Saltar al contenido
Injoys
Datos de IA

Revisión de precios y velocidad de OpenAI GPT-5.6 y estrategia de selección de modelos

Desde el 30 de julio de 2026, OpenAI redujo los precios de la API de GPT-5.6 Luna y Terra en un 80% y un 20%, respectivamente, e introdujo Fast mode en Sol. Esta revisión se centra en una estrategia que reduce el coste por resultado asignando modelos según las fases de planificación, ejecución y verificación, en lugar de utilizar el modelo más avanzado para todas las tareas.

Vistas 12 15 min de lectura KO EN JA ES

Escucha o lee este artículo

Escúchalo o lee solo el texto.

Revisión de precios y velocidad de OpenAI GPT-5.6 y estrategia de selección de modelos

Supertonic 3 Voz generada por IA

0:00 24:50

Descargar audio

Nombre de archivo
openai-gpt-5-6-price-performance-model-routing-es.mp3
Formato
MP3 (audio/mpeg)
Duración
24:50
Tamaño
17 MB
Motor
Supertonic 3

Este audio fue generado por IA. Puedes descargarlo y usarlo libremente para uso personal.

Revisión de precios y velocidad de OpenAI GPT-5.6 y estrategia de selección de modelos

16 min de lectura

Revisión de precios y velocidad de OpenAI GPT-5.6 y estrategia de selección de modelos
Desde el 30 de julio de 2026, OpenAI redujo los precios de la API de GPT-5.6 Luna y Terra en un 80% y un 20%, respectivamente, e introdujo Fast mode en Sol. Esta revisión se centra en una estrategia que reduce el coste por resultado asignando modelos según las fases de planificación, ejecución y verificación, en lugar de utilizar el modelo más avanzado para todas las tareas.
El precio de la API de GPT-5.6 Luna se redujo a 0.20 dólares por millón de tokens de entrada y a 1.20 dólares por millón de tokens de salida.
El precio de la API de GPT-5.6 Terra se redujo a 2 dólares por millón de tokens de entrada y a 12 dólares por millón de tokens de salida.
Según el anuncio, el Fast mode de GPT-5.6 Sol es hasta 2.5 veces más rápido que el procesamiento Standard, cuesta el doble y mantiene el nivel de inteligencia del modelo.
Las empresas pueden aplicar una configuración por niveles en la que Sol se encargue de las decisiones y la planificación complejas, mientras Luna o Terra gestionan la ejecución repetitiva y la verificación.
OpenAI explica que la optimización conjunta del modelo, la infraestructura de inferencia y el arnés de agentes hizo posibles la reducción de precios y la mejora del rendimiento.
OpenAI ha vinculado las mejoras en la eficiencia de ejecución de la familia GPT-5.6 con una reducción de los precios de la API y una mayor velocidad de procesamiento. La clave no consiste en aplicar el modelo más potente a todas las tareas, sino en combinar Sol, Terra y Luna según el nivel de riesgo, la complejidad, la latencia y la posibilidad de verificación de cada tarea para reducir el coste por resultado.
Las cifras de precios y rendimiento se basan en la información anunciada por OpenAI el 30 de julio de 2026. Los benchmarks de clientes y las cifras de mejora de eficiencia son resultados medidos por OpenAI o por las empresas citadas en el anuncio, por lo que no puede asumirse que se reproduzcan de forma idéntica en todos los entornos.
Cambios en los precios de la API del 30 de julio de 2026
Los nuevos precios de la API de GPT-5.6 Luna y Terra son los siguientes.
Modelo | 1 millón de tokens de entrada | 1 millón de tokens de salida | Reducción | Función principal GPT-5.6 Luna | 0.20 dólares | 1.20 dólares | 80% | Procesamiento masivo, tareas repetitivas y trabajos de ejecución claramente definidos GPT-5.6 Terra | 2 dólares | 12 dólares | 20% | Trabajo cotidiano que requiere equilibrio entre calidad, coste y velocidad GPT-5.6 Sol | Sin cambios en el anuncio | Sin cambios en el anuncio | Ninguna | Razonamiento complejo, planificación y decisiones importantes
Los precios de las suscripciones de pago de ChatGPT y Codex, así como el presupuesto total de las cuotas, no cambian con este anuncio. Sin embargo, se reducen los créditos descontados al utilizar Terra y Luna. OpenAI indicó que los cambios de precios a través de AWS se aplicarían gradualmente desde más tarde el 30 de julio.
Ejemplo de cálculo del coste de la API
El coste de los tokens puede calcularse de la siguiente manera.
Coste total = número de tokens de entrada ÷ 1,000,000 × precio de entrada + número de tokens de salida ÷ 1,000,000 × precio de salida
Por ejemplo, si se procesan 10 millones de tokens de entrada y 2 millones de tokens de salida, el coste basado únicamente en el precio por token sería el siguiente.
Modelo | Coste de entrada | Coste de salida | Total Luna | 2 dólares | 2.40 dólares | 4.40 dólares Terra | 20 dólares | 24 dólares | 44 dólares
El importe real facturado puede verse afectado por condiciones específicas del servicio, como la aplicación de caché, el método de procesamiento elegido y la estructura de las llamadas a herramientas.
Funciones de la familia GPT-5.6
GPT-5.6 no es un único modelo, sino una familia jerárquica de productos con distintos costes y niveles de rendimiento.
GPT-5.6 Sol
Sol se encarga del razonamiento de más alto nivel y de la resolución de problemas complejos. Es adecuado para aclarar requisitos ambiguos, tomar decisiones cuyo coste de fracaso sea elevado, elaborar planes a largo plazo y revisar resultados importantes.
GPT-5.6 Terra
Terra busca equilibrar rendimiento, coste y velocidad de respuesta. Es adecuado para tareas que requieren una mayor capacidad de juicio que Luna, pero que no necesitan utilizar siempre Sol, como las consultas y respuestas internas de una organización, las tareas de agentes con un alcance definido y los trabajos generales de análisis y programación.
GPT-5.6 Luna
Luna es el nivel más rápido y económico. Además de generar frases breves y sencillas, admite llamadas a herramientas y flujos de trabajo de varias etapas, por lo que puede utilizarse como modelo de ejecución para repetir a gran escala tareas claramente definidas.
Entre sus aplicaciones representativas se encuentran las siguientes.
· Clasificación masiva de documentos y consultas de clientes · Extracción de datos estructurados · Modificaciones repetitivas de código · Creación y ejecución de pruebas · Generación de documentos con reglas claras · Revisión de contenido a gran escala · Automatización de agentes en segundo plano · Asistencia repetitiva en investigación
OpenAI afirma que Luna ofrece un nivel de rendimiento similar al de un modelo considerado de vanguardia hace 1 año, con aproximadamente el 6% del coste estimado por tarea y casi 9 veces más velocidad. En este caso, el 6% no es una comparación directa de los precios por token, sino una comparación del coste estimado necesario para obtener el mismo resultado en una tarea.
Características del Fast mode de Sol
GPT-5.6 Sol ha incorporado Fast mode para la API. Este sustituye al anterior Priority Processing y corresponde al concepto de la función /fast de Codex.
Elemento | Fast mode Velocidad | Hasta 2.5 veces más rápido que el procesamiento Standard Inteligencia del modelo | Igual que Standard según el anuncio de OpenAI Precio | El doble del precio del procesamiento Standard Compatibilidad anterior | Procesamiento automático en Fast mode de las solicitudes con la etiqueta priority
La expresión «hasta 2.5 veces más rápido» de Fast mode no garantiza que la latencia de todas las solicitudes se reduzca exactamente en la misma proporción. La velocidad percibida puede variar según la longitud del prompt, la longitud de la salida, la carga del servicio y el número de llamadas a herramientas.
Casos adecuados para Fast mode
· Servicios en tiempo real en los que el usuario espera una respuesta · Entornos de desarrollo que repiten rápidamente modificaciones y comprobaciones de código · Tareas en las que las llamadas a Sol determinan la latencia de todo el agente · Situaciones en las que incluso unos minutos de retraso son importantes, como la respuesta a incidentes o el análisis de fallos · Trabajos en los que el coste causado por el retraso del procesamiento supera el coste adicional de la API
El procesamiento Standard puede ser más económico para tareas cuya finalización no sea urgente, como lotes en segundo plano, análisis nocturnos y procesamiento asíncrono.
Criterios de selección de modelos centrados en resultados
Seleccionar un modelo no consiste en elegir el que ocupa la posición más alta en una clasificación. Para cada tarea deben examinarse las siguientes preguntas.
Factor de decisión | Pregunta que debe comprobarse Impacto del fracaso | ¿Cómo afecta un error a los clientes, los ingresos, la seguridad o el cumplimiento normativo? Tolerancia a errores | ¿Puede una persona revisar los errores o pueden detectarse mediante reglas automáticas? Latencia | ¿El usuario espera en tiempo real o puede procesarse de forma asíncrona? Volumen de procesamiento | ¿Cuántos casos deben procesarse al día o al mes? Claridad del problema | ¿Están suficientemente definidos la entrada, las reglas y la salida esperada? Valor del razonamiento | ¿Un razonamiento más potente mejora significativamente la calidad real de los resultados? Posibilidad de verificación | ¿Puede evaluarse el resultado mediante pruebas, esquemas o comprobaciones cruzadas?
Es muy probable que las tareas claras y susceptibles de verificación automática sean adecuadas para Luna. Si se necesita cierta capacidad de juicio, puede considerarse Terra. Sol es adecuado para resolver ambigüedades, tomar decisiones de alto riesgo o realizar la revisión final de las consecuencias de un fallo.
Estructura de planificación con Sol y ejecución con Luna
Incluso dentro de la tarea de un único agente pueden asignarse modelos diferentes a cada etapa. Por ejemplo, un agente de programación puede configurarse de la siguiente manera.
· Sol identifica las ambigüedades de los requisitos y organiza las preguntas. · Sol determina el plan de implementación, el alcance de los cambios y los factores de riesgo. · Luna implementa en código los cambios ya aclarados. · Luna crea y ejecuta las pruebas. · Luna o Terra evalúa los resultados de las pruebas y las diferencias en el código. · Sol vuelve a revisar únicamente las conclusiones importantes o con una alta probabilidad de fallo.
Esta estructura permite reducir los costes en comparación con el uso de Sol en todas las etapas y concentrar una gran capacidad de razonamiento en las decisiones importantes. Sin embargo, al dividir los modelos, deben diseñarse por separado las reglas de enrutamiento, la gestión de errores, el seguimiento de registros y el sistema de evaluación.
Tres niveles de eficiencia que respaldan la reducción de precios
OpenAI explica que la reducción de costes no procede simplemente de una política de precios, sino de mejoras técnicas en tres niveles.
· Eficiencia de tokens del propio modelo · Eficiencia del hardware del sistema de inferencia · Eficiencia del arnés de agentes que conecta modelos, herramientas y contexto
Esta explicación se basa en la documentación técnica publicada por OpenAI, y la estructura detallada de todos los costes no se ha hecho pública. Por tanto, desde el exterior resulta difícil determinar en qué medida contribuyeron respectivamente la eficiencia técnica y la política estratégica de precios a la reducción.
Optimización del modelo y del sistema de inferencia
Mejora del volumen de trabajo por token
Según OpenAI, GPT-5.6 se entrenó para optimizar tanto la tasa de éxito de las tareas como la eficiencia de procesamiento. Esto significa que fue diseñado para reducir razonamientos innecesariamente largos o repetitivos y llegar a los resultados necesarios con menos tokens, aumentando así la inteligencia y el volumen de trabajo por token.
Distribución de carga y enrutamiento de solicitudes
El sistema de inferencia distribuye las solicitudes entre centros de datos y clústeres según la región, la capacidad disponible y el tipo de acelerador. Dentro de cada clúster, selecciona una instancia del modelo teniendo en cuenta la carga actual, la longitud del contexto de entrada, la posibilidad de utilizar caché y las características de la solicitud, entre otros factores.
OpenAI indicó que utilizó GPT-5.6 Sol y Codex para analizar el tráfico de producción, investigar las causas de desequilibrios de carga, probar estrategias de enrutamiento y ajustar heurísticas.
Optimización de kernels de GPU
Los kernels de GPU son el código esencial que ejecuta en el hardware las operaciones matemáticas del modelo. El coste de procesamiento puede variar incluso en la misma GPU según el movimiento de memoria, la sincronización, la disposición de los datos y el método de paralelización.
Según OpenAI, GPT-5.6 Sol participó en la creación y optimización de kernels de producción utilizando Triton y Gluon en el entorno de Codex. La empresa afirmó que la combinación de las mejoras de los kernels y las optimizaciones relacionadas redujo en un 20% el coste integral de la prestación del modelo.
El coste integral no se refiere a una sola operación específica, sino al coste total del procesamiento real de una solicitud, incluido el enrutamiento, el movimiento de datos, la ejecución del modelo y la generación de la salida.
Verificación de la exactitud de los kernels
Incluso un kernel rápido no puede utilizarse si produce resultados numéricamente incorrectos. OpenAI explicó que invirtió en herramientas de verificación, incluido FpSan, para comprobar la exactitud de los kernels escritos por IA. FpSan es la abreviatura de Floating-Point Sanitizer, una herramienta de código abierto que detecta errores relacionados con operaciones de coma flotante.
Esto demuestra que, cuando la IA genera código de infraestructura de producción, se necesitan no solo benchmarks de rendimiento, sino también verificación numérica, pruebas de regresión y procedimientos de recuperación en caso de fallo.
Decodificación especulativa y caché KV
Decodificación especulativa
La decodificación especulativa es un método en el que un pequeño modelo de borrador propone primero los tokens que se generarán a continuación y el modelo principal de mayor tamaño verifica varios candidatos en paralelo. Si se aceptan las propuestas, puede reducirse el número de costosos cálculos secuenciales del modelo principal.
OpenAI indicó que GPT-5.6 Sol diseñó y ejecutó cientos de experimentos que modificaban el tamaño y la estructura del modelo de borrador, además de supervisar el entrenamiento. Según su explicación, esto mejoró la eficiencia de generación de tokens en al menos un 15%.
Caché KV y configuración por carga de trabajo
Mientras procesa la entrada, el modelo crea una caché Key-Value, es decir, una caché KV. La configuración óptima varía según la longitud de la entrada y la salida, el tamaño del lote, la tasa de aciertos de caché, el número de solicitudes simultáneas, la capacidad de memoria y el método de fragmentación del modelo.
OpenAI explica que analizó cargas de trabajo reales con Sol y Codex, evaluó configuraciones candidatas y ajustó con precisión la configuración del motor para cada tipo de tarea. El objetivo es procesar más solicitudes con el mismo hardware.
Arnés de agentes y coste del contexto
Un agente llama varias veces al modelo y a las herramientas para resolver una sola solicitud del usuario. Si una tarea que requiere 30 llamadas al modelo sufre 1 segundo de retraso innecesario en cada llamada, la latencia total puede aumentar aproximadamente 30 segundos.
OpenAI describe como arnés de agentes una capa de orquestación basada en Rust que conecta el modelo, las herramientas y el entorno del usuario.
Exposición diferida únicamente de las herramientas necesarias
Si desde el principio se incluye en el prompt toda la información sobre herramientas, complementos, habilidades e integraciones MCP, aumentan los tokens de entrada y la latencia. El arnés utiliza un método de exploración diferida que expone la información sobre las herramientas relevantes únicamente cuando es necesaria. OpenAI indicó que, de forma predeterminada, la salida de las herramientas está limitada a 10,000 tokens, salvo que el modelo solicite un límite distinto.
Conservación exacta del prefijo y caché de prompts
La caché de prompts reduce los cálculos duplicados reutilizando el mismo fragmento inicial de una entrada procesada anteriormente. Para reutilizar la caché, el prefijo del prompt debe coincidir exactamente.
El arnés de OpenAI gestiona el historial mediante una estructura de solo adición y añade al final los mensajes nuevos y los resultados de las herramientas. Las herramientas se presentan en un orden determinista, mientras que los ajustes de ejecución, como las políticas de aprobación, se aplican durante el tiempo de ejecución sin modificar las propias definiciones de las herramientas. Este método facilita el aumento de la tasa de aciertos de caché en los ciclos repetitivos de los agentes.
Cómo interpretar las cifras de casos empresariales
El anuncio oficial de OpenAI incluyó evaluaciones de Replit, Notion, Ramp, Blitzy, Cognition y Dust, entre otras empresas.
· Notion indicó que, en su propia evaluación, Terra ofreció una calidad similar a GPT-5.5 con la mitad del coste por tarea y un 60% menos de tiempo. · Blitzy explicó que, tras adoptar Luna, la tasa de reutilización de la caché de prompts aumentó del 24% al 90%, mientras que el coste fue un 87% inferior al del anterior modelo predeterminado. · Dust indicó que, en las mismas tareas de agentes, Luna fue un 40% más rápido y un 40% más económico que el anterior modelo predeterminado. · Ramp indicó que utiliza Luna como modelo predeterminado para la automatización de agentes en segundo plano.
Estas cifras corresponden a casos medidos con las tareas internas, los prompts, los criterios de evaluación y las estructuras de sistemas de cada empresa. No son un benchmark común e independiente, por lo que no deben aplicarse directamente al trabajo de otras organizaciones. Antes de la adopción, es necesaria una evaluación propia que refleje los datos reales y el coste de los errores.
Lista de verificación previa a la adopción
· Preparar una muestra representativa de tareas y las respuestas correctas o los criterios de evaluación. · Comparar en las mismas condiciones la tasa de éxito y la tasa de reintentos de Luna, Terra y Sol. · Incluir no solo el coste de los tokens, sino también las llamadas a herramientas, el personal de revisión y el coste de recuperación ante fallos. · Medir, además de la latencia media, la latencia del percentil 95 o 99. · Clasificar como candidatos para modelos económicos los pasos que puedan verificarse mediante pruebas automáticas o validación de esquemas. · Aplicar políticas independientes de aprobación y registro a las tareas relacionadas con datos personales, seguridad y normativas. · Definir criterios de enrutamiento para escalar a Terra o Sol los resultados de baja confianza. · Verificar con tráfico real si el valor de la reducción de latencia supera el coste adicional de Fast mode.
Significado y limitaciones
Esta reorganización demuestra que el criterio de la competencia entre modelos de IA está pasando de una única puntuación máxima al coste por resultado. Al asignar Luna a las tareas repetitivas a gran escala, Terra al trabajo cotidiano basado en conocimiento y Sol a las decisiones ambiguas e importantes, pueden combinarse inteligencia, velocidad y coste según cada trabajo.
Sin embargo, con la información pública resulta difícil separar en qué medida la reducción de precios del 80% procede de mejoras en la eficiencia técnica y en qué medida de una estrategia de mercado. Además, la rentabilidad de los modelos económicos no se determina únicamente por el precio de los tokens. Si una tasa de errores elevada aumenta los reintentos y las revisiones humanas, el coste total del trabajo puede subir.
Por tanto, la métrica clave no es el precio de una llamada al modelo, sino el coste total de producir un resultado que supere la verificación. Para determinar si la reducción de precios de GPT-5.6 se traduce en valor empresarial real, deben medirse conjuntamente la tasa de éxito de cada modelo, el número de reintentos, la latencia y el coste de revisión.
0:00 0:00
1 / 87

Descargar texto

Nombre de archivo
openai-gpt-5-6-price-performance-model-routing-es.txt
Formato
TXT (text/plain)
Párrafos
87

Descarga exactamente lo que ves como archivo de texto. Cita la fuente al reproducirlo.

El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.

Puntos clave

  • El precio de la API de GPT-5.6 Luna se redujo a 0.20 dólares por millón de tokens de entrada y a 1.20 dólares por millón de tokens de salida.
  • El precio de la API de GPT-5.6 Terra se redujo a 2 dólares por millón de tokens de entrada y a 12 dólares por millón de tokens de salida.
  • Según el anuncio, el Fast mode de GPT-5.6 Sol es hasta 2.5 veces más rápido que el procesamiento Standard, cuesta el doble y mantiene el nivel de inteligencia del modelo.
  • Las empresas pueden aplicar una configuración por niveles en la que Sol se encargue de las decisiones y la planificación complejas, mientras Luna o Terra gestionan la ejecución repetitiva y la verificación.
  • OpenAI explica que la optimización conjunta del modelo, la infraestructura de inferencia y el arnés de agentes hizo posibles la reducción de precios y la mejora del rendimiento.

OpenAI ha vinculado las mejoras en la eficiencia de ejecución de la familia GPT-5.6 con una reducción de los precios de la API y una mayor velocidad de procesamiento. La clave no consiste en aplicar el modelo más potente a todas las tareas, sino en combinar Sol, Terra y Luna según el nivel de riesgo, la complejidad, la latencia y la posibilidad de verificación de cada tarea para reducir el coste por resultado.

Las cifras de precios y rendimiento se basan en la información anunciada por OpenAI el 30 de julio de 2026. Los benchmarks de clientes y las cifras de mejora de eficiencia son resultados medidos por OpenAI o por las empresas citadas en el anuncio, por lo que no puede asumirse que se reproduzcan de forma idéntica en todos los entornos.

Cambios en los precios de la API del 30 de julio de 2026

Los nuevos precios de la API de GPT-5.6 Luna y Terra son los siguientes.

Modelo 1 millón de tokens de entrada 1 millón de tokens de salida Reducción Función principal
GPT-5.6 Luna 0.20 dólares 1.20 dólares 80% Procesamiento masivo, tareas repetitivas y trabajos de ejecución claramente definidos
GPT-5.6 Terra 2 dólares 12 dólares 20% Trabajo cotidiano que requiere equilibrio entre calidad, coste y velocidad
GPT-5.6 Sol Sin cambios en el anuncio Sin cambios en el anuncio Ninguna Razonamiento complejo, planificación y decisiones importantes

Los precios de las suscripciones de pago de ChatGPT y Codex, así como el presupuesto total de las cuotas, no cambian con este anuncio. Sin embargo, se reducen los créditos descontados al utilizar Terra y Luna. OpenAI indicó que los cambios de precios a través de AWS se aplicarían gradualmente desde más tarde el 30 de julio.

Ejemplo de cálculo del coste de la API

El coste de los tokens puede calcularse de la siguiente manera.

Coste total = número de tokens de entrada ÷ 1,000,000 × precio de entrada + número de tokens de salida ÷ 1,000,000 × precio de salida

Por ejemplo, si se procesan 10 millones de tokens de entrada y 2 millones de tokens de salida, el coste basado únicamente en el precio por token sería el siguiente.

Modelo Coste de entrada Coste de salida Total
Luna 2 dólares 2.40 dólares 4.40 dólares
Terra 20 dólares 24 dólares 44 dólares

El importe real facturado puede verse afectado por condiciones específicas del servicio, como la aplicación de caché, el método de procesamiento elegido y la estructura de las llamadas a herramientas.

Funciones de la familia GPT-5.6

GPT-5.6 no es un único modelo, sino una familia jerárquica de productos con distintos costes y niveles de rendimiento.

GPT-5.6 Sol

Sol se encarga del razonamiento de más alto nivel y de la resolución de problemas complejos. Es adecuado para aclarar requisitos ambiguos, tomar decisiones cuyo coste de fracaso sea elevado, elaborar planes a largo plazo y revisar resultados importantes.

GPT-5.6 Terra

Terra busca equilibrar rendimiento, coste y velocidad de respuesta. Es adecuado para tareas que requieren una mayor capacidad de juicio que Luna, pero que no necesitan utilizar siempre Sol, como las consultas y respuestas internas de una organización, las tareas de agentes con un alcance definido y los trabajos generales de análisis y programación.

GPT-5.6 Luna

Luna es el nivel más rápido y económico. Además de generar frases breves y sencillas, admite llamadas a herramientas y flujos de trabajo de varias etapas, por lo que puede utilizarse como modelo de ejecución para repetir a gran escala tareas claramente definidas.

Entre sus aplicaciones representativas se encuentran las siguientes.

  • Clasificación masiva de documentos y consultas de clientes
  • Extracción de datos estructurados
  • Modificaciones repetitivas de código
  • Creación y ejecución de pruebas
  • Generación de documentos con reglas claras
  • Revisión de contenido a gran escala
  • Automatización de agentes en segundo plano
  • Asistencia repetitiva en investigación

OpenAI afirma que Luna ofrece un nivel de rendimiento similar al de un modelo considerado de vanguardia hace 1 año, con aproximadamente el 6% del coste estimado por tarea y casi 9 veces más velocidad. En este caso, el 6% no es una comparación directa de los precios por token, sino una comparación del coste estimado necesario para obtener el mismo resultado en una tarea.

Características del Fast mode de Sol

GPT-5.6 Sol ha incorporado Fast mode para la API. Este sustituye al anterior Priority Processing y corresponde al concepto de la función /fast de Codex.

Elemento Fast mode
Velocidad Hasta 2.5 veces más rápido que el procesamiento Standard
Inteligencia del modelo Igual que Standard según el anuncio de OpenAI
Precio El doble del precio del procesamiento Standard
Compatibilidad anterior Procesamiento automático en Fast mode de las solicitudes con la etiqueta priority

La expresión «hasta 2.5 veces más rápido» de Fast mode no garantiza que la latencia de todas las solicitudes se reduzca exactamente en la misma proporción. La velocidad percibida puede variar según la longitud del prompt, la longitud de la salida, la carga del servicio y el número de llamadas a herramientas.

Casos adecuados para Fast mode

  • Servicios en tiempo real en los que el usuario espera una respuesta
  • Entornos de desarrollo que repiten rápidamente modificaciones y comprobaciones de código
  • Tareas en las que las llamadas a Sol determinan la latencia de todo el agente
  • Situaciones en las que incluso unos minutos de retraso son importantes, como la respuesta a incidentes o el análisis de fallos
  • Trabajos en los que el coste causado por el retraso del procesamiento supera el coste adicional de la API

El procesamiento Standard puede ser más económico para tareas cuya finalización no sea urgente, como lotes en segundo plano, análisis nocturnos y procesamiento asíncrono.

Criterios de selección de modelos centrados en resultados

Seleccionar un modelo no consiste en elegir el que ocupa la posición más alta en una clasificación. Para cada tarea deben examinarse las siguientes preguntas.

Factor de decisión Pregunta que debe comprobarse
Impacto del fracaso ¿Cómo afecta un error a los clientes, los ingresos, la seguridad o el cumplimiento normativo?
Tolerancia a errores ¿Puede una persona revisar los errores o pueden detectarse mediante reglas automáticas?
Latencia ¿El usuario espera en tiempo real o puede procesarse de forma asíncrona?
Volumen de procesamiento ¿Cuántos casos deben procesarse al día o al mes?
Claridad del problema ¿Están suficientemente definidos la entrada, las reglas y la salida esperada?
Valor del razonamiento ¿Un razonamiento más potente mejora significativamente la calidad real de los resultados?
Posibilidad de verificación ¿Puede evaluarse el resultado mediante pruebas, esquemas o comprobaciones cruzadas?

Es muy probable que las tareas claras y susceptibles de verificación automática sean adecuadas para Luna. Si se necesita cierta capacidad de juicio, puede considerarse Terra. Sol es adecuado para resolver ambigüedades, tomar decisiones de alto riesgo o realizar la revisión final de las consecuencias de un fallo.

Estructura de planificación con Sol y ejecución con Luna

Incluso dentro de la tarea de un único agente pueden asignarse modelos diferentes a cada etapa. Por ejemplo, un agente de programación puede configurarse de la siguiente manera.

  1. Sol identifica las ambigüedades de los requisitos y organiza las preguntas.
  2. Sol determina el plan de implementación, el alcance de los cambios y los factores de riesgo.
  3. Luna implementa en código los cambios ya aclarados.
  4. Luna crea y ejecuta las pruebas.
  5. Luna o Terra evalúa los resultados de las pruebas y las diferencias en el código.
  6. Sol vuelve a revisar únicamente las conclusiones importantes o con una alta probabilidad de fallo.

Esta estructura permite reducir los costes en comparación con el uso de Sol en todas las etapas y concentrar una gran capacidad de razonamiento en las decisiones importantes. Sin embargo, al dividir los modelos, deben diseñarse por separado las reglas de enrutamiento, la gestión de errores, el seguimiento de registros y el sistema de evaluación.

Tres niveles de eficiencia que respaldan la reducción de precios

OpenAI explica que la reducción de costes no procede simplemente de una política de precios, sino de mejoras técnicas en tres niveles.

  1. Eficiencia de tokens del propio modelo
  2. Eficiencia del hardware del sistema de inferencia
  3. Eficiencia del arnés de agentes que conecta modelos, herramientas y contexto

Esta explicación se basa en la documentación técnica publicada por OpenAI, y la estructura detallada de todos los costes no se ha hecho pública. Por tanto, desde el exterior resulta difícil determinar en qué medida contribuyeron respectivamente la eficiencia técnica y la política estratégica de precios a la reducción.

Optimización del modelo y del sistema de inferencia

Mejora del volumen de trabajo por token

Según OpenAI, GPT-5.6 se entrenó para optimizar tanto la tasa de éxito de las tareas como la eficiencia de procesamiento. Esto significa que fue diseñado para reducir razonamientos innecesariamente largos o repetitivos y llegar a los resultados necesarios con menos tokens, aumentando así la inteligencia y el volumen de trabajo por token.

Distribución de carga y enrutamiento de solicitudes

El sistema de inferencia distribuye las solicitudes entre centros de datos y clústeres según la región, la capacidad disponible y el tipo de acelerador. Dentro de cada clúster, selecciona una instancia del modelo teniendo en cuenta la carga actual, la longitud del contexto de entrada, la posibilidad de utilizar caché y las características de la solicitud, entre otros factores.

OpenAI indicó que utilizó GPT-5.6 Sol y Codex para analizar el tráfico de producción, investigar las causas de desequilibrios de carga, probar estrategias de enrutamiento y ajustar heurísticas.

Optimización de kernels de GPU

Los kernels de GPU son el código esencial que ejecuta en el hardware las operaciones matemáticas del modelo. El coste de procesamiento puede variar incluso en la misma GPU según el movimiento de memoria, la sincronización, la disposición de los datos y el método de paralelización.

Según OpenAI, GPT-5.6 Sol participó en la creación y optimización de kernels de producción utilizando Triton y Gluon en el entorno de Codex. La empresa afirmó que la combinación de las mejoras de los kernels y las optimizaciones relacionadas redujo en un 20% el coste integral de la prestación del modelo.

El coste integral no se refiere a una sola operación específica, sino al coste total del procesamiento real de una solicitud, incluido el enrutamiento, el movimiento de datos, la ejecución del modelo y la generación de la salida.

Verificación de la exactitud de los kernels

Incluso un kernel rápido no puede utilizarse si produce resultados numéricamente incorrectos. OpenAI explicó que invirtió en herramientas de verificación, incluido FpSan, para comprobar la exactitud de los kernels escritos por IA. FpSan es la abreviatura de Floating-Point Sanitizer, una herramienta de código abierto que detecta errores relacionados con operaciones de coma flotante.

Esto demuestra que, cuando la IA genera código de infraestructura de producción, se necesitan no solo benchmarks de rendimiento, sino también verificación numérica, pruebas de regresión y procedimientos de recuperación en caso de fallo.

Decodificación especulativa y caché KV

Decodificación especulativa

La decodificación especulativa es un método en el que un pequeño modelo de borrador propone primero los tokens que se generarán a continuación y el modelo principal de mayor tamaño verifica varios candidatos en paralelo. Si se aceptan las propuestas, puede reducirse el número de costosos cálculos secuenciales del modelo principal.

OpenAI indicó que GPT-5.6 Sol diseñó y ejecutó cientos de experimentos que modificaban el tamaño y la estructura del modelo de borrador, además de supervisar el entrenamiento. Según su explicación, esto mejoró la eficiencia de generación de tokens en al menos un 15%.

Caché KV y configuración por carga de trabajo

Mientras procesa la entrada, el modelo crea una caché Key-Value, es decir, una caché KV. La configuración óptima varía según la longitud de la entrada y la salida, el tamaño del lote, la tasa de aciertos de caché, el número de solicitudes simultáneas, la capacidad de memoria y el método de fragmentación del modelo.

OpenAI explica que analizó cargas de trabajo reales con Sol y Codex, evaluó configuraciones candidatas y ajustó con precisión la configuración del motor para cada tipo de tarea. El objetivo es procesar más solicitudes con el mismo hardware.

Arnés de agentes y coste del contexto

Un agente llama varias veces al modelo y a las herramientas para resolver una sola solicitud del usuario. Si una tarea que requiere 30 llamadas al modelo sufre 1 segundo de retraso innecesario en cada llamada, la latencia total puede aumentar aproximadamente 30 segundos.

OpenAI describe como arnés de agentes una capa de orquestación basada en Rust que conecta el modelo, las herramientas y el entorno del usuario.

Exposición diferida únicamente de las herramientas necesarias

Si desde el principio se incluye en el prompt toda la información sobre herramientas, complementos, habilidades e integraciones MCP, aumentan los tokens de entrada y la latencia. El arnés utiliza un método de exploración diferida que expone la información sobre las herramientas relevantes únicamente cuando es necesaria. OpenAI indicó que, de forma predeterminada, la salida de las herramientas está limitada a 10,000 tokens, salvo que el modelo solicite un límite distinto.

Conservación exacta del prefijo y caché de prompts

La caché de prompts reduce los cálculos duplicados reutilizando el mismo fragmento inicial de una entrada procesada anteriormente. Para reutilizar la caché, el prefijo del prompt debe coincidir exactamente.

El arnés de OpenAI gestiona el historial mediante una estructura de solo adición y añade al final los mensajes nuevos y los resultados de las herramientas. Las herramientas se presentan en un orden determinista, mientras que los ajustes de ejecución, como las políticas de aprobación, se aplican durante el tiempo de ejecución sin modificar las propias definiciones de las herramientas. Este método facilita el aumento de la tasa de aciertos de caché en los ciclos repetitivos de los agentes.

Cómo interpretar las cifras de casos empresariales

El anuncio oficial de OpenAI incluyó evaluaciones de Replit, Notion, Ramp, Blitzy, Cognition y Dust, entre otras empresas.

  • Notion indicó que, en su propia evaluación, Terra ofreció una calidad similar a GPT-5.5 con la mitad del coste por tarea y un 60% menos de tiempo.
  • Blitzy explicó que, tras adoptar Luna, la tasa de reutilización de la caché de prompts aumentó del 24% al 90%, mientras que el coste fue un 87% inferior al del anterior modelo predeterminado.
  • Dust indicó que, en las mismas tareas de agentes, Luna fue un 40% más rápido y un 40% más económico que el anterior modelo predeterminado.
  • Ramp indicó que utiliza Luna como modelo predeterminado para la automatización de agentes en segundo plano.

Estas cifras corresponden a casos medidos con las tareas internas, los prompts, los criterios de evaluación y las estructuras de sistemas de cada empresa. No son un benchmark común e independiente, por lo que no deben aplicarse directamente al trabajo de otras organizaciones. Antes de la adopción, es necesaria una evaluación propia que refleje los datos reales y el coste de los errores.

Lista de verificación previa a la adopción

  1. Preparar una muestra representativa de tareas y las respuestas correctas o los criterios de evaluación.
  2. Comparar en las mismas condiciones la tasa de éxito y la tasa de reintentos de Luna, Terra y Sol.
  3. Incluir no solo el coste de los tokens, sino también las llamadas a herramientas, el personal de revisión y el coste de recuperación ante fallos.
  4. Medir, además de la latencia media, la latencia del percentil 95 o 99.
  5. Clasificar como candidatos para modelos económicos los pasos que puedan verificarse mediante pruebas automáticas o validación de esquemas.
  6. Aplicar políticas independientes de aprobación y registro a las tareas relacionadas con datos personales, seguridad y normativas.
  7. Definir criterios de enrutamiento para escalar a Terra o Sol los resultados de baja confianza.
  8. Verificar con tráfico real si el valor de la reducción de latencia supera el coste adicional de Fast mode.

Significado y limitaciones

Esta reorganización demuestra que el criterio de la competencia entre modelos de IA está pasando de una única puntuación máxima al coste por resultado. Al asignar Luna a las tareas repetitivas a gran escala, Terra al trabajo cotidiano basado en conocimiento y Sol a las decisiones ambiguas e importantes, pueden combinarse inteligencia, velocidad y coste según cada trabajo.

Sin embargo, con la información pública resulta difícil separar en qué medida la reducción de precios del 80% procede de mejoras en la eficiencia técnica y en qué medida de una estrategia de mercado. Además, la rentabilidad de los modelos económicos no se determina únicamente por el precio de los tokens. Si una tasa de errores elevada aumenta los reintentos y las revisiones humanas, el coste total del trabajo puede subir.

Por tanto, la métrica clave no es el precio de una llamada al modelo, sino el coste total de producir un resultado que supere la verificación. Para determinar si la reducción de precios de GPT-5.6 se traduce en valor empresarial real, deben medirse conjuntamente la tasa de éxito de cada modelo, el número de reintentos, la latencia y el coste de revisión.

Imágenes

El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.
Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.

Preguntas frecuentes

¿Cuál es el nuevo precio de la API de GPT-5.6 Luna?

A fecha del 30 de julio de 2026, Luna cuesta 0.20 dólares por cada millón de tokens de entrada y 1.20 dólares por cada millón de tokens de salida. La reducción respecto al precio anterior anunciada por OpenAI es del 80%.

¿Cuál es el nuevo precio de la API de GPT-5.6 Terra?

Terra cuesta 2 dólares por cada millón de tokens de entrada y 12 dólares por cada millón de tokens de salida. La reducción de precio anunciada por OpenAI es del 20%.

¿También se ha reducido el precio de GPT-5.6 Sol?

No. En este anuncio de OpenAI, el precio del procesamiento Standard de Sol no ha cambiado. En su lugar, se ha añadido Fast mode, que es hasta 2.5 veces más rápido que Standard y cuesta el doble.

¿Disminuye la calidad de las respuestas del modelo al utilizar Fast mode?

OpenAI explica que Fast mode aumenta la velocidad de procesamiento sin reducir el nivel de inteligencia de Sol. Sin embargo, la velocidad de hasta 2.5 veces es un límite máximo, y la latencia real puede variar según la longitud de la solicitud, el volumen de salida, las llamadas a herramientas y la carga del sistema.

¿Es necesario modificar las solicitudes existentes de Priority Processing?

Según el anuncio de OpenAI, la etiqueta `priority` de las solicitudes existentes de la API seguirá funcionando y se vinculará automáticamente al procesamiento de Fast mode. En un entorno de producción, es recomendable comprobar por separado la fecha de aplicación y los cargos reales.

¿Para qué tareas es adecuado utilizar Luna?

Es adecuado para tareas masivas y repetitivas con reglas y resultados esperados claros que puedan verificarse automáticamente. Algunos ejemplos representativos son la clasificación de documentos, la extracción de datos, las modificaciones repetitivas de código, la ejecución de pruebas, la revisión de contenido y la automatización en segundo plano.

¿Qué modelo debería elegir entre Terra y Luna?

Si se priorizan el bajo coste y el alto rendimiento, y la tarea está claramente definida, puede evaluarse primero Luna. Si se necesita una mayor comprensión del contexto y capacidad de juicio, pero no un razonamiento avanzado al nivel de Sol, Terra puede ser adecuado.

¿No se puede utilizar Sol en todas las etapas de los agentes?

Se puede, pero podría reducirse la eficiencia de costes. Si Sol se encarga de la planificación y de las decisiones de alto riesgo, mientras que Luna o Terra gestionan la ejecución y las pruebas claramente definidas, es posible reducir el coste total manteniendo la calidad de las etapas importantes.

¿El coste por tarea del 6% de Luna es una comparación de precios por token?

No. El aproximadamente 6% mencionado por OpenAI es el coste estimado por tarea necesario para obtener resultados similares a los del modelo de comparación. No es una cifra obtenida simplemente dividiendo directamente los precios por token, y debe entenderse como una comparación que incluye las tareas de evaluación y la tasa de éxito.

¿Cómo debe evaluarse la rentabilidad real de un modelo de API?

Además del precio de los tokens, deben incluirse la tasa de éxito, el número de reintentos, el coste de las llamadas a herramientas, la latencia de respuesta, el tiempo de revisión humana y el coste de recuperación de errores. El indicador más útil es el coste total por cada resultado que supera la verificación.

Fuentes

Formatos de datos

Este contenido está disponible en varios formatos amigables para máquinas.

Idiomas solo de datos (traducción automática, solo archivos)

Indonesio JSON MD Portugués JSON MD Chino (tradicional) JSON MD Alemán JSON MD

Reutilización y uso por IA

La indexación en buscadores y la citación por IA con atribución son bienvenidas. Consulte la política de licencias para más detalles.

CC BY · Licencia

Correcciones · mejoras · comentarios Cuéntenos qué está mal o podría mejorar y lo revisaremos. No requiere iniciar sesión.

Comentarios (0)

Inicio de sesión requerido

Inicia sesión con tu cuenta de Google para dar me gusta y comentar.

Sé el primero en comentar.

Contenido relacionado