{"content_id":"aillofw1zj","slug":"openai-gpt-5-6-price-performance-model-routing","locale":"es","schema_type":"TechArticle","category":"ai_data","category_name":"Datos de IA","title":"Revisión de precios y velocidad de OpenAI GPT-5.6 y estrategia de selección de modelos","summary":"Desde el 30 de julio de 2026, OpenAI redujo los precios de la API de GPT-5.6 Luna y Terra en un 80% y un 20%, respectivamente, e introdujo Fast mode en Sol. Esta revisión se centra en una estrategia que reduce el coste por resultado asignando modelos según las fases de planificación, ejecución y verificación, en lugar de utilizar el modelo más avanzado para todas las tareas.","author":{"name":"Equipo editorial de Injoys","url":"https://injoys.com/ko/about"},"key_points":["El precio de la API de GPT-5.6 Luna se redujo a 0.20 dólares por millón de tokens de entrada y a 1.20 dólares por millón de tokens de salida.","El precio de la API de GPT-5.6 Terra se redujo a 2 dólares por millón de tokens de entrada y a 12 dólares por millón de tokens de salida.","Según el anuncio, el Fast mode de GPT-5.6 Sol es hasta 2.5 veces más rápido que el procesamiento Standard, cuesta el doble y mantiene el nivel de inteligencia del modelo.","Las empresas pueden aplicar una configuración por niveles en la que Sol se encargue de las decisiones y la planificación complejas, mientras Luna o Terra gestionan la ejecución repetitiva y la verificación.","OpenAI explica que la optimización conjunta del modelo, la infraestructura de inferencia y el arnés de agentes hizo posibles la reducción de precios y la mejora del rendimiento."],"content_markdown":"OpenAI ha vinculado las mejoras en la eficiencia de ejecución de la familia GPT-5.6 con una reducción de los precios de la API y una mayor velocidad de procesamiento. La clave no consiste en aplicar el modelo más potente a todas las tareas, sino en combinar Sol, Terra y Luna según el nivel de riesgo, la complejidad, la latencia y la posibilidad de verificación de cada tarea para reducir el coste por resultado.\n\nLas cifras de precios y rendimiento se basan en la información anunciada por OpenAI el 30 de julio de 2026. Los benchmarks de clientes y las cifras de mejora de eficiencia son resultados medidos por OpenAI o por las empresas citadas en el anuncio, por lo que no puede asumirse que se reproduzcan de forma idéntica en todos los entornos.\n\n## Cambios en los precios de la API del 30 de julio de 2026\n\nLos nuevos precios de la API de GPT-5.6 Luna y Terra son los siguientes.\n\n| Modelo | 1 millón de tokens de entrada | 1 millón de tokens de salida | Reducción | Función principal |\n|---|---:|---:|---:|---|\n| GPT-5.6 Luna | 0.20 dólares | 1.20 dólares | 80% | Procesamiento masivo, tareas repetitivas y trabajos de ejecución claramente definidos |\n| GPT-5.6 Terra | 2 dólares | 12 dólares | 20% | Trabajo cotidiano que requiere equilibrio entre calidad, coste y velocidad |\n| GPT-5.6 Sol | Sin cambios en el anuncio | Sin cambios en el anuncio | Ninguna | Razonamiento complejo, planificación y decisiones importantes |\n\nLos precios de las suscripciones de pago de ChatGPT y Codex, así como el presupuesto total de las cuotas, no cambian con este anuncio. Sin embargo, se reducen los créditos descontados al utilizar Terra y Luna. OpenAI indicó que los cambios de precios a través de AWS se aplicarían gradualmente desde más tarde el 30 de julio.\n\n### Ejemplo de cálculo del coste de la API\n\nEl coste de los tokens puede calcularse de la siguiente manera.\n\n`Coste total = número de tokens de entrada ÷ 1,000,000 × precio de entrada + número de tokens de salida ÷ 1,000,000 × precio de salida`\n\nPor ejemplo, si se procesan 10 millones de tokens de entrada y 2 millones de tokens de salida, el coste basado únicamente en el precio por token sería el siguiente.\n\n| Modelo | Coste de entrada | Coste de salida | Total |\n|---|---:|---:|---:|\n| Luna | 2 dólares | 2.40 dólares | 4.40 dólares |\n| Terra | 20 dólares | 24 dólares | 44 dólares |\n\nEl importe real facturado puede verse afectado por condiciones específicas del servicio, como la aplicación de caché, el método de procesamiento elegido y la estructura de las llamadas a herramientas.\n\n## Funciones de la familia GPT-5.6\n\nGPT-5.6 no es un único modelo, sino una familia jerárquica de productos con distintos costes y niveles de rendimiento.\n\n### GPT-5.6 Sol\n\nSol se encarga del razonamiento de más alto nivel y de la resolución de problemas complejos. Es adecuado para aclarar requisitos ambiguos, tomar decisiones cuyo coste de fracaso sea elevado, elaborar planes a largo plazo y revisar resultados importantes.\n\n### GPT-5.6 Terra\n\nTerra busca equilibrar rendimiento, coste y velocidad de respuesta. Es adecuado para tareas que requieren una mayor capacidad de juicio que Luna, pero que no necesitan utilizar siempre Sol, como las consultas y respuestas internas de una organización, las tareas de agentes con un alcance definido y los trabajos generales de análisis y programación.\n\n### GPT-5.6 Luna\n\nLuna es el nivel más rápido y económico. Además de generar frases breves y sencillas, admite llamadas a herramientas y flujos de trabajo de varias etapas, por lo que puede utilizarse como modelo de ejecución para repetir a gran escala tareas claramente definidas.\n\nEntre sus aplicaciones representativas se encuentran las siguientes.\n\n- Clasificación masiva de documentos y consultas de clientes\n- Extracción de datos estructurados\n- Modificaciones repetitivas de código\n- Creación y ejecución de pruebas\n- Generación de documentos con reglas claras\n- Revisión de contenido a gran escala\n- Automatización de agentes en segundo plano\n- Asistencia repetitiva en investigación\n\nOpenAI afirma que Luna ofrece un nivel de rendimiento similar al de un modelo considerado de vanguardia hace 1 año, con aproximadamente el 6% del coste estimado por tarea y casi 9 veces más velocidad. En este caso, el 6% no es una comparación directa de los precios por token, sino una comparación del coste estimado necesario para obtener el mismo resultado en una tarea.\n\n## Características del Fast mode de Sol\n\nGPT-5.6 Sol ha incorporado Fast mode para la API. Este sustituye al anterior Priority Processing y corresponde al concepto de la función `/fast` de Codex.\n\n| Elemento | Fast mode |\n|---|---|\n| Velocidad | Hasta 2.5 veces más rápido que el procesamiento Standard |\n| Inteligencia del modelo | Igual que Standard según el anuncio de OpenAI |\n| Precio | El doble del precio del procesamiento Standard |\n| Compatibilidad anterior | Procesamiento automático en Fast mode de las solicitudes con la etiqueta `priority` |\n\nLa expresión «hasta 2.5 veces más rápido» de Fast mode no garantiza que la latencia de todas las solicitudes se reduzca exactamente en la misma proporción. La velocidad percibida puede variar según la longitud del prompt, la longitud de la salida, la carga del servicio y el número de llamadas a herramientas.\n\n### Casos adecuados para Fast mode\n\n- Servicios en tiempo real en los que el usuario espera una respuesta\n- Entornos de desarrollo que repiten rápidamente modificaciones y comprobaciones de código\n- Tareas en las que las llamadas a Sol determinan la latencia de todo el agente\n- Situaciones en las que incluso unos minutos de retraso son importantes, como la respuesta a incidentes o el análisis de fallos\n- Trabajos en los que el coste causado por el retraso del procesamiento supera el coste adicional de la API\n\nEl procesamiento Standard puede ser más económico para tareas cuya finalización no sea urgente, como lotes en segundo plano, análisis nocturnos y procesamiento asíncrono.\n\n## Criterios de selección de modelos centrados en resultados\n\nSeleccionar un modelo no consiste en elegir el que ocupa la posición más alta en una clasificación. Para cada tarea deben examinarse las siguientes preguntas.\n\n| Factor de decisión | Pregunta que debe comprobarse |\n|---|---|\n| Impacto del fracaso | ¿Cómo afecta un error a los clientes, los ingresos, la seguridad o el cumplimiento normativo? |\n| Tolerancia a errores | ¿Puede una persona revisar los errores o pueden detectarse mediante reglas automáticas? |\n| Latencia | ¿El usuario espera en tiempo real o puede procesarse de forma asíncrona? |\n| Volumen de procesamiento | ¿Cuántos casos deben procesarse al día o al mes? |\n| Claridad del problema | ¿Están suficientemente definidos la entrada, las reglas y la salida esperada? |\n| Valor del razonamiento | ¿Un razonamiento más potente mejora significativamente la calidad real de los resultados? |\n| Posibilidad de verificación | ¿Puede evaluarse el resultado mediante pruebas, esquemas o comprobaciones cruzadas? |\n\nEs muy probable que las tareas claras y susceptibles de verificación automática sean adecuadas para Luna. Si se necesita cierta capacidad de juicio, puede considerarse Terra. Sol es adecuado para resolver ambigüedades, tomar decisiones de alto riesgo o realizar la revisión final de las consecuencias de un fallo.\n\n## Estructura de planificación con Sol y ejecución con Luna\n\nIncluso dentro de la tarea de un único agente pueden asignarse modelos diferentes a cada etapa. Por ejemplo, un agente de programación puede configurarse de la siguiente manera.\n\n1. Sol identifica las ambigüedades de los requisitos y organiza las preguntas.\n2. Sol determina el plan de implementación, el alcance de los cambios y los factores de riesgo.\n3. Luna implementa en código los cambios ya aclarados.\n4. Luna crea y ejecuta las pruebas.\n5. Luna o Terra evalúa los resultados de las pruebas y las diferencias en el código.\n6. Sol vuelve a revisar únicamente las conclusiones importantes o con una alta probabilidad de fallo.\n\nEsta estructura permite reducir los costes en comparación con el uso de Sol en todas las etapas y concentrar una gran capacidad de razonamiento en las decisiones importantes. Sin embargo, al dividir los modelos, deben diseñarse por separado las reglas de enrutamiento, la gestión de errores, el seguimiento de registros y el sistema de evaluación.\n\n## Tres niveles de eficiencia que respaldan la reducción de precios\n\nOpenAI explica que la reducción de costes no procede simplemente de una política de precios, sino de mejoras técnicas en tres niveles.\n\n1. Eficiencia de tokens del propio modelo\n2. Eficiencia del hardware del sistema de inferencia\n3. Eficiencia del arnés de agentes que conecta modelos, herramientas y contexto\n\nEsta explicación se basa en la documentación técnica publicada por OpenAI, y la estructura detallada de todos los costes no se ha hecho pública. Por tanto, desde el exterior resulta difícil determinar en qué medida contribuyeron respectivamente la eficiencia técnica y la política estratégica de precios a la reducción.\n\n## Optimización del modelo y del sistema de inferencia\n\n### Mejora del volumen de trabajo por token\n\nSegún OpenAI, GPT-5.6 se entrenó para optimizar tanto la tasa de éxito de las tareas como la eficiencia de procesamiento. Esto significa que fue diseñado para reducir razonamientos innecesariamente largos o repetitivos y llegar a los resultados necesarios con menos tokens, aumentando así la inteligencia y el volumen de trabajo por token.\n\n### Distribución de carga y enrutamiento de solicitudes\n\nEl sistema de inferencia distribuye las solicitudes entre centros de datos y clústeres según la región, la capacidad disponible y el tipo de acelerador. Dentro de cada clúster, selecciona una instancia del modelo teniendo en cuenta la carga actual, la longitud del contexto de entrada, la posibilidad de utilizar caché y las características de la solicitud, entre otros factores.\n\nOpenAI indicó que utilizó GPT-5.6 Sol y Codex para analizar el tráfico de producción, investigar las causas de desequilibrios de carga, probar estrategias de enrutamiento y ajustar heurísticas.\n\n### Optimización de kernels de GPU\n\nLos kernels de GPU son el código esencial que ejecuta en el hardware las operaciones matemáticas del modelo. El coste de procesamiento puede variar incluso en la misma GPU según el movimiento de memoria, la sincronización, la disposición de los datos y el método de paralelización.\n\nSegún OpenAI, GPT-5.6 Sol participó en la creación y optimización de kernels de producción utilizando Triton y Gluon en el entorno de Codex. La empresa afirmó que la combinación de las mejoras de los kernels y las optimizaciones relacionadas redujo en un 20% el coste integral de la prestación del modelo.\n\nEl coste integral no se refiere a una sola operación específica, sino al coste total del procesamiento real de una solicitud, incluido el enrutamiento, el movimiento de datos, la ejecución del modelo y la generación de la salida.\n\n### Verificación de la exactitud de los kernels\n\nIncluso un kernel rápido no puede utilizarse si produce resultados numéricamente incorrectos. OpenAI explicó que invirtió en herramientas de verificación, incluido FpSan, para comprobar la exactitud de los kernels escritos por IA. FpSan es la abreviatura de Floating-Point Sanitizer, una herramienta de código abierto que detecta errores relacionados con operaciones de coma flotante.\n\nEsto demuestra que, cuando la IA genera código de infraestructura de producción, se necesitan no solo benchmarks de rendimiento, sino también verificación numérica, pruebas de regresión y procedimientos de recuperación en caso de fallo.\n\n## Decodificación especulativa y caché KV\n\n### Decodificación especulativa\n\nLa decodificación especulativa es un método en el que un pequeño modelo de borrador propone primero los tokens que se generarán a continuación y el modelo principal de mayor tamaño verifica varios candidatos en paralelo. Si se aceptan las propuestas, puede reducirse el número de costosos cálculos secuenciales del modelo principal.\n\nOpenAI indicó que GPT-5.6 Sol diseñó y ejecutó cientos de experimentos que modificaban el tamaño y la estructura del modelo de borrador, además de supervisar el entrenamiento. Según su explicación, esto mejoró la eficiencia de generación de tokens en al menos un 15%.\n\n### Caché KV y configuración por carga de trabajo\n\nMientras procesa la entrada, el modelo crea una caché Key-Value, es decir, una caché KV. La configuración óptima varía según la longitud de la entrada y la salida, el tamaño del lote, la tasa de aciertos de caché, el número de solicitudes simultáneas, la capacidad de memoria y el método de fragmentación del modelo.\n\nOpenAI explica que analizó cargas de trabajo reales con Sol y Codex, evaluó configuraciones candidatas y ajustó con precisión la configuración del motor para cada tipo de tarea. El objetivo es procesar más solicitudes con el mismo hardware.\n\n## Arnés de agentes y coste del contexto\n\nUn agente llama varias veces al modelo y a las herramientas para resolver una sola solicitud del usuario. Si una tarea que requiere 30 llamadas al modelo sufre 1 segundo de retraso innecesario en cada llamada, la latencia total puede aumentar aproximadamente 30 segundos.\n\nOpenAI describe como arnés de agentes una capa de orquestación basada en Rust que conecta el modelo, las herramientas y el entorno del usuario.\n\n### Exposición diferida únicamente de las herramientas necesarias\n\nSi desde el principio se incluye en el prompt toda la información sobre herramientas, complementos, habilidades e integraciones MCP, aumentan los tokens de entrada y la latencia. El arnés utiliza un método de exploración diferida que expone la información sobre las herramientas relevantes únicamente cuando es necesaria. OpenAI indicó que, de forma predeterminada, la salida de las herramientas está limitada a 10,000 tokens, salvo que el modelo solicite un límite distinto.\n\n### Conservación exacta del prefijo y caché de prompts\n\nLa caché de prompts reduce los cálculos duplicados reutilizando el mismo fragmento inicial de una entrada procesada anteriormente. Para reutilizar la caché, el prefijo del prompt debe coincidir exactamente.\n\nEl arnés de OpenAI gestiona el historial mediante una estructura de solo adición y añade al final los mensajes nuevos y los resultados de las herramientas. Las herramientas se presentan en un orden determinista, mientras que los ajustes de ejecución, como las políticas de aprobación, se aplican durante el tiempo de ejecución sin modificar las propias definiciones de las herramientas. Este método facilita el aumento de la tasa de aciertos de caché en los ciclos repetitivos de los agentes.\n\n## Cómo interpretar las cifras de casos empresariales\n\nEl anuncio oficial de OpenAI incluyó evaluaciones de Replit, Notion, Ramp, Blitzy, Cognition y Dust, entre otras empresas.\n\n- Notion indicó que, en su propia evaluación, Terra ofreció una calidad similar a GPT-5.5 con la mitad del coste por tarea y un 60% menos de tiempo.\n- Blitzy explicó que, tras adoptar Luna, la tasa de reutilización de la caché de prompts aumentó del 24% al 90%, mientras que el coste fue un 87% inferior al del anterior modelo predeterminado.\n- Dust indicó que, en las mismas tareas de agentes, Luna fue un 40% más rápido y un 40% más económico que el anterior modelo predeterminado.\n- Ramp indicó que utiliza Luna como modelo predeterminado para la automatización de agentes en segundo plano.\n\nEstas cifras corresponden a casos medidos con las tareas internas, los prompts, los criterios de evaluación y las estructuras de sistemas de cada empresa. No son un benchmark común e independiente, por lo que no deben aplicarse directamente al trabajo de otras organizaciones. Antes de la adopción, es necesaria una evaluación propia que refleje los datos reales y el coste de los errores.\n\n## Lista de verificación previa a la adopción\n\n1. Preparar una muestra representativa de tareas y las respuestas correctas o los criterios de evaluación.\n2. Comparar en las mismas condiciones la tasa de éxito y la tasa de reintentos de Luna, Terra y Sol.\n3. Incluir no solo el coste de los tokens, sino también las llamadas a herramientas, el personal de revisión y el coste de recuperación ante fallos.\n4. Medir, además de la latencia media, la latencia del percentil 95 o 99.\n5. Clasificar como candidatos para modelos económicos los pasos que puedan verificarse mediante pruebas automáticas o validación de esquemas.\n6. Aplicar políticas independientes de aprobación y registro a las tareas relacionadas con datos personales, seguridad y normativas.\n7. Definir criterios de enrutamiento para escalar a Terra o Sol los resultados de baja confianza.\n8. Verificar con tráfico real si el valor de la reducción de latencia supera el coste adicional de Fast mode.\n\n## Significado y limitaciones\n\nEsta reorganización demuestra que el criterio de la competencia entre modelos de IA está pasando de una única puntuación máxima al coste por resultado. Al asignar Luna a las tareas repetitivas a gran escala, Terra al trabajo cotidiano basado en conocimiento y Sol a las decisiones ambiguas e importantes, pueden combinarse inteligencia, velocidad y coste según cada trabajo.\n\nSin embargo, con la información pública resulta difícil separar en qué medida la reducción de precios del 80% procede de mejoras en la eficiencia técnica y en qué medida de una estrategia de mercado. Además, la rentabilidad de los modelos económicos no se determina únicamente por el precio de los tokens. Si una tasa de errores elevada aumenta los reintentos y las revisiones humanas, el coste total del trabajo puede subir.\n\nPor tanto, la métrica clave no es el precio de una llamada al modelo, sino el coste total de producir un resultado que supere la verificación. Para determinar si la reducción de precios de GPT-5.6 se traduce en valor empresarial real, deben medirse conjuntamente la tasa de éxito de cada modelo, el número de reintentos, la latencia y el coste de revisión.","content_html":"\u003cp\u003eOpenAI ha vinculado las mejoras en la eficiencia de ejecución de la familia GPT-5.6 con una reducción de los precios de la API y una mayor velocidad de procesamiento. La clave no consiste en aplicar el modelo más potente a todas las tareas, sino en combinar Sol, Terra y Luna según el nivel de riesgo, la complejidad, la latencia y la posibilidad de verificación de cada tarea para reducir el coste por resultado.\u003c/p\u003e\n\u003cp\u003eLas cifras de precios y rendimiento se basan en la información anunciada por OpenAI el 30 de julio de 2026. Los benchmarks de clientes y las cifras de mejora de eficiencia son resultados medidos por OpenAI o por las empresas citadas en el anuncio, por lo que no puede asumirse que se reproduzcan de forma idéntica en todos los entornos.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#cambios-en-los-precios-de-la-api-del-30-de-julio-de-2026\" class=\"anchor\" id=\"cambios-en-los-precios-de-la-api-del-30-de-julio-de-2026\"\u003e\u003c/a\u003eCambios en los precios de la API del 30 de julio de 2026\u003c/h2\u003e\n\u003cp\u003eLos nuevos precios de la API de GPT-5.6 Luna y Terra son los siguientes.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModelo\u003c/th\u003e\n\u003cth\u003e1 millón de tokens de entrada\u003c/th\u003e\n\u003cth\u003e1 millón de tokens de salida\u003c/th\u003e\n\u003cth\u003eReducción\u003c/th\u003e\n\u003cth\u003eFunción principal\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Luna\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de entrada\"\u003e0.20 dólares\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de salida\"\u003e1.20 dólares\u003c/td\u003e\n\u003ctd data-label=\"Reducción\"\u003e80%\u003c/td\u003e\n\u003ctd data-label=\"Función principal\"\u003eProcesamiento masivo, tareas repetitivas y trabajos de ejecución claramente definidos\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Terra\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de entrada\"\u003e2 dólares\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de salida\"\u003e12 dólares\u003c/td\u003e\n\u003ctd data-label=\"Reducción\"\u003e20%\u003c/td\u003e\n\u003ctd data-label=\"Función principal\"\u003eTrabajo cotidiano que requiere equilibrio entre calidad, coste y velocidad\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eGPT-5.6 Sol\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de entrada\"\u003eSin cambios en el anuncio\u003c/td\u003e\n\u003ctd data-label=\"1 millón de tokens de salida\"\u003eSin cambios en el anuncio\u003c/td\u003e\n\u003ctd data-label=\"Reducción\"\u003eNinguna\u003c/td\u003e\n\u003ctd data-label=\"Función principal\"\u003eRazonamiento complejo, planificación y decisiones importantes\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eLos precios de las suscripciones de pago de ChatGPT y Codex, así como el presupuesto total de las cuotas, no cambian con este anuncio. Sin embargo, se reducen los créditos descontados al utilizar Terra y Luna. OpenAI indicó que los cambios de precios a través de AWS se aplicarían gradualmente desde más tarde el 30 de julio.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#ejemplo-de-c%C3%A1lculo-del-coste-de-la-api\" class=\"anchor\" id=\"ejemplo-de-cálculo-del-coste-de-la-api\"\u003e\u003c/a\u003eEjemplo de cálculo del coste de la API\u003c/h3\u003e\n\u003cp\u003eEl coste de los tokens puede calcularse de la siguiente manera.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eCoste total = número de tokens de entrada ÷ 1,000,000 × precio de entrada + número de tokens de salida ÷ 1,000,000 × precio de salida\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003ePor ejemplo, si se procesan 10 millones de tokens de entrada y 2 millones de tokens de salida, el coste basado únicamente en el precio por token sería el siguiente.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModelo\u003c/th\u003e\n\u003cth\u003eCoste de entrada\u003c/th\u003e\n\u003cth\u003eCoste de salida\u003c/th\u003e\n\u003cth\u003eTotal\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eLuna\u003c/td\u003e\n\u003ctd data-label=\"Coste de entrada\"\u003e2 dólares\u003c/td\u003e\n\u003ctd data-label=\"Coste de salida\"\u003e2.40 dólares\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003e4.40 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Modelo\"\u003eTerra\u003c/td\u003e\n\u003ctd data-label=\"Coste de entrada\"\u003e20 dólares\u003c/td\u003e\n\u003ctd data-label=\"Coste de salida\"\u003e24 dólares\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003e44 dólares\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eEl importe real facturado puede verse afectado por condiciones específicas del servicio, como la aplicación de caché, el método de procesamiento elegido y la estructura de las llamadas a herramientas.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#funciones-de-la-familia-gpt-56\" class=\"anchor\" id=\"funciones-de-la-familia-gpt-56\"\u003e\u003c/a\u003eFunciones de la familia GPT-5.6\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 no es un único modelo, sino una familia jerárquica de productos con distintos costes y niveles de rendimiento.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-sol\" class=\"anchor\" id=\"gpt-56-sol\"\u003e\u003c/a\u003eGPT-5.6 Sol\u003c/h3\u003e\n\u003cp\u003eSol se encarga del razonamiento de más alto nivel y de la resolución de problemas complejos. Es adecuado para aclarar requisitos ambiguos, tomar decisiones cuyo coste de fracaso sea elevado, elaborar planes a largo plazo y revisar resultados importantes.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-terra\" class=\"anchor\" id=\"gpt-56-terra\"\u003e\u003c/a\u003eGPT-5.6 Terra\u003c/h3\u003e\n\u003cp\u003eTerra busca equilibrar rendimiento, coste y velocidad de respuesta. Es adecuado para tareas que requieren una mayor capacidad de juicio que Luna, pero que no necesitan utilizar siempre Sol, como las consultas y respuestas internas de una organización, las tareas de agentes con un alcance definido y los trabajos generales de análisis y programación.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-luna\" class=\"anchor\" id=\"gpt-56-luna\"\u003e\u003c/a\u003eGPT-5.6 Luna\u003c/h3\u003e\n\u003cp\u003eLuna es el nivel más rápido y económico. Además de generar frases breves y sencillas, admite llamadas a herramientas y flujos de trabajo de varias etapas, por lo que puede utilizarse como modelo de ejecución para repetir a gran escala tareas claramente definidas.\u003c/p\u003e\n\u003cp\u003eEntre sus aplicaciones representativas se encuentran las siguientes.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eClasificación masiva de documentos y consultas de clientes\u003c/li\u003e\n\u003cli\u003eExtracción de datos estructurados\u003c/li\u003e\n\u003cli\u003eModificaciones repetitivas de código\u003c/li\u003e\n\u003cli\u003eCreación y ejecución de pruebas\u003c/li\u003e\n\u003cli\u003eGeneración de documentos con reglas claras\u003c/li\u003e\n\u003cli\u003eRevisión de contenido a gran escala\u003c/li\u003e\n\u003cli\u003eAutomatización de agentes en segundo plano\u003c/li\u003e\n\u003cli\u003eAsistencia repetitiva en investigación\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOpenAI afirma que Luna ofrece un nivel de rendimiento similar al de un modelo considerado de vanguardia hace 1 año, con aproximadamente el 6% del coste estimado por tarea y casi 9 veces más velocidad. En este caso, el 6% no es una comparación directa de los precios por token, sino una comparación del coste estimado necesario para obtener el mismo resultado en una tarea.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#caracter%C3%ADsticas-del-fast-mode-de-sol\" class=\"anchor\" id=\"características-del-fast-mode-de-sol\"\u003e\u003c/a\u003eCaracterísticas del Fast mode de Sol\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 Sol ha incorporado Fast mode para la API. Este sustituye al anterior Priority Processing y corresponde al concepto de la función \u003ccode\u003e/fast\u003c/code\u003e de Codex.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eElemento\u003c/th\u003e\n\u003cth\u003eFast mode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eVelocidad\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eHasta 2.5 veces más rápido que el procesamiento Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eInteligencia del modelo\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eIgual que Standard según el anuncio de OpenAI\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003ePrecio\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eEl doble del precio del procesamiento Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Elemento\"\u003eCompatibilidad anterior\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eProcesamiento automático en Fast mode de las solicitudes con la etiqueta \u003ccode\u003epriority\u003c/code\u003e\n\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eLa expresión «hasta 2.5 veces más rápido» de Fast mode no garantiza que la latencia de todas las solicitudes se reduzca exactamente en la misma proporción. La velocidad percibida puede variar según la longitud del prompt, la longitud de la salida, la carga del servicio y el número de llamadas a herramientas.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#casos-adecuados-para-fast-mode\" class=\"anchor\" id=\"casos-adecuados-para-fast-mode\"\u003e\u003c/a\u003eCasos adecuados para Fast mode\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eServicios en tiempo real en los que el usuario espera una respuesta\u003c/li\u003e\n\u003cli\u003eEntornos de desarrollo que repiten rápidamente modificaciones y comprobaciones de código\u003c/li\u003e\n\u003cli\u003eTareas en las que las llamadas a Sol determinan la latencia de todo el agente\u003c/li\u003e\n\u003cli\u003eSituaciones en las que incluso unos minutos de retraso son importantes, como la respuesta a incidentes o el análisis de fallos\u003c/li\u003e\n\u003cli\u003eTrabajos en los que el coste causado por el retraso del procesamiento supera el coste adicional de la API\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEl procesamiento Standard puede ser más económico para tareas cuya finalización no sea urgente, como lotes en segundo plano, análisis nocturnos y procesamiento asíncrono.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#criterios-de-selecci%C3%B3n-de-modelos-centrados-en-resultados\" class=\"anchor\" id=\"criterios-de-selección-de-modelos-centrados-en-resultados\"\u003e\u003c/a\u003eCriterios de selección de modelos centrados en resultados\u003c/h2\u003e\n\u003cp\u003eSeleccionar un modelo no consiste en elegir el que ocupa la posición más alta en una clasificación. Para cada tarea deben examinarse las siguientes preguntas.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eFactor de decisión\u003c/th\u003e\n\u003cth\u003ePregunta que debe comprobarse\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eImpacto del fracaso\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Cómo afecta un error a los clientes, los ingresos, la seguridad o el cumplimiento normativo?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eTolerancia a errores\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Puede una persona revisar los errores o pueden detectarse mediante reglas automáticas?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eLatencia\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿El usuario espera en tiempo real o puede procesarse de forma asíncrona?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eVolumen de procesamiento\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Cuántos casos deben procesarse al día o al mes?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eClaridad del problema\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Están suficientemente definidos la entrada, las reglas y la salida esperada?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003eValor del razonamiento\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Un razonamiento más potente mejora significativamente la calidad real de los resultados?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Factor de decisión\"\u003ePosibilidad de verificación\u003c/td\u003e\n\u003ctd data-label=\"Pregunta que debe comprobarse\"\u003e¿Puede evaluarse el resultado mediante pruebas, esquemas o comprobaciones cruzadas?\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eEs muy probable que las tareas claras y susceptibles de verificación automática sean adecuadas para Luna. Si se necesita cierta capacidad de juicio, puede considerarse Terra. Sol es adecuado para resolver ambigüedades, tomar decisiones de alto riesgo o realizar la revisión final de las consecuencias de un fallo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#estructura-de-planificaci%C3%B3n-con-sol-y-ejecuci%C3%B3n-con-luna\" class=\"anchor\" id=\"estructura-de-planificación-con-sol-y-ejecución-con-luna\"\u003e\u003c/a\u003eEstructura de planificación con Sol y ejecución con Luna\u003c/h2\u003e\n\u003cp\u003eIncluso dentro de la tarea de un único agente pueden asignarse modelos diferentes a cada etapa. Por ejemplo, un agente de programación puede configurarse de la siguiente manera.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eSol identifica las ambigüedades de los requisitos y organiza las preguntas.\u003c/li\u003e\n\u003cli\u003eSol determina el plan de implementación, el alcance de los cambios y los factores de riesgo.\u003c/li\u003e\n\u003cli\u003eLuna implementa en código los cambios ya aclarados.\u003c/li\u003e\n\u003cli\u003eLuna crea y ejecuta las pruebas.\u003c/li\u003e\n\u003cli\u003eLuna o Terra evalúa los resultados de las pruebas y las diferencias en el código.\u003c/li\u003e\n\u003cli\u003eSol vuelve a revisar únicamente las conclusiones importantes o con una alta probabilidad de fallo.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEsta estructura permite reducir los costes en comparación con el uso de Sol en todas las etapas y concentrar una gran capacidad de razonamiento en las decisiones importantes. Sin embargo, al dividir los modelos, deben diseñarse por separado las reglas de enrutamiento, la gestión de errores, el seguimiento de registros y el sistema de evaluación.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tres-niveles-de-eficiencia-que-respaldan-la-reducci%C3%B3n-de-precios\" class=\"anchor\" id=\"tres-niveles-de-eficiencia-que-respaldan-la-reducción-de-precios\"\u003e\u003c/a\u003eTres niveles de eficiencia que respaldan la reducción de precios\u003c/h2\u003e\n\u003cp\u003eOpenAI explica que la reducción de costes no procede simplemente de una política de precios, sino de mejoras técnicas en tres niveles.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEficiencia de tokens del propio modelo\u003c/li\u003e\n\u003cli\u003eEficiencia del hardware del sistema de inferencia\u003c/li\u003e\n\u003cli\u003eEficiencia del arnés de agentes que conecta modelos, herramientas y contexto\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eEsta explicación se basa en la documentación técnica publicada por OpenAI, y la estructura detallada de todos los costes no se ha hecho pública. Por tanto, desde el exterior resulta difícil determinar en qué medida contribuyeron respectivamente la eficiencia técnica y la política estratégica de precios a la reducción.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#optimizaci%C3%B3n-del-modelo-y-del-sistema-de-inferencia\" class=\"anchor\" id=\"optimización-del-modelo-y-del-sistema-de-inferencia\"\u003e\u003c/a\u003eOptimización del modelo y del sistema de inferencia\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#mejora-del-volumen-de-trabajo-por-token\" class=\"anchor\" id=\"mejora-del-volumen-de-trabajo-por-token\"\u003e\u003c/a\u003eMejora del volumen de trabajo por token\u003c/h3\u003e\n\u003cp\u003eSegún OpenAI, GPT-5.6 se entrenó para optimizar tanto la tasa de éxito de las tareas como la eficiencia de procesamiento. Esto significa que fue diseñado para reducir razonamientos innecesariamente largos o repetitivos y llegar a los resultados necesarios con menos tokens, aumentando así la inteligencia y el volumen de trabajo por token.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#distribuci%C3%B3n-de-carga-y-enrutamiento-de-solicitudes\" class=\"anchor\" id=\"distribución-de-carga-y-enrutamiento-de-solicitudes\"\u003e\u003c/a\u003eDistribución de carga y enrutamiento de solicitudes\u003c/h3\u003e\n\u003cp\u003eEl sistema de inferencia distribuye las solicitudes entre centros de datos y clústeres según la región, la capacidad disponible y el tipo de acelerador. Dentro de cada clúster, selecciona una instancia del modelo teniendo en cuenta la carga actual, la longitud del contexto de entrada, la posibilidad de utilizar caché y las características de la solicitud, entre otros factores.\u003c/p\u003e\n\u003cp\u003eOpenAI indicó que utilizó GPT-5.6 Sol y Codex para analizar el tráfico de producción, investigar las causas de desequilibrios de carga, probar estrategias de enrutamiento y ajustar heurísticas.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#optimizaci%C3%B3n-de-kernels-de-gpu\" class=\"anchor\" id=\"optimización-de-kernels-de-gpu\"\u003e\u003c/a\u003eOptimización de kernels de GPU\u003c/h3\u003e\n\u003cp\u003eLos kernels de GPU son el código esencial que ejecuta en el hardware las operaciones matemáticas del modelo. El coste de procesamiento puede variar incluso en la misma GPU según el movimiento de memoria, la sincronización, la disposición de los datos y el método de paralelización.\u003c/p\u003e\n\u003cp\u003eSegún OpenAI, GPT-5.6 Sol participó en la creación y optimización de kernels de producción utilizando Triton y Gluon en el entorno de Codex. La empresa afirmó que la combinación de las mejoras de los kernels y las optimizaciones relacionadas redujo en un 20% el coste integral de la prestación del modelo.\u003c/p\u003e\n\u003cp\u003eEl coste integral no se refiere a una sola operación específica, sino al coste total del procesamiento real de una solicitud, incluido el enrutamiento, el movimiento de datos, la ejecución del modelo y la generación de la salida.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#verificaci%C3%B3n-de-la-exactitud-de-los-kernels\" class=\"anchor\" id=\"verificación-de-la-exactitud-de-los-kernels\"\u003e\u003c/a\u003eVerificación de la exactitud de los kernels\u003c/h3\u003e\n\u003cp\u003eIncluso un kernel rápido no puede utilizarse si produce resultados numéricamente incorrectos. OpenAI explicó que invirtió en herramientas de verificación, incluido FpSan, para comprobar la exactitud de los kernels escritos por IA. FpSan es la abreviatura de Floating-Point Sanitizer, una herramienta de código abierto que detecta errores relacionados con operaciones de coma flotante.\u003c/p\u003e\n\u003cp\u003eEsto demuestra que, cuando la IA genera código de infraestructura de producción, se necesitan no solo benchmarks de rendimiento, sino también verificación numérica, pruebas de regresión y procedimientos de recuperación en caso de fallo.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#decodificaci%C3%B3n-especulativa-y-cach%C3%A9-kv\" class=\"anchor\" id=\"decodificación-especulativa-y-caché-kv\"\u003e\u003c/a\u003eDecodificación especulativa y caché KV\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#decodificaci%C3%B3n-especulativa\" class=\"anchor\" id=\"decodificación-especulativa\"\u003e\u003c/a\u003eDecodificación especulativa\u003c/h3\u003e\n\u003cp\u003eLa decodificación especulativa es un método en el que un pequeño modelo de borrador propone primero los tokens que se generarán a continuación y el modelo principal de mayor tamaño verifica varios candidatos en paralelo. Si se aceptan las propuestas, puede reducirse el número de costosos cálculos secuenciales del modelo principal.\u003c/p\u003e\n\u003cp\u003eOpenAI indicó que GPT-5.6 Sol diseñó y ejecutó cientos de experimentos que modificaban el tamaño y la estructura del modelo de borrador, además de supervisar el entrenamiento. Según su explicación, esto mejoró la eficiencia de generación de tokens en al menos un 15%.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#cach%C3%A9-kv-y-configuraci%C3%B3n-por-carga-de-trabajo\" class=\"anchor\" id=\"caché-kv-y-configuración-por-carga-de-trabajo\"\u003e\u003c/a\u003eCaché KV y configuración por carga de trabajo\u003c/h3\u003e\n\u003cp\u003eMientras procesa la entrada, el modelo crea una caché Key-Value, es decir, una caché KV. La configuración óptima varía según la longitud de la entrada y la salida, el tamaño del lote, la tasa de aciertos de caché, el número de solicitudes simultáneas, la capacidad de memoria y el método de fragmentación del modelo.\u003c/p\u003e\n\u003cp\u003eOpenAI explica que analizó cargas de trabajo reales con Sol y Codex, evaluó configuraciones candidatas y ajustó con precisión la configuración del motor para cada tipo de tarea. El objetivo es procesar más solicitudes con el mismo hardware.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#arn%C3%A9s-de-agentes-y-coste-del-contexto\" class=\"anchor\" id=\"arnés-de-agentes-y-coste-del-contexto\"\u003e\u003c/a\u003eArnés de agentes y coste del contexto\u003c/h2\u003e\n\u003cp\u003eUn agente llama varias veces al modelo y a las herramientas para resolver una sola solicitud del usuario. Si una tarea que requiere 30 llamadas al modelo sufre 1 segundo de retraso innecesario en cada llamada, la latencia total puede aumentar aproximadamente 30 segundos.\u003c/p\u003e\n\u003cp\u003eOpenAI describe como arnés de agentes una capa de orquestación basada en Rust que conecta el modelo, las herramientas y el entorno del usuario.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#exposici%C3%B3n-diferida-%C3%BAnicamente-de-las-herramientas-necesarias\" class=\"anchor\" id=\"exposición-diferida-únicamente-de-las-herramientas-necesarias\"\u003e\u003c/a\u003eExposición diferida únicamente de las herramientas necesarias\u003c/h3\u003e\n\u003cp\u003eSi desde el principio se incluye en el prompt toda la información sobre herramientas, complementos, habilidades e integraciones MCP, aumentan los tokens de entrada y la latencia. El arnés utiliza un método de exploración diferida que expone la información sobre las herramientas relevantes únicamente cuando es necesaria. OpenAI indicó que, de forma predeterminada, la salida de las herramientas está limitada a 10,000 tokens, salvo que el modelo solicite un límite distinto.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#conservaci%C3%B3n-exacta-del-prefijo-y-cach%C3%A9-de-prompts\" class=\"anchor\" id=\"conservación-exacta-del-prefijo-y-caché-de-prompts\"\u003e\u003c/a\u003eConservación exacta del prefijo y caché de prompts\u003c/h3\u003e\n\u003cp\u003eLa caché de prompts reduce los cálculos duplicados reutilizando el mismo fragmento inicial de una entrada procesada anteriormente. Para reutilizar la caché, el prefijo del prompt debe coincidir exactamente.\u003c/p\u003e\n\u003cp\u003eEl arnés de OpenAI gestiona el historial mediante una estructura de solo adición y añade al final los mensajes nuevos y los resultados de las herramientas. Las herramientas se presentan en un orden determinista, mientras que los ajustes de ejecución, como las políticas de aprobación, se aplican durante el tiempo de ejecución sin modificar las propias definiciones de las herramientas. Este método facilita el aumento de la tasa de aciertos de caché en los ciclos repetitivos de los agentes.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#c%C3%B3mo-interpretar-las-cifras-de-casos-empresariales\" class=\"anchor\" id=\"cómo-interpretar-las-cifras-de-casos-empresariales\"\u003e\u003c/a\u003eCómo interpretar las cifras de casos empresariales\u003c/h2\u003e\n\u003cp\u003eEl anuncio oficial de OpenAI incluyó evaluaciones de Replit, Notion, Ramp, Blitzy, Cognition y Dust, entre otras empresas.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNotion indicó que, en su propia evaluación, Terra ofreció una calidad similar a GPT-5.5 con la mitad del coste por tarea y un 60% menos de tiempo.\u003c/li\u003e\n\u003cli\u003eBlitzy explicó que, tras adoptar Luna, la tasa de reutilización de la caché de prompts aumentó del 24% al 90%, mientras que el coste fue un 87% inferior al del anterior modelo predeterminado.\u003c/li\u003e\n\u003cli\u003eDust indicó que, en las mismas tareas de agentes, Luna fue un 40% más rápido y un 40% más económico que el anterior modelo predeterminado.\u003c/li\u003e\n\u003cli\u003eRamp indicó que utiliza Luna como modelo predeterminado para la automatización de agentes en segundo plano.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eEstas cifras corresponden a casos medidos con las tareas internas, los prompts, los criterios de evaluación y las estructuras de sistemas de cada empresa. No son un benchmark común e independiente, por lo que no deben aplicarse directamente al trabajo de otras organizaciones. Antes de la adopción, es necesaria una evaluación propia que refleje los datos reales y el coste de los errores.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#lista-de-verificaci%C3%B3n-previa-a-la-adopci%C3%B3n\" class=\"anchor\" id=\"lista-de-verificación-previa-a-la-adopción\"\u003e\u003c/a\u003eLista de verificación previa a la adopción\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003ePreparar una muestra representativa de tareas y las respuestas correctas o los criterios de evaluación.\u003c/li\u003e\n\u003cli\u003eComparar en las mismas condiciones la tasa de éxito y la tasa de reintentos de Luna, Terra y Sol.\u003c/li\u003e\n\u003cli\u003eIncluir no solo el coste de los tokens, sino también las llamadas a herramientas, el personal de revisión y el coste de recuperación ante fallos.\u003c/li\u003e\n\u003cli\u003eMedir, además de la latencia media, la latencia del percentil 95 o 99.\u003c/li\u003e\n\u003cli\u003eClasificar como candidatos para modelos económicos los pasos que puedan verificarse mediante pruebas automáticas o validación de esquemas.\u003c/li\u003e\n\u003cli\u003eAplicar políticas independientes de aprobación y registro a las tareas relacionadas con datos personales, seguridad y normativas.\u003c/li\u003e\n\u003cli\u003eDefinir criterios de enrutamiento para escalar a Terra o Sol los resultados de baja confianza.\u003c/li\u003e\n\u003cli\u003eVerificar con tráfico real si el valor de la reducción de latencia supera el coste adicional de Fast mode.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#significado-y-limitaciones\" class=\"anchor\" id=\"significado-y-limitaciones\"\u003e\u003c/a\u003eSignificado y limitaciones\u003c/h2\u003e\n\u003cp\u003eEsta reorganización demuestra que el criterio de la competencia entre modelos de IA está pasando de una única puntuación máxima al coste por resultado. Al asignar Luna a las tareas repetitivas a gran escala, Terra al trabajo cotidiano basado en conocimiento y Sol a las decisiones ambiguas e importantes, pueden combinarse inteligencia, velocidad y coste según cada trabajo.\u003c/p\u003e\n\u003cp\u003eSin embargo, con la información pública resulta difícil separar en qué medida la reducción de precios del 80% procede de mejoras en la eficiencia técnica y en qué medida de una estrategia de mercado. Además, la rentabilidad de los modelos económicos no se determina únicamente por el precio de los tokens. Si una tasa de errores elevada aumenta los reintentos y las revisiones humanas, el coste total del trabajo puede subir.\u003c/p\u003e\n\u003cp\u003ePor tanto, la métrica clave no es el precio de una llamada al modelo, sino el coste total de producir un resultado que supere la verificación. Para determinar si la reducción de precios de GPT-5.6 se traduce en valor empresarial real, deben medirse conjuntamente la tasa de éxito de cada modelo, el número de reintentos, la latencia y el coste de revisión.\u003c/p\u003e\n","tags":["OpenAI","GPT-5.6","Precios de API","Eficiencia de razonamiento","Agente"],"faqs":[{"question":"¿Cuál es el nuevo precio de la API de GPT-5.6 Luna?","answer":"A fecha del 30 de julio de 2026, Luna cuesta 0.20 dólares por cada millón de tokens de entrada y 1.20 dólares por cada millón de tokens de salida. La reducción respecto al precio anterior anunciada por OpenAI es del 80%."},{"question":"¿Cuál es el nuevo precio de la API de GPT-5.6 Terra?","answer":"Terra cuesta 2 dólares por cada millón de tokens de entrada y 12 dólares por cada millón de tokens de salida. La reducción de precio anunciada por OpenAI es del 20%."},{"question":"¿También se ha reducido el precio de GPT-5.6 Sol?","answer":"No. En este anuncio de OpenAI, el precio del procesamiento Standard de Sol no ha cambiado. En su lugar, se ha añadido Fast mode, que es hasta 2.5 veces más rápido que Standard y cuesta el doble."},{"question":"¿Disminuye la calidad de las respuestas del modelo al utilizar Fast mode?","answer":"OpenAI explica que Fast mode aumenta la velocidad de procesamiento sin reducir el nivel de inteligencia de Sol. Sin embargo, la velocidad de hasta 2.5 veces es un límite máximo, y la latencia real puede variar según la longitud de la solicitud, el volumen de salida, las llamadas a herramientas y la carga del sistema."},{"question":"¿Es necesario modificar las solicitudes existentes de Priority Processing?","answer":"Según el anuncio de OpenAI, la etiqueta `priority` de las solicitudes existentes de la API seguirá funcionando y se vinculará automáticamente al procesamiento de Fast mode. En un entorno de producción, es recomendable comprobar por separado la fecha de aplicación y los cargos reales."},{"question":"¿Para qué tareas es adecuado utilizar Luna?","answer":"Es adecuado para tareas masivas y repetitivas con reglas y resultados esperados claros que puedan verificarse automáticamente. Algunos ejemplos representativos son la clasificación de documentos, la extracción de datos, las modificaciones repetitivas de código, la ejecución de pruebas, la revisión de contenido y la automatización en segundo plano."},{"question":"¿Qué modelo debería elegir entre Terra y Luna?","answer":"Si se priorizan el bajo coste y el alto rendimiento, y la tarea está claramente definida, puede evaluarse primero Luna. Si se necesita una mayor comprensión del contexto y capacidad de juicio, pero no un razonamiento avanzado al nivel de Sol, Terra puede ser adecuado."},{"question":"¿No se puede utilizar Sol en todas las etapas de los agentes?","answer":"Se puede, pero podría reducirse la eficiencia de costes. Si Sol se encarga de la planificación y de las decisiones de alto riesgo, mientras que Luna o Terra gestionan la ejecución y las pruebas claramente definidas, es posible reducir el coste total manteniendo la calidad de las etapas importantes."},{"question":"¿El coste por tarea del 6% de Luna es una comparación de precios por token?","answer":"No. El aproximadamente 6% mencionado por OpenAI es el coste estimado por tarea necesario para obtener resultados similares a los del modelo de comparación. No es una cifra obtenida simplemente dividiendo directamente los precios por token, y debe entenderse como una comparación que incluye las tareas de evaluación y la tasa de éxito."},{"question":"¿Cómo debe evaluarse la rentabilidad real de un modelo de API?","answer":"Además del precio de los tokens, deben incluirse la tasa de éxito, el número de reintentos, el coste de las llamadas a herramientas, la latencia de respuesta, el tiempo de revisión humana y el coste de recuperación de errores. El indicador más útil es el coste total por cada resultado que supera la verificación."}],"sources":[{"url":"https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/","title":"Ampliando la frontera entre precio y rendimiento con GPT-5.6 | OpenAI","type":"source"},{"url":"https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/","title":"Cómo GPT-5.6 combina la inteligencia de vanguardia con una eficiencia de vanguardia | OpenAI","type":"source"}],"images":[{"id":395,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"퍼즐, AI 칩 계층, 작업 컨베이어, 감소하는 동전 더미로 표현한 모델 선택 흐름","caption":"AI 모델의 작업 분배와 비용 절감, 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Model selection flow with puzzles, layered AI chips, a task conveyor, and shrinking coin stacks","caption":"The diagram visualizes AI task routing, cost reduction, and output verification.","description":null},"ja":{"alt":"パズル、階層化AIチップ、タスク用コンベア、減っていくコインで示すモデル選択フロー","caption":"AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。","description":null},"es":{"alt":"Flujo de selección de modelos con piezas, chips de IA, cinta de tareas y pilas de monedas decrecientes","caption":"El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.","description":null},"id":{"alt":"Alur pemilihan model dengan puzzle, chip AI bertingkat, konveyor tugas, dan tumpukan koin yang menyusut","caption":"Diagram ini menggambarkan perutean tugas AI, penghematan biaya, dan verifikasi hasil.","description":null},"pt":{"alt":"Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes","caption":"O diagrama mostra o roteamento de tarefas, a redução de custos e a verificação por IA.","description":null},"zh-hant":{"alt":"以拼圖、分層 AI 晶片、任務輸送帶與遞減硬幣堆呈現模型選擇流程","caption":"此概念圖呈現 AI 任務分流、成本降低與結果驗證流程。","description":null},"de":{"alt":"Modellauswahl mit Puzzleteilen, gestaffelten KI-Chips, Aufgabenband und schrumpfenden Münzstapeln","caption":"Die Grafik veranschaulicht KI-Aufgabenverteilung, Kostensenkung und Ergebnisprüfung.","description":null}}},{"id":396,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 모델별 처리 흐름과 속도, 비용, 하드웨어 구성을 비교한 인포그래픽","caption":"세 가지 AI 처리 경로의 성능과 비용 차이 및 연결된 인프라를 시각화한다.","description":null},"en":{"alt":"Infographic comparing AI model processing flows, speed, cost, and hardware infrastructure","caption":"Three AI processing paths visualize differences in performance, cost, and connected infrastructure.","description":null},"ja":{"alt":"AIモデル別の処理フロー、速度、コスト、ハードウェア構成を比較する図","caption":"3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。","description":null},"es":{"alt":"Infografía comparativa de flujos, velocidad, coste e infraestructura de modelos de IA","caption":"Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.","description":null},"id":{"alt":"Infografik perbandingan alur, kecepatan, biaya, dan infrastruktur perangkat keras model AI","caption":"Tiga jalur pemrosesan AI memperlihatkan perbedaan kinerja, biaya, dan infrastruktur yang terhubung.","description":null},"pt":{"alt":"Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA","caption":"Três rotas de processamento de IA mostram diferenças de desempenho, custo e infraestrutura conectada.","description":null},"zh-hant":{"alt":"比較各種 AI 模型處理流程、速度、成本與硬體架構的資訊圖表","caption":"三條 AI 處理路徑呈現效能、成本與連接基礎設施的差異。","description":null},"de":{"alt":"Infografik zum Vergleich von KI-Modellabläufen, Geschwindigkeit, Kosten und Hardware","caption":"Drei KI-Verarbeitungspfade zeigen Unterschiede bei Leistung, Kosten und verbundener Infrastruktur.","description":null}}}],"published_at":"2026-08-01T07:15:42+09:00","updated_at":"2026-08-01T07:15:42+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/es/articles/openai-gpt-5-6-price-performance-model-routing"}