Introducción
OpenAI ha realizado ajustes significativos de precios en la familia GPT-5.6.
Desde el 30 de julio de 2026, la compañía ha reducido el precio de API de GPT-5.6 Luna en un 80% y el de GPT-5.6 Terra en un 20%. El modelo insignia GPT-5.6 Sol mantiene su precio estándar sin cambios, pero OpenAI ha lanzado un modo rápido que procesa hasta 2,5 veces más rápido que el modo estándar, manteniendo el mismo nivel de inteligencia del modelo.
Este cambio llega justo después de que OpenAI publicara un informe de análisis técnico que muestra cómo GPT-5.6 Sol ayudó a optimizar los sistemas utilizados para servir a la propia GPT-5.6. Según OpenAI, las mejoras en los kernels de GPU de nivel de producción redujeron el costo de servicio de extremo a extremo en un 20%, mientras que las mejoras en la decodificación especulativa aumentaron la eficiencia de generación de tokens en más de un 15%.
El resultado es que OpenAI está adoptando una estrategia más agresiva en lo que denomina la frontera de relación precio-rendimiento: equiparar la cantidad de inteligencia utilizada con el valor económico de la tarea.

Para los desarrolladores, el cambio más importante es claro: Luna ahora es sustancialmente más económica para cargas de trabajo de agentes de alto rendimiento, Terra tiene un costo diario más bajo, y Sol puede adquirirse a un nivel de servicio superior cuando la latencia importa más que el precio.
- Luna baja un 80%, Terra un 20% y Sol lanza el modo rápido
La actualización de precios del 30 de julio cubre toda la familia GPT-5.6, pero los ajustes varían según el modelo.
GPT-5.6 Luna: la mayor reducción de precio
Luna ha recibido el recorte de precio más agresivo.
Su precio estándar de API se ha ajustado desde los siguientes niveles:
| Tipo de token | Precio anterior | Precio nuevo | Cambio |
|---|---|---|---|
| Entrada | 1,00 USD / 1M tokens | 0,20 USD / 1M tokens | -80% |
| Salida | 6,00 USD / 1M tokens | 1,20 USD / 1M tokens | -80% |
OpenAI describe a Luna como el modelo más rápido y asequible de la familia GPT-5.6, posicionándolo para cargas de trabajo de alto rendimiento sensibles al costo.
Esto incluye las siguientes tareas:
- Clasificación
- Extracción de información
- Agentes en segundo plano
- Trabajo de codificación diario
- Generación de pruebas
- Flujos de trabajo con salida estructurada
- Subagentes que utilizan herramientas
- Procesamiento de documentos a gran escala
El precio más bajo cambia especialmente la economía de los bucles de agentes, donde una sola solicitud de usuario puede implicar múltiples llamadas al modelo en lugar de una única finalización simple.
OpenAI afirma que Luna puede utilizar herramientas y completar flujos de trabajo de múltiples pasos, lo que hace viable delegar más trabajo a modelos de menor costo sin tener que reservar el comportamiento de agente para el nivel de vanguardia más caro.
GPT-5.6 Terra: una reducción menor pero significativa
El precio estándar de API de Terra es ahora:
| Tipo de token | Precio anterior | Precio nuevo | Cambio |
|---|---|---|---|
| Entrada | 2,50 USD / 1M tokens | 2,00 USD / 1M tokens | -20% |
| Salida | 15,00 USD / 1M tokens | 12,00 USD / 1M tokens | -20% |
Terra sigue siendo el modelo de gama media de la familia GPT-5.6.
Está diseñado para cargas de trabajo que requieren capacidades de razonamiento más sólidas que Luna, pero que no necesariamente justifican el mayor costo de Sol.
Las aplicaciones típicas incluyen:
- Agentes empresariales cotidianos
- Asistencia de codificación
- Preguntas y respuestas en el espacio de trabajo
- Análisis de documentos
- Investigación de alcance limitado
- Flujos de trabajo profesionales de múltiples pasos
OpenAI menciona a Notion como uno de los clientes que utiliza Terra para cargas de trabajo de agentes personales, como preguntas y respuestas en el espacio de trabajo sensibles a la latencia y tareas de alcance limitado.
GPT-5.6 Sol mantiene su precio estándar sin cambios
El precio estándar de API de Sol permanece sin cambios:
| Tipo de token | Precio estándar |
|---|---|
| Entrada | 5,00 USD / 1M tokens |
| Salida | 30,00 USD / 1M tokens |
El cambio en Sol no es una reducción de precio.
En su lugar, OpenAI ha lanzado el modo rápido.
Modo rápido de Sol: hasta 2,5 veces más velocidad
El modo rápido reemplaza la terminología anterior de "prioridad de procesamiento" de OpenAI.
Para GPT-5.6 Sol, OpenAI afirma que el modo rápido es hasta 2,5 veces más rápido que el procesamiento estándar, con el mismo nivel de inteligencia del modelo.
El costo es el precio.
El modo rápido cuesta el doble que el procesamiento estándar.
Para Sol, esto significa:
| Tipo de token | Estándar | Modo rápido |
|---|---|---|
| Entrada | 5,00 USD / 1M | 10,00 USD / 1M |
| Entrada en caché | 0,50 USD / 1M | 1,00 USD / 1M |
| Salida | 30,00 USD / 1M | 60,00 USD / 1M |
Las solicitudes existentes a la API que utilizan:
service_tier="priority"
mantienen compatibilidad hacia atrás y se enrutan al modo rápido.
OpenAI también admite:
service_tier="fast"
como identificador de servicio renombrado.
El modo rápido es útil cuando el costo de esperar supera el costo de una inferencia más rápida.
Los ejemplos incluyen:
- Agentes de codificación interactivos
- Flujos de trabajo de producción sensibles al tiempo
- Asistencia de analista en tiempo real
- Operaciones de clientes de alto valor
- Tareas de agentes complejas donde la latencia se acumula en múltiples pasos
Un flujo de trabajo que requiere 20 o 30 llamadas al modelo puede resultar mucho más lento en general que una única respuesta de chat, incluso si cada llamada individual tiene baja latencia. Por lo tanto, en sistemas de agentes, un procesamiento más rápido puede tener un impacto desproporcionadamente importante.
También cambia la medición de uso en ChatGPT Work y Codex
Los precios más bajos de Luna y Terra también se reflejan en la forma en que se calcula el uso en ChatGPT Work y Codex.
OpenAI afirma:
- Los usuarios gratuitos y los usuarios de Go pueden utilizar Terra.
- Los usuarios de Plus, Pro, Business y Enterprise pueden elegir entre Terra y Luna.
- Los precios de suscripción y los presupuestos de cuota permanecen sin cambios.
- Dado que Luna y Terra son más económicos, ahora consumen menos créditos al utilizarlos.
Esto no significa que las suscripciones de pago sean más baratas.
El cambio significa que, cuando los usuarios eligen Luna o Terra, la misma cuota dura más tiempo.

La relación precio-rendimiento se está convirtiendo en una métrica más importante para los modelos
OpenAI publicó un gráfico de precio frente a inteligencia basado en el Índice de Inteligencia de Artificial Analysis v4.1 para ilustrar el nuevo posicionamiento de Luna.
El gráfico sitúa a GPT-5.6 Luna por encima de los 50 puntos en el índice de inteligencia, al tiempo que muestra que después del ajuste de precios, uno de los Luna
El coste estimado de la tarea configurada es de aproximadamente 0,05 USD.
Estos datos no deben confundirse con el precio de una única llamada a la API.
Artificial Analysis calcula el coste por tarea de índice de inteligencia basándose en el uso de tokens del modelo y un método ponderado de puntos de referencia. El coste real de las solicitudes de producción depende de:
-
El tamaño de la entrada
-
El tamaño de la salida
-
La profundidad del razonamiento
-
El almacenamiento en caché de avisos
-
El número de llamadas a herramientas
-
El número de rondas de ejecución del agente
-
La facturación de contextos largos
-
Los mecanismos de reintento
Antes de la reducción de precios del 30 de julio, Artificial Analysis informó de que GPT-5.6 Luna tenía un índice de inteligencia de aproximadamente 51 en su configuración de razonamiento máximo.
Los nuevos precios de token, más bajos, acercan aún más a Luna al extremo de bajo coste de la curva de "inteligencia-coste".
El mensaje más amplio que transmite OpenAI es que las empresas no deberían utilizar el modelo más caro en cada paso.
Un flujo de trabajo podría utilizar primero Sol para eliminar ambigüedades y elaborar un plan, y luego asignar a Luna las tareas de implementación, prueba o trabajo repetitivo bien definido.
Cuando los modelos de nivel inferior ya tienen la capacidad de usar herramientas y completar flujos de trabajo de varios pasos, este tipo de enrutamiento de modelos resulta mucho más atractivo.
- GPT-5.6 ayudó a optimizar la infraestructura que ejecuta GPT-5.6
El día anterior a esta reducción de precios, OpenAI publicó un artículo técnico detallado sobre cómo GPT-5.6 se ha vuelto más eficiente.
Lo más inusual de esta historia es que el propio GPT-5.6 Sol participó en el proceso de optimización.
OpenAI afirma que sus ingenieros utilizaron Sol a través de Codex para analizar los sistemas de producción, escribir código de rendimiento, probar alternativas y supervisar los experimentos.
La empresa describió tres niveles principales de optimización:
- El conjunto de herramientas de agentes
- La orquestación de API y solicitudes
- La inferencia del modelo en la infraestructura de GPU
Sol ayudó a optimizar los núcleos de GPU de producción
En la capa de inferencia, OpenAI afirma que GPT-5.6 Sol reescribió y optimizó de forma autónoma los núcleos de producción.
Los núcleos de GPU son programas de bajo nivel responsables de ejecutar eficientemente operaciones matemáticas en el hardware acelerador.
Incluso si la arquitectura subyacente del modelo no cambia, los movimientos de memoria, la sincronización, la programación o la disposición de datos ineficientes pueden provocar que los recursos de GPU, que son caros, no se aprovechen al máximo.
OpenAI afirma que Sol ayudó a identificar los siguientes tipos de cálculos optimizables:
- Los que se pueden precalcular
- Los que se pueden evitar
- Los que se pueden paralelizar
- Los que se pueden reordenar
- Los que se pueden implementar con núcleos más eficientes
La empresa mencionó específicamente dos tecnologías de programación de GPU, Triton y Gluon, que participaron en este trabajo.
Según OpenAI, las mejoras en los núcleos y las optimizaciones de servicio relacionadas redujeron el coste de servicio de extremo a extremo de GPT-5.6 en un 20 %.
Sol también mejoró la decodificación especulativa
Otra optimización importante provino de la decodificación especulativa.
Una versión simplificada de la decodificación especulativa es la siguiente:
- Un modelo borrador más pequeño predice varios tokens posteriores posibles.
- El modelo principal evalúa estos tokens candidatos en paralelo.
- Los tokens aceptados pueden emitirse sin la misma cantidad de trabajo de generación secuencial.
Por lo tanto, la calidad del modelo borrador es crucial.
OpenAI afirma que GPT-5.6 Sol diseñó y ejecutó cientos de experimentos sobre la arquitectura del modelo especulativo, con cambios que incluyen:
- Escala
- Estructura
- Características
- Configuración de entrenamiento
Sol también supervisa el proceso de entrenamiento e interviene cuando se producen fallos de hardware o inestabilidad en el entrenamiento.
OpenAI afirma que las mejoras resultantes aumentaron la eficiencia de generación de tokens en más de un 15 %.

El equilibrio de carga también es importante
El coste del modelo no depende únicamente del código que se ejecuta dentro de una sola GPU.
Las solicitudes deben enrutarse entre los siguientes niveles:
- Regiones
- Centros de datos
- Tipos de aceleradores
- Clústeres
- Instancias de modelo
- Subredes de modelo
- Núcleos de cómputo
Si la carga de trabajo no se distribuye de manera equitativa y parte del hardware queda inactivo, los costes pueden seguir siendo elevados incluso con aceleradores de gran rendimiento.
OpenAI afirma que Sol ayudó a analizar el tráfico de producción, identificar las causas del desequilibrio de carga, probar estrategias de enrutamiento alternativas y ajustar las reglas heurísticas utilizadas para distribuir las solicitudes.
Este tipo de optimización operativa puede aumentar el rendimiento general sin añadir la inversión en hardware correspondiente.
La gestión del contexto reduce el cálculo redundante
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
OpenAI también optimizó los marcos de agentes utilizados por sistemas como Codex y ChatGPT Work.
Un agente puede necesitar múltiples llamadas al modelo y a herramientas antes de devolver un resultado final.
Por ejemplo, Codex podría:
- Revisar el código fuente.
- Buscar el historial de despliegues.
- Leer informes de incidentes.
- Editar archivos.
- Ejecutar pruebas.
- Comprobar errores.
- Modificar el código.
- Volver a ejecutar las pruebas.
Cada bucle puede llevar contexto, definiciones de herramientas, resultados anteriores e información del entorno.
Si este contexto crece innecesariamente, también aumentan el coste y la latencia.
OpenAI afirma que su marco de agentes emplea técnicas como el descubrimiento diferido, que solo expone herramientas, habilidades, plugins e integraciones MCP cuando es necesario.
La salida de las herramientas está limitada por defecto a 10 000 tokens, a menos que el modelo solicite un límite diferente.
Esto reduce la posibilidad de que resultados grandes de herramientas llenen innecesariamente la ventana de contexto.
Historial de solo adición para preservar el caché de avisos
Los bucles de agentes suelen reutilizar las mismas instrucciones y el mismo contexto varias veces.
El caché de avisos evita recalcular los prefijos de aviso estables.
Pero el caché solo funciona si el prefijo repetido permanece exactamente igual.
OpenAI afirma que su marco mantiene la característica de solo adición del historial visible para el modelo:
- Los nuevos mensajes se añaden al final.
- Los resultados de las herramientas se añaden al final.
- Las actualizaciones del entorno se añaden al final.
- La ordenación de las herramientas es determinista.
- La configuración de aprobación en tiempo de ejecución no se gestiona en las definiciones de herramientas.
Este diseño mejora la tasa de reutilización del caché de avisos en Codex y ChatGPT Work.
El principio básico es sencillo:
El modelo es más barato, no solo porque su coste de token es menor, sino porque los sistemas que lo rodean evitan desde el principio generar y procesar tokens innecesarios.
El bucle de eficiencia puede producir efectos compuestos
OpenAI describe esto como un bucle de retroalimentación.
Los modelos más potentes ayudan a los ingenieros a mejorar:
- Los núcleos de GPU
- El enrutamiento
- La decodificación especulativa
- El caché
- La configuración de la carga de trabajo
- La orquestación de agentes
Estas mejoras reducen el coste y la latencia.
Una infraestructura más eficiente hace, a su vez, que sea más económico ejecutar modelos más potentes a mayor escala.
OpenAI cree que esto puede acortar el ciclo que va desde la investigación y el desarrollo de modelos hasta el despliegue a gran escala, acelerando así el ritmo de innovación en IA.
Hay que encontrar la próxima generación de ganancias de optimización.
La reducción de precios de Luna y Terra del 30 de julio es el resultado más visible hasta la fecha orientado al cliente.
- Reacción de los desarrolladores: Luna recibe más atención y los competidores se enfrentan a una nueva presión de precios
El informe original en chino también destacó la entusiasta reacción de la comunidad de desarrolladores tras el anuncio.
Algunos usuarios se centraron en la magnitud de la reducción de precios de Luna.
Un recorte del 80 % es mucho mayor que los ajustes de precios graduales habituales en las API de vanguardia.
Otros consideran que Luna estaba infravalorada incluso antes de la reducción, especialmente para cargas de trabajo de agentes, donde los modelos de menor coste pueden encargarse de tareas de ejecución rutinarias bajo la guía de un planificador más potente.
Este ajuste de precios también provocó de inmediato comparaciones con otros modelos centrados en el coste, incluido Kimi K3.
Un meme viral en la comunidad describía la situación como: Luna empezaba de repente a competir por los usuarios que habían atraído los bajos precios de Kimi K3.
El meme era divertido, pero no es una prueba de referencia técnica, por lo que no se ha incluido en las imágenes del texto.
Los desarrolladores preguntaron de inmediato si Anthropic respondería
Otra reacción habitual fue mencionar a @Anthropic para preguntar si los precios de la API de Claude se ajustarían en consecuencia.
Esta reacción refleja un cambio más amplio en el panorama competitivo de los grandes modelos.
Hace un año, la competencia más visible se centraba en:
- Las puntuaciones de los puntos de referencia
- La capacidad de codificación
- La ventana de contexto
- Las capacidades multimodales
Estas dimensiones siguen siendo importantes.
Pero los desarrolladores que ejecutan agentes de producción se centran cada vez más en:
- El coste por tarea completada
- La latencia
- El uso de tokens de salida
- La eficiencia del caché de avisos
- El número de llamadas a herramientas
- La fiabilidad
- La flexibilidad del enrutamiento de modelos
El token más barato no siempre es el flujo de trabajo más barato.
Del mismo modo, el modelo más inteligente no es necesariamente el mejor modelo para cada paso de un flujo de trabajo.
La reducción de precio de Luna hace que el enrutamiento de modelos sea más atractivo
Supongamos que una tarea consta de cinco fases:
- Comprender una pregunta ambigua.
- Elaborar un plan.
- Modificar archivos de rutina.
- Escribir pruebas.
- Revisar los resultados.
Un equipo podría usar Sol en las fases 1 y 2.
Cuando el trabajo está claramente especificado, Luna puede encargarse de las fases 3 a 5.
Cuanto más barata sea Luna, mayor será el incentivo para desviar el trabajo de agente rutinario desde el modelo insignia.
Esto no significa que Luna se acerque a Sol en todas las capacidades.
Significa que el valor de un modelo más pequeño depende de si es lo suficientemente inteligente para la tarea específica que se le asigna.
La métrica importante es el costo por resultado exitoso
La nueva narrativa de OpenAI enfatiza repetidamente el valor por dólar.
Esto es más útil que centrarse únicamente en el precio de los tokens.
Las evaluaciones en producción deberían rastrear:
- Tasa de éxito de tareas
- Tokens de entrada
- Tokens de salida
- Reutilización de caché de entrada
- Rondas de modelo
- Llamadas a herramientas
- Latencia de extremo a extremo
- Tasa de reintentos
- Tiempo de corrección humana
- Costo total por tarea exitosa
Un modelo que cuesta solo una quinta parte por token puede seguir siendo caro si necesita muchos reintentos.
Un modelo más caro que complete el trabajo con menos pasos podría, en cambio, tener un costo total menor.
Los nuevos precios de Luna hacen que el cálculo favorezca más a los modelos pequeños, pero los desarrolladores aún necesitan
evaluaciones específicas para sus cargas de trabajo.
Conclusión: la competencia entre modelos se está desplazando hacia la relación inteligencia-costo
Los eventos del 29 y 30 de julio muestran que OpenAI está impulsando simultáneamente dos ideas relacionadas.
Primero, GPT-5.6 se usa cada vez más para mejorar la infraestructura que ejecuta el propio GPT-5.6.
Segundo, la compañía está convirtiendo parte de estas ganancias de eficiencia en precios más bajos para los clientes y opciones de servicio más rápidas.
Esto cambia el panorama competitivo.
La siguiente fase del mercado de modelos no es solo:
¿Qué modelo es más inteligente?
También incluye:
¿Cuánta inteligencia útil pueden comprar los desarrolladores por cada dólar gastado y cada segundo de latencia esperado?
La reducción del 80% en el precio de Luna hace que esta cuestión sea especialmente relevante.
Terra se ha vuelto más barata para el trabajo profesional cotidiano.
Sol sigue siendo el modelo de gama alta, pero el modo Fast permite a los desarrolladores pagar más por mayor velocidad cuando el tiempo es crítico.
A medida que la calidad de los modelos se acerca en más tareas, las empresas que logren que el mismo hardware realice más trabajo útil —y conviertan esas ganancias de eficiencia en mejores precios— podrían obtener una ventaja competitiva cada vez más importante.
Preguntas frecuentes
¿Cuál es el nuevo precio de la API de GPT-5.6 Luna?
Desde el 30 de julio de 2026, OpenAI ha fijado el precio de GPT-5.6 Luna en modo de procesamiento estándar en 0,20 USD por millón de tokens de entrada y 1,20 USD por millón de tokens de salida. Esto representa una reducción del 80% respecto al precio inicial de 1 USD/6 USD por millón de tokens.
¿Cuál es el nuevo precio de GPT-5.6 Terra?
GPT-5.6 Terra tiene actualmente un precio en modo de procesamiento estándar de 2 USD por millón de tokens de entrada y 12 USD por millón de tokens de salida. OpenAI indica que esto supone una reducción del 20% respecto al precio anterior de 2,50 USD/15 USD por millón de tokens.
¿Se ha reducido el precio de GPT-5.6 Sol?
No. El precio estándar de la API de Sol sigue siendo de 5 USD por millón de tokens de entrada y 30 USD por millón de tokens de salida. El cambio principal es la introducción del modo Fast.
¿Qué es el modo Fast de GPT-5.6 Sol?
El modo Fast es el nivel de procesamiento de API más rápido de OpenAI, que reemplaza la denominación anterior de Priority Processing. Para GPT-5.6 Sol, OpenAI afirma que, al doble del precio estándar por token, puede aumentar la velocidad de procesamiento hasta 2,5 veces en comparación con el modo estándar, sin cambiar el nivel de inteligencia del modelo.
¿Las solicitudes antiguas de Priority Processing siguen siendo válidas?
Sí. OpenAI afirma que las solicitudes que usan el nivel de servicio priority siguen siendo compatibles con versiones anteriores y usarán automáticamente el modo Fast. Los desarrolladores también pueden usar el valor de nivel de servicio fast.
¿GPT-5.6 realmente ayudó a optimizarse a sí mismo?
OpenAI afirma que GPT-5.6 Sol, utilizado a través de Codex en procesos de ingeniería supervisados por humanos, ayudó a analizar tráfico de producción, reescribir núcleos de GPU, ejecutar cientos de experimentos de decodificación especulativa y supervisar el proceso de entrenamiento. OpenAI atribuye parte de los resultados —una reducción del 20% en el costo de servicio de extremo a extremo y una mejora de más del 15% en la eficiencia de generación de tokens— a estos trabajos.
¿La reducción de precios cambiará las suscripciones de ChatGPT?
Los precios de suscripción y los presupuestos de cuotas no cambiarán. OpenAI afirma que, debido a los precios subyacentes más bajos, Luna y Terra ahora consumen menos créditos en Codex y ChatGPT Work.
¿Es Luna ahora el mejor modelo para todas las cargas de trabajo de agentes?
No. Luna es mucho más barata, pero la selección del modelo sigue dependiendo de la dificultad de la tarea y de la tasa de error aceptable. La estrategia habitual es: usar modelos más potentes para tareas de planificación ambiguas y modelos más baratos para tareas de ejecución bien definidas.
Herramientas relacionadas
- OpenAI API: la plataforma de desarrolladores de OpenAI para acceder a los modelos GPT-5.6 y a los servicios de API.
- GPT-5.6 Sol: especificaciones oficiales del modelo insignia GPT-5.6.
- GPT-5.6 Terra: documentación oficial del nivel equilibrado de GPT-5.6.
- GPT-5.6 Luna: documentación oficial del nivel de GPT-5.6 sensible al costo.
- Codex: el entorno de codificación con agentes de OpenAI, utilizado en parte de los trabajos de optimización de GPT-5.6.
- Artificial Analysis: una plataforma independiente de análisis de modelos que cubre inteligencia, velocidad, uso de tokens y costo por tarea.
Enlaces relacionados
- OpenAI: avanzando en la frontera precio-rendimiento con GPT-5.6: anuncio oficial de OpenAI del 30 de julio sobre las reducciones de precio de Luna y Terra y el modo Fast de Sol.
- OpenAI: cómo GPT-5.6 combina inteligencia de frontera con eficiencia de frontera: detalles técnicos sobre equilibrio de carga, núcleos de GPU, decodificación especulativa, gestión de contexto y caché de prompts.
- OpenAI Fast Mode: documentación oficial sobre procesamiento de API más rápido y precios del modo Fast.
- OpenAI GPT-5.6 Launch: anuncio original de disponibilidad general de la familia GPT-5.6 y contexto de evaluaciones comparativas.
- Artificial Analysis: GPT-5.6 benchmarks: análisis independiente de inteligencia, rendimiento de codificación, velocidad y costo de GPT-5.6 antes de la reducción de precios del 30 de julio.
- [Artificial Analysis GPT-5.6 Luna](https://artificialanalysis.
ai/models/gpt-5-6-luna/): Información detallada sobre la metodología a nivel de modelo y el índice de inteligencia de Luna.
- Catálogo de modelos de OpenAI: Catálogo oficial de modelos API y especificaciones actuales de los modelos.
Resumen
OpenAI ha reducido el precio de la API de GPT-5.6 Luna en un 80%, y el de Terra en un 20%, mientras mantiene sin cambios el precio de Sol Standard. Sol, en cambio, ha añadido un nuevo modo Fast que puede aumentar la velocidad de procesamiento de la API hasta 2.5 veces, pero a un precio del doble que el modo Standard.
Este momento está estrechamente relacionado con el trabajo de ingeniería reciente de OpenAI. La compañía afirma que GPT-5.6 Sol ayudó a optimizar los núcleos de GPU, la decodificación especulativa, el equilibrio de carga y la infraestructura de agentes, lo que redujo los costos de servicio de extremo a extremo en un 20% y logró mejoras de más del 15% en la eficiencia de generación de tokens en parte de la pila tecnológica.
Para los desarrolladores, el resultado es una gama más amplia de relación costo-beneficio: Sol para las tareas más difíciles, Terra para tareas profesionales equilibradas, y Luna a un precio más bajo para la ejecución de agentes a gran escala.
La actualización de GPT-5.6 demuestra que la competencia en modelos de vanguardia se centra cada vez más en el costo por resultado exitoso, no solo en el nivel bruto de inteligencia de referencia.



