OpenAI ha ajustado su estrategia de precios menos de un mes después del lanzamiento oficial de la serie GPT-5.6. A partir del 30 de julio de...

OpenAI ha ajustado su sistema de precios menos de un mes después del lanzamiento oficial de la serie GPT-5.6.
A partir del 30 de julio de 2026:
Esta actualización no se limita a descuentos temporales. OpenAI afirma que la reducción de precios refleja mejoras en el propio modelo, la arquitectura de razonamiento, el sistema de enrutamiento, la gestión de contexto y el software de agentes que conecta los modelos con las herramientas.
El resultado práctico es una gama más amplia de opciones en entornos de producción.
Luna ahora tiene un precio adecuado para flujos de trabajo de agentes de alta concurrencia y sensibles al coste. Terra sigue siendo la opción equilibrada para el trabajo diario cuando se necesita mayor inteligencia. Sol continúa atendiendo las tareas más exigentes, mientras que Fast mode ofrece una opción de menor latencia cuando el tiempo de espera importa más que la prima por token.
Cuando GPT-5.6 se lanzó el 9 de julio, OpenAI publicó los siguientes precios API estándar de contexto corto:
| Modelo | Precio de entrada original | Precio de salida original |
|---|---|---|
| GPT-5.6 Sol | $5,00 / millón de tokens | $30,00 / millón de tokens |
| GPT-5.6 Terra | $2,50 / millón de tokens | $15,00 / millón de tokens |
| GPT-5.6 Luna | $1,00 / millón de tokens | $6,00 / millón de tokens |
La actualización del 30 de julio ajusta los precios de Terra y Luna:
| Modelo | Nuevo precio de entrada | Nuevo precio de salida | Variación |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 / millón de tokens | $30,00 / millón de tokens | Sin cambios |
| GPT-5.6 Terra | $2,00 / millón de tokens | $12,00 / millón de tokens | Reducción del 20 % |
| GPT-5.6 Luna | $0,20 / millón de tokens | $1,20 / millón de tokens | Reducción del 80 % |
El precio de Luna ahora se ha reducido a una quinta parte del precio de lanzamiento original.
El nuevo precio de Terra equivale a cuatro quintas partes de su precio original.
Sol permanece sin cambios bajo procesamiento Standard, pero Fast mode ahora ofrece a los desarrolladores una opción: hasta 2,5 veces más velocidad de respuesta por el doble del precio por token de Standard.
Los precios de entrada y salida superficiales no muestran la estructura de facturación completa.
GPT-5.6 admite descuentos por entrada en caché y escritura explícita en caché. Las solicitudes con más de 272 000 tokens de entrada también pueden acogerse a precios de contexto largo para toda la solicitud.
Las siguientes tarifas se calculan por millón de tokens:
| Modelo | Entrada | Entrada en caché | Escritura en caché | Salida |
|---|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $0,50 | $6,25 | $30,00 |
| GPT-5.6 Terra | $2,00 | $0,20 | $2,50 | $12,00 |
| GPT-5.6 Luna | $0,20 | $0,02 | $0,25 | $1,20 |
La lectura en caché ofrece un 90 % de descuento en comparación con la entrada normal no almacenada en caché.
La escritura en caché se factura a 1,25 veces el precio de la entrada no almacenada en caché.
Para indicaciones que superen los 272 000 tokens de entrada, OpenAI aplica actualmente las siguientes tarifas para la solicitud completa:
| Modelo | Entrada | Entrada en caché | Escritura en caché | Salida |
|---|---|---|---|---|
| GPT-5.6 Sol | $10,00 | $1,00 | $12,50 | $45,00 |
| GPT-5.6 Terra | $4,00 | $0,40 | $5,00 | $18,00 |
| GPT-5.6 Luna | $0,40 | $0,04 | $0,50 | $1,80 |
La regla de contexto largo implica que
la estimación de costes debe tener en cuenta tanto el número de tokens como si la solicitud supera el umbral de 272 000 tokens.
Una indicación individual muy grande no se procesa facturando los primeros 272 000 tokens a la tarifa de contexto corto y el resto a una tarifa más alta. El multiplicador de contexto largo se aplica a la solicitud completa.
El argumento principal de OpenAI es que el despliegue eficiente de IA comienza por los resultados, no por el nombre del modelo.
Las distintas fases de un mismo flujo de trabajo pueden requerir diferentes niveles de inteligencia, velocidad y fiabilidad.
El modelo ideal para una tarea depende de:
GPT-5.6 Luna está diseñada para trabajos sensibles al coste y de gran volumen.
Su página actual del modelo API lo describe como aproximadamente equivalente al nivel nano utilizado en la serie GPT-5 anterior.
Luna es una opción práctica para los siguientes escenarios:
OpenAI estima que Luna puede ofrecer un rendimiento comparable al de los modelos considerados de vanguardia hace aproximadamente un año, a un coste de unos seis céntimos por dólar por tarea y casi nueve veces más rápido.
Esta comparación se basa en las evaluaciones y la metodología de costes de OpenAI. Los equipos deben validar estos resultados con sus propias cargas de trabajo.
GPT-5.6 Terra es el miembro equilibrado de la serie.
OpenAI lo posiciona donde se encontraban los modelos mini en la era GPT-5, pero con mayor capacidad de agencia y trabajo especializado.
Terra es adecuada para los siguientes trabajos:
GPT-5.6 Sol es el modelo insignia para trabajos complejos y especializados.
Es la mejor opción cuando el modelo debe:
El alias de API gpt-5.6 enruta a gpt-5.6-sol.
Esta actualización de precios hace más prácticos los flujos de trabajo con modelos mixtos.
Un agente de codificación no necesita utilizar Sol para cada token y cada llamada a herramienta.
Una arquitectura posible es:
es muy elevado.
El mismo patrón puede aplicarse más allá de la ingeniería de software.
Un sistema de procesamiento de documentos podría usar Luna para la extracción, Terra para la síntesis y Sol solo cuando el material sea ambiguo o tenga un impacto significativo.
La estrategia de enrutamiento correcta debe determinarse mediante evaluaciones, no mediante suposiciones.
Resultados de clientes compartidos por OpenAI
El anuncio de OpenAI incluye comentarios tempranos de clientes de múltiples usuarios de producción.
Estos ejemplos son reportados por las propias empresas y clientes, no por evaluaciones comparativas independientes.
| Empresa | Uso o resultados reportados |
|---|---|
| Replit | Luna hace que casos de uso antes poco prácticos sean lo suficientemente rentables para explorar |
| Notion | En evaluaciones internas, Terra alcanzó una calidad comparable a la de GPT-5.5 con la mitad del costo de tareas y un tiempo reducido en un 60% |
| Ramp | Terra y Luna lideraron las evaluaciones internas de codificación en eficiencia de costos; Luna se convirtió en la opción predeterminada para tareas de automatización en segundo plano |
| Blitzy | Luna elevó la tasa de reutilización de caché de avisos del 24% al 90%, reduciendo significativamente los costos en comparación con la opción predeterminada anterior |
| Cognition | Luna actúa como un compañero de codificación de menor costo en Devin Fusion, trabajando junto a modelos más grandes |
| Dust | Se reporta que, en tareas de agente similares, Luna es un 40% más rápida y un 40% más económica que la opción predeterminada anterior de la empresa |
Estos ejemplos demuestran que la facturación por tokens no es la única métrica útil.
Un modelo más económico también puede cambiar:
Una métrica más significativa suele ser el costo por resultado exitoso.
OpenAI atribuye la mejora en la relación precio-rendimiento a tres niveles interconectados.
Los modelos de la serie GPT-5.6 están diseñados para completar tareas de manera más directa.
Un modelo que requiere menos tokens de salida, menos reintentos o menos ciclos de razonamiento puede reducir el costo total de la tarea, incluso si el precio de etiqueta permanece sin cambios.
La pila de producción determina la eficiencia con la que el modelo utiliza el hardware.
OpenAI afirma que un software de servicio optimizado puede generar tokens de manera más eficiente y mantener la productividad de los recursos computacionales.
El marco es el software que rodea al modelo y proporciona herramientas, contexto, enrutamiento, estado y control del flujo de trabajo.
OpenAI afirma que una mejor gestión del contexto ayuda a los agentes a evitar repetir trabajo ya completado.
Esto puede reducir:
Estos tres niveles se influyen mutuamente.
Un modelo más fuerte puede encontrar espacios de optimización en la pila de servicios. Esta optimización reduce los costos, haciendo que el uso de agentes a mayor escala sea económicamente viable. Más uso, a su vez, crea más oportunidades para mejorar el sistema.
Una de las afirmaciones más llamativas del anuncio es que GPT-5.6 Sol contribuyó a los esfuerzos internos de eficiencia de OpenAI.
En un proceso de ingeniería liderado por humanos, OpenAI afirma que Sol:
OpenAI informa que las optimizaciones del kernel redujeron el costo de servicio de extremo a extremo del modelo en aproximadamente un 20%.
La compañía también afirma que estos experimentos mejoraron la eficiencia de generación de tokens en más de un 15%.
Estos son resultados internos de OpenAI y aún no han sido reproducidos de manera independiente mediante evaluaciones comparativas públicas.
Un punto aún más importante es que los modelos se están convirtiendo gradualmente en parte del proceso de mejora de la infraestructura en la que operan.
Esto crea un ciclo de retroalimentación de ingeniería más estrecho:
Modelo más fuerte
→ Mejor optimización de infraestructura
→ Menores costos de servicio
→ Aplicaciones más amplias
→ Más retroalimentación e inversión
→ Modelo de próxima generación más potente
Un precio más bajo no significa que OpenAI necesite menos cómputo total.
La compañía cree que lograr inteligencia suficiente requiere ambas cosas:
Lo primero expande la capacidad total.
Lo segundo mejora la cantidad de trabajo útil completado por unidad de hardware.
OpenAI afirma que está construyendo una cartera diversificada de infraestructura y asignando cargas de trabajo a los sistemas más adecuados para ejecutarlas.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Esto respalda ambos extremos de la serie GPT-5.6:
Ejemplos de cargas de trabajo que podrían ejecutarse más fácilmente a escala incluyen:
Mientras tanto, cuando el valor de obtener una respuesta más rápida justifica el costo adicional, las solicitudes complejas de Sol pueden usar el modo Fast.
El modo Fast es el nuevo nombre del nivel de servicio de procesamiento prioritario de OpenAI.
Las solicitudes API existentes que usan:
"service_tier": "priority"
siguen siendo compatibles.
Los desarrolladores también pueden usar:
"service_tier": "fast"
Para GPT-5.6 Sol, OpenAI afirma que el modo Fast puede ser hasta 2,5 veces más rápido que el procesamiento estándar, manteniendo la misma inteligencia del modelo.
El costo es el precio.
Actualmente, el modo Fast de GPT-5.6 Sol tiene un precio de 2 veces el precio estándar de los tokens de API.
Los descuentos para entrada en caché siguen aplicándose.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Revisa este plan de migración e identifica los tres supuestos de mayor riesgo.",
service_tier="fast",
)
print(response.output_text)
El modo Fast está disponible para los modelos compatibles a través de la API de Respuestas y la API de Completions de Chat.
Para GPT-5.6 y modelos anteriores, incluso si la solicitud utiliza el nuevo nombre fast, el objeto de respuesta puede reportar el nivel de servicio como priority.
El modo Fast no es automáticamente la mejor configuración para todas las solicitudes de Sol.
Es más útil cuando la latencia afecta directamente el valor del resultado.
Ejemplos incluyen:
Tráfico empresarial sensible a la latencia.
Para los siguientes escenarios, el procesamiento estándar puede ser más económico:
El sobreprecio de dos veces en tokens solo tiene sentido cuando el valor creado por la finalización posterior supera su costo.
Los nuevos precios hacen que Luna y Terra sean más económicas, pero el caché de avisos también puede tener un impacto enorme en agentes de ejecución prolongada.
Cada ronda en un ciclo de agente puede reenviar:
Sin caché, la aplicación puede terminar pagando repetidamente por el mismo prefijo.
GPT-5.6 admite tanto el caché automático como los puntos de interrupción explícitos de caché.
OpenAI actualmente factura de la siguiente manera:
Las escrituras de caché cuestan más que la entrada normal, pero las lecturas posteriores obtienen un descuento significativo.
El caché es más útil cuando el mismo prefijo estable se reutiliza suficientes veces para recuperar el mayor costo de escritura.
Las aplicaciones deben rastrear:
El actual
La página de modelos de API enumera varias especificaciones compartidas:
| Especificación | Sol | Terra | Luna |
|---|---|---|---|
| Ventana de contexto | 1,050,000 tokens | 1,050,000 tokens | 1,050,000 tokens |
| Salida máxima | 128,000 tokens | 128,000 tokens | 128,000 tokens |
| Fecha límite de conocimiento | 16 de febrero de 2026 | 16 de febrero de 2026 | 16 de febrero de 2026 |
| Entrada/salida de texto | Compatible | Compatible | Compatible |
| Entrada de imágenes | Compatible | Compatible | Compatible |
| Tokens de razonamiento | Compatible | Compatible | Compatible |
| Llamada de funciones | Compatible | Compatible | Compatible |
| Salida estructurada | Compatible | Compatible | Compatible |
| Ajuste fino | No compatible | No compatible | No compatible |
Los tres modelos están disponibles a través de la API de Responses.
La página de modelos también enumera una amplia compatibilidad con herramientas, pero la disponibilidad de funciones específicas puede variar según el endpoint, la cuenta, el producto y la fase de lanzamiento.
OpenAI indica que GPT-5.6 Terra y Luna siguen disponibles en las siguientes plataformas:
El acceso actual descrito en el anuncio de precios incluye:
| Grupo de planes | Acceso a GPT-5.6 en ChatGPT Work y Codex |
|---|---|
| Free y Go | Terra |
| Plus, Pro, Business, Enterprise | Terra y Luna |
Sol tiene sus propias reglas de acceso en ChatGPT, ChatGPT Work, Codex y API.
La actualización del 30 de julio no redujo los precios de suscripción de ChatGPT ni de Codex.
Tampoco aumentó los presupuestos de cuotas declarados.
Por el contrario, Luna y Terra ahora consumen menos créditos debido a su menor costo de uso subyacente.
OpenAI también indicó que la actualización de precios comenzaría a implementarse a través de AWS el mismo día del anuncio. Los precios de los modelos a través de plataformas de terceros pueden diferir de los precios directos de la API de OpenAI.
Elegir el modelo GPT-5.6 correcto
Un proceso de selección práctico puede seguir cinco pasos.
Escriba qué constituye éxito.
Evite elegir modelos basándose únicamente en etiquetas amplias como "programación" o "investigación".
Las tareas de clasificación de bajo riesgo y las migraciones de bases de datos en entornos de producción no deberían usar las mismas reglas de decisión.
Para tareas difíciles, pruebe primero Sol para conocer el nivel de calidad más alto disponible.
Mida si los modelos de menor costo conservan la calidad que realmente importa.
Realice un seguimiento de:
No optimice únicamente el precio más barato del token de entrada.
GPT-5.6 Luna ahora tiene un precio estándar de token de entrada de contexto corto de 0.20 USD por millón, token de entrada en caché a 0.02 USD por millón y token de salida a 1.20 USD por millón. El precio de escritura en caché es de 0.25 USD por millón de tokens.
GPT-5.6 Terra ahora tiene un precio estándar de token de entrada de contexto corto de 2.00 USD por millón, token de entrada en caché a 0.20 USD por millón y token de salida a 12.00 USD por millón. El precio de escritura en caché es de 2.50 USD por millón de tokens.
Su precio estándar de token no ha cambiado. Sol sigue siendo de 5 USD por millón de tokens de entrada de contexto corto y 30 USD por millón de tokens de salida, mientras que el modo Fast ofrece una velocidad de procesamiento 2.5 veces mayor al doble del precio estándar.
OpenAI renombró Priority Processing a modo Fast el 30 de julio de 2026. Las solicitudes existentes que usan service_tier: "priority" siguen siendo compatibles, y las nuevas solicitudes pueden usar service_tier: "fast".
La página de modelos actual indica que los prompts con más de 272,000 tokens de entrada utilizarán tarifas de entrada y salida más altas para toda la solicitud. Los desarrolladores deben considerar este umbral al estimar los costos de prompts extremadamente grandes.
OpenAI posiciona a Luna como el modelo orientado a trabajos de alto rendimiento sensibles al costo. Cuando Luna no ofrece suficiente calidad, Terra es la opción equilibrada, mientras que Sol está orientado a las tareas profesionales más difíciles.
No. OpenAI indica que los precios de suscripción y los presupuestos de cuotas se mantienen sin cambios. Terra y Luna ahora consumen menos créditos en los flujos de trabajo compatibles con productos de pago.
Los precios directos de la API de OpenAI cambiaron el 30 de julio. OpenAI indicó que los precios de AWS comenzarían a implementarse más tarde ese mismo día, pero los precios y la disponibilidad en plataformas de terceros pueden variar, por lo que los usuarios deben verificar las tarifas actuales del proveedor.
adecuado para cargas que necesitan inteligencia y menores costos.
/com/api/docs/guides/latest-model): recomendaciones oficiales sobre selección de modelos, migración, inferencia, caché y flujos de trabajo.
En la actualización del 30 de julio, OpenAI redujo el precio estándar de la API de GPT-5.6 Luna en un 80% y el de Terra en un 20%. El precio estándar de Sol se mantuvo sin cambios, mientras que el nuevo modo rápido puede acelerar la velocidad de respuesta de la API hasta 2.5 veces, con una tarifa de tokens del doble.
Este anuncio gira en torno a una estrategia más amplia de relación costo-rendimiento. OpenAI afirma que está mejorando los modelos, la pila de inferencia, el enrutamiento, la gestión de contexto y los marcos de agentes para reducir el tiempo, los tokens o la potencia de cómputo necesarios para cada tarea exitosa.
Para los desarrolladores, la elección correcta no consiste simplemente en seleccionar el modelo más barato. Luna está orientada a la ejecución de alto rendimiento, Terra equilibra costo e inteligencia, y Sol se encarga de los trabajos más complejos. Los ahorros derivados del enrutamiento híbrido de modelos, el caché, la evaluación y la medición del costo por éxito podrían superar con creces los de simplemente cambiar de modelo.
El cambio fundamental es que GPT-5.6 ahora ofrece un rango de trabajo más amplio: los niveles Luna y Terra proporcionan inteligencia cotidiana más económica, mientras que, cuando la latencia justifica un mayor costo, se puede acceder a inteligencia de vanguardia más rápida a través de Sol.
Este archivo Markdown es una adaptación editorial independiente del artículo oficial. Conserva el tema, el orden de los hechos y el significado práctico, pero no reproduce textualmente la redacción de OpenAI ni las citas de clientes.
Empieza con una sola frase y obtén un sitio completo en minutos.