Introducción
OpenAI ha ajustado su sistema de precios menos de un mes después del lanzamiento oficial de la serie GPT-5.6.
A partir del 30 de julio de 2026:
- GPT-5.6 Luna reduce su precio en un 80 %.
- GPT-5.6 Terra reduce su precio en un 20 %.
- GPT-5.6 Sol mantiene su precio Standard original, pero añade una opción de procesamiento API más rápida.
- Priority Processing pasa a denominarse Fast mode.
Esta actualización no se limita a descuentos temporales. OpenAI afirma que la reducción de precios refleja mejoras en el propio modelo, la arquitectura de razonamiento, el sistema de enrutamiento, la gestión de contexto y el software de agentes que conecta los modelos con las herramientas.
El resultado práctico es una gama más amplia de opciones en entornos de producción.
Luna ahora tiene un precio adecuado para flujos de trabajo de agentes de alta concurrencia y sensibles al coste. Terra sigue siendo la opción equilibrada para el trabajo diario cuando se necesita mayor inteligencia. Sol continúa atendiendo las tareas más exigentes, mientras que Fast mode ofrece una opción de menor latencia cuando el tiempo de espera importa más que la prima por token.
Cambios del 30 de julio de 2026
Cuando GPT-5.6 se lanzó el 9 de julio, OpenAI publicó los siguientes precios API estándar de contexto corto:
| Modelo | Precio de entrada original | Precio de salida original |
|---|---|---|
| GPT-5.6 Sol | $5,00 / millón de tokens | $30,00 / millón de tokens |
| GPT-5.6 Terra | $2,50 / millón de tokens | $15,00 / millón de tokens |
| GPT-5.6 Luna | $1,00 / millón de tokens | $6,00 / millón de tokens |
La actualización del 30 de julio ajusta los precios de Terra y Luna:
| Modelo | Nuevo precio de entrada | Nuevo precio de salida | Variación |
|---|---|---|---|
| GPT-5.6 Sol | $5,00 / millón de tokens | $30,00 / millón de tokens | Sin cambios |
| GPT-5.6 Terra | $2,00 / millón de tokens | $12,00 / millón de tokens | Reducción del 20 % |
| GPT-5.6 Luna | $0,20 / millón de tokens | $1,20 / millón de tokens | Reducción del 80 % |
El precio de Luna ahora se ha reducido a una quinta parte del precio de lanzamiento original.
El nuevo precio de Terra equivale a cuatro quintas partes de su precio original.
Sol permanece sin cambios bajo procesamiento Standard, pero Fast mode ahora ofrece a los desarrolladores una opción: hasta 2,5 veces más velocidad de respuesta por el doble del precio por token de Standard.
Precios API Standard actuales
Los precios de entrada y salida superficiales no muestran la estructura de facturación completa.
GPT-5.6 admite descuentos por entrada en caché y escritura explícita en caché. Las solicitudes con más de 272 000 tokens de entrada también pueden acogerse a precios de contexto largo para toda la solicitud.
Precios Standard de contexto corto
Las siguientes tarifas se calculan por millón de tokens:
| Modelo | Entrada | Entrada en caché | Escritura en caché | Salida |
|---|---|---|---|---|
| GPT-5.6 Sol | $5,00 | $0,50 | $6,25 | $30,00 |
| GPT-5.6 Terra | $2,00 | $0,20 | $2,50 | $12,00 |
| GPT-5.6 Luna | $0,20 | $0,02 | $0,25 | $1,20 |
La lectura en caché ofrece un 90 % de descuento en comparación con la entrada normal no almacenada en caché.
La escritura en caché se factura a 1,25 veces el precio de la entrada no almacenada en caché.
Precios Standard de contexto largo
Para indicaciones que superen los 272 000 tokens de entrada, OpenAI aplica actualmente las siguientes tarifas para la solicitud completa:
| Modelo | Entrada | Entrada en caché | Escritura en caché | Salida |
|---|---|---|---|---|
| GPT-5.6 Sol | $10,00 | $1,00 | $12,50 | $45,00 |
| GPT-5.6 Terra | $4,00 | $0,40 | $5,00 | $18,00 |
| GPT-5.6 Luna | $0,40 | $0,04 | $0,50 | $1,80 |
La regla de contexto largo implica que
la estimación de costes debe tener en cuenta tanto el número de tokens como si la solicitud supera el umbral de 272 000 tokens.
Una indicación individual muy grande no se procesa facturando los primeros 272 000 tokens a la tarifa de contexto corto y el resto a una tarifa más alta. El multiplicador de contexto largo se aplica a la solicitud completa.
Equiparar inteligencia con resultados
El argumento principal de OpenAI es que el despliegue eficiente de IA comienza por los resultados, no por el nombre del modelo.
Las distintas fases de un mismo flujo de trabajo pueden requerir diferentes niveles de inteligencia, velocidad y fiabilidad.
El modelo ideal para una tarea depende de:
- Las consecuencias de los errores.
- La dificultad del trabajo.
- El tiempo de respuesta aceptable.
- El volumen de solicitudes.
- El coste de la revisión humana.
- La capacidad de verificar automáticamente los resultados.
- Si la tarea está claramente especificada o sigue siendo ambigua.
Cuándo elegir Luna
GPT-5.6 Luna está diseñada para trabajos sensibles al coste y de gran volumen.
Su página actual del modelo API lo describe como aproximadamente equivalente al nivel nano utilizado en la serie GPT-5 anterior.
Luna es una opción práctica para los siguientes escenarios:
- Clasificación.
- Extracción estructurada.
- Pasos de agentes en segundo plano.
- Cambios de código rutinarios.
- Generación de pruebas.
- Procesamiento de clasificación de documentos.
- Bucles repetitivos de llamadas a herramientas.
- Procesamiento a gran escala donde el impacto negativo de cada tarea individual es limitado.
OpenAI estima que Luna puede ofrecer un rendimiento comparable al de los modelos considerados de vanguardia hace aproximadamente un año, a un coste de unos seis céntimos por dólar por tarea y casi nueve veces más rápido.
Esta comparación se basa en las evaluaciones y la metodología de costes de OpenAI. Los equipos deben validar estos resultados con sus propias cargas de trabajo.
Cuándo elegir Terra
GPT-5.6 Terra es el miembro equilibrado de la serie.
OpenAI lo posiciona donde se encontraban los modelos mini en la era GPT-5, pero con mayor capacidad de agencia y trabajo especializado.
Terra es adecuada para los siguientes trabajos:
- Preguntas y respuestas en el espacio de trabajo.
- Investigación de alcance limitado.
- Codificación diaria.
- Análisis de documentos.
- Planificación de agentes de complejidad media.
- Flujos de trabajo de atención al cliente que requieren razonamiento.
- Tareas empresariales repetitivas cuando Luna no es lo bastante fiable pero Sol no es necesaria.
Cuándo elegir Sol
GPT-5.6 Sol es el modelo insignia para trabajos complejos y especializados.
Es la mejor opción cuando el modelo debe:
- Resolver ambigüedades.
- Elaborar planes para proyectos difíciles.
- Revisar decisiones de alto valor.
- Gestionar codificación o depuración complejas.
- Coordinar herramientas en flujos de trabajo prolongados.
- Realizar investigaciones profundas.
- Generar o verificar trabajos donde el coste del fallo es elevado.
El alias de API gpt-5.6 enruta a gpt-5.6-sol.
Un flujo de trabajo puede utilizar varios modelos
Esta actualización de precios hace más prácticos los flujos de trabajo con modelos mixtos.
Un agente de codificación no necesita utilizar Sol para cada token y cada llamada a herramienta.
Una arquitectura posible es:
- Usar Sol para comprender la base de código e identificar incertidumbres.
- Permitir que Sol cree el plan y defina los criterios de éxito.
- Enviar las tareas de implementación claramente especificadas a Luna.
- Usar Luna para escribir pruebas rutinarias y realizar comprobaciones repetitivas.
- Enrutar los pasos inciertos o fallidos a Terra o Sol.
- Cuando las consecuencias de los errores sean graves, usar Sol para la revisión final.
es muy elevado.
El mismo patrón puede aplicarse más allá de la ingeniería de software.
Un sistema de procesamiento de documentos podría usar Luna para la extracción, Terra para la síntesis y Sol solo cuando el material sea ambiguo o tenga un impacto significativo.
La estrategia de enrutamiento correcta debe determinarse mediante evaluaciones, no mediante suposiciones.
Resultados de clientes compartidos por OpenAI
El anuncio de OpenAI incluye comentarios tempranos de clientes de múltiples usuarios de producción.
Estos ejemplos son reportados por las propias empresas y clientes, no por evaluaciones comparativas independientes.
| Empresa | Uso o resultados reportados |
|---|---|
| Replit | Luna hace que casos de uso antes poco prácticos sean lo suficientemente rentables para explorar |
| Notion | En evaluaciones internas, Terra alcanzó una calidad comparable a la de GPT-5.5 con la mitad del costo de tareas y un tiempo reducido en un 60% |
| Ramp | Terra y Luna lideraron las evaluaciones internas de codificación en eficiencia de costos; Luna se convirtió en la opción predeterminada para tareas de automatización en segundo plano |
| Blitzy | Luna elevó la tasa de reutilización de caché de avisos del 24% al 90%, reduciendo significativamente los costos en comparación con la opción predeterminada anterior |
| Cognition | Luna actúa como un compañero de codificación de menor costo en Devin Fusion, trabajando junto a modelos más grandes |
| Dust | Se reporta que, en tareas de agente similares, Luna es un 40% más rápida y un 40% más económica que la opción predeterminada anterior de la empresa |
Estos ejemplos demuestran que la facturación por tokens no es la única métrica útil.
Un modelo más económico también puede cambiar:
- El número de llamadas a herramientas.
- La reutilización de caché.
- La longitud del contexto.
- La verbosidad de la salida.
- La frecuencia de reintentos.
- La necesidad de revisión humana.
- El tiempo total de finalización.
Una métrica más significativa suele ser el costo por resultado exitoso.
Lo que OpenAI dice sobre cómo logra la eficiencia
OpenAI atribuye la mejora en la relación precio-rendimiento a tres niveles interconectados.
- Modelo
Los modelos de la serie GPT-5.6 están diseñados para completar tareas de manera más directa.
Un modelo que requiere menos tokens de salida, menos reintentos o menos ciclos de razonamiento puede reducir el costo total de la tarea, incluso si el precio de etiqueta permanece sin cambios.
- Sistema de inferencia
La pila de producción determina la eficiencia con la que el modelo utiliza el hardware.
OpenAI afirma que un software de servicio optimizado puede generar tokens de manera más eficiente y mantener la productividad de los recursos computacionales.
- Marco de agentes
El marco es el software que rodea al modelo y proporciona herramientas, contexto, enrutamiento, estado y control del flujo de trabajo.
OpenAI afirma que una mejor gestión del contexto ayuda a los agentes a evitar repetir trabajo ya completado.
Esto puede reducir:
- Llamadas repetidas a herramientas.
- Procesamiento repetido de contextos sin cambios.
- Planificación redundante.
- Llamadas innecesarias de ida y vuelta al modelo.
- Consumo de tokens para repetir resultados anteriores.
Estos tres niveles se influyen mutuamente.
Un modelo más fuerte puede encontrar espacios de optimización en la pila de servicios. Esta optimización reduce los costos, haciendo que el uso de agentes a mayor escala sea económicamente viable. Más uso, a su vez, crea más oportunidades para mejorar el sistema.
GPT-5.6 Sol ayudó a optimizar su propia pila de servicios
Una de las afirmaciones más llamativas del anuncio es que GPT-5.6 Sol contribuyó a los esfuerzos internos de eficiencia de OpenAI.
En un proceso de ingeniería liderado por humanos, OpenAI afirma que Sol:
- Reescribió y optimizó kernels de producción.
- Diseñó y ejecutó cientos de experimentos de generación de tokens.
- Supervisó los procesos de entrenamiento.
- Intervino cuando surgían problemas.
OpenAI informa que las optimizaciones del kernel redujeron el costo de servicio de extremo a extremo del modelo en aproximadamente un 20%.
La compañía también afirma que estos experimentos mejoraron la eficiencia de generación de tokens en más de un 15%.
Estos son resultados internos de OpenAI y aún no han sido reproducidos de manera independiente mediante evaluaciones comparativas públicas.
Un punto aún más importante es que los modelos se están convirtiendo gradualmente en parte del proceso de mejora de la infraestructura en la que operan.
Esto crea un ciclo de retroalimentación de ingeniería más estrecho:
Modelo más fuerte
→ Mejor optimización de infraestructura
→ Menores costos de servicio
→ Aplicaciones más amplias
→ Más retroalimentación e inversión
→ Modelo de próxima generación más potente
Estrategia de cómputo orientada a la escala
Un precio más bajo no significa que OpenAI necesite menos cómputo total.
La compañía cree que lograr inteligencia suficiente requiere ambas cosas:
- Más cómputo.
- Cómputo más productivo.
Lo primero expande la capacidad total.
Lo segundo mejora la cantidad de trabajo útil completado por unidad de hardware.
OpenAI afirma que está construyendo una cartera diversificada de infraestructura y asignando cargas de trabajo a los sistemas más adecuados para ejecutarlas.
Esto respalda ambos extremos de la serie GPT-5.6:
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
- Luna y Terra hacen que las cargas de trabajo de alto volumen sean más económicas.
- Sol y el modo Fast admiten trabajos difíciles y sensibles a la latencia.
Ejemplos de cargas de trabajo que podrían ejecutarse más fácilmente a escala incluyen:
- Pipelines de análisis de documentos grandes.
- Clasificación de interacciones con clientes.
- Implementación de software de rutina.
- Automatización de agentes en segundo plano.
- Tareas repetitivas de procesamiento de datos.
- Flujos de trabajo de llamadas a herramientas con alta tasa de reutilización de caché.
Mientras tanto, cuando el valor de obtener una respuesta más rápida justifica el costo adicional, las solicitudes complejas de Sol pueden usar el modo Fast.
El modo Fast reemplaza al procesamiento prioritario
El modo Fast es el nuevo nombre del nivel de servicio de procesamiento prioritario de OpenAI.
Las solicitudes API existentes que usan:
"service_tier": "priority"
siguen siendo compatibles.
Los desarrolladores también pueden usar:
"service_tier": "fast"
Para GPT-5.6 Sol, OpenAI afirma que el modo Fast puede ser hasta 2,5 veces más rápido que el procesamiento estándar, manteniendo la misma inteligencia del modelo.
El costo es el precio.
Actualmente, el modo Fast de GPT-5.6 Sol tiene un precio de 2 veces el precio estándar de los tokens de API.
Los descuentos para entrada en caché siguen aplicándose.
Ejemplo en Python
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Revisa este plan de migración e identifica los tres supuestos de mayor riesgo.",
service_tier="fast",
)
print(response.output_text)
El modo Fast está disponible para los modelos compatibles a través de la API de Respuestas y la API de Completions de Chat.
Para GPT-5.6 y modelos anteriores, incluso si la solicitud utiliza el nuevo nombre fast, el objeto de respuesta puede reportar el nivel de servicio como priority.
Cuándo vale la pena el sobreprecio del modo Fast
El modo Fast no es automáticamente la mejor configuración para todas las solicitudes de Sol.
Es más útil cuando la latencia afecta directamente el valor del resultado.
Ejemplos incluyen:
- Asistentes orientados al usuario que completan flujos de trabajo de alto valor.
- Agentes de programación que esperan para desbloquear a los desarrolladores.
- Investigación o análisis interactivo.
- Soporte en respuesta a incidentes.
- Revisión en tiempo real antes de tomar decisiones.
- Sistemas de producción estables.
Tráfico empresarial sensible a la latencia.
Para los siguientes escenarios, el procesamiento estándar puede ser más económico:
- Tareas en segundo plano.
- Investigación nocturna.
- Generación de informes asíncronos.
- Análisis por lotes.
- Tareas donde el usuario no necesita esperar.
- Flujos de trabajo cuyo cuello de botella son herramientas externas y no el modelo.
El sobreprecio de dos veces en tokens solo tiene sentido cuando el valor creado por la finalización posterior supera su costo.
En flujos de trabajo de agentes de larga duración, el caché de avisos es aún más importante
Los nuevos precios hacen que Luna y Terra sean más económicas, pero el caché de avisos también puede tener un impacto enorme en agentes de ejecución prolongada.
Cada ronda en un ciclo de agente puede reenviar:
- Instrucciones del sistema.
- Definiciones de herramientas.
- Documentos compartidos.
- Contexto del repositorio de código.
- Historial de conversación.
- Reglas estables del flujo de trabajo.
Sin caché, la aplicación puede terminar pagando repetidamente por el mismo prefijo.
GPT-5.6 admite tanto el caché automático como los puntos de interrupción explícitos de caché.
OpenAI actualmente factura de la siguiente manera:
- Las lecturas de caché se facturan al 10% del precio de entrada no almacenada en caché.
- Las escrituras de caché se facturan al 125% del precio de entrada no almacenada en caché.
Las escrituras de caché cuestan más que la entrada normal, pero las lecturas posteriores obtienen un descuento significativo.
El caché es más útil cuando el mismo prefijo estable se reutiliza suficientes veces para recuperar el mayor costo de escritura.
Las aplicaciones deben rastrear:
- La tasa de aciertos de caché.
- La estabilidad del prefijo.
- El intervalo de tiempo entre solicitudes.
- El tamaño del contexto en caché.
- Si el flujo de trabajo invalida con frecuencia el prefijo.
Especificaciones del modelo compartidas en toda la serie
El actual
La página de modelos de API enumera varias especificaciones compartidas:
| Especificación | Sol | Terra | Luna |
|---|---|---|---|
| Ventana de contexto | 1,050,000 tokens | 1,050,000 tokens | 1,050,000 tokens |
| Salida máxima | 128,000 tokens | 128,000 tokens | 128,000 tokens |
| Fecha límite de conocimiento | 16 de febrero de 2026 | 16 de febrero de 2026 | 16 de febrero de 2026 |
| Entrada/salida de texto | Compatible | Compatible | Compatible |
| Entrada de imágenes | Compatible | Compatible | Compatible |
| Tokens de razonamiento | Compatible | Compatible | Compatible |
| Llamada de funciones | Compatible | Compatible | Compatible |
| Salida estructurada | Compatible | Compatible | Compatible |
| Ajuste fino | No compatible | No compatible | No compatible |
Los tres modelos están disponibles a través de la API de Responses.
La página de modelos también enumera una amplia compatibilidad con herramientas, pero la disponibilidad de funciones específicas puede variar según el endpoint, la cuenta, el producto y la fase de lanzamiento.
Disponibilidad en ChatGPT Work, Codex y API
OpenAI indica que GPT-5.6 Terra y Luna siguen disponibles en las siguientes plataformas:
- ChatGPT Work.
- Codex.
- API de OpenAI.
El acceso actual descrito en el anuncio de precios incluye:
| Grupo de planes | Acceso a GPT-5.6 en ChatGPT Work y Codex |
|---|---|
| Free y Go | Terra |
| Plus, Pro, Business, Enterprise | Terra y Luna |
Sol tiene sus propias reglas de acceso en ChatGPT, ChatGPT Work, Codex y API.
La actualización del 30 de julio no redujo los precios de suscripción de ChatGPT ni de Codex.
Tampoco aumentó los presupuestos de cuotas declarados.
Por el contrario, Luna y Terra ahora consumen menos créditos debido a su menor costo de uso subyacente.
OpenAI también indicó que la actualización de precios comenzaría a implementarse a través de AWS el mismo día del anuncio. Los precios de los modelos a través de plataformas de terceros pueden diferir de los precios directos de la API de OpenAI.
Cómo hacerlo
Elegir el modelo GPT-5.6 correcto
Un proceso de selección práctico puede seguir cinco pasos.
Paso 1: Definir claramente el resultado esperado
Escriba qué constituye éxito.
Evite elegir modelos basándose únicamente en etiquetas amplias como "programación" o "investigación".
Paso 2: Identificar el costo del fracaso
Las tareas de clasificación de bajo riesgo y las migraciones de bases de datos en entornos de producción no deberían usar las mismas reglas de decisión.
Paso 3: Establecer una línea base con Sol
Para tareas difíciles, pruebe primero Sol para conocer el nivel de calidad más alto disponible.
Paso 4: Probar Terra y Luna en el mismo conjunto de evaluación
Mida si los modelos de menor costo conservan la calidad que realmente importa.
Paso 5: Optimizar todo el flujo de trabajo
Realice un seguimiento de:
- Tasa de éxito de tareas.
- Total de tokens.
- Tasa de reutilización de caché.
- Número de llamadas a herramientas.
- Número de reintentos.
- Latencia.
- Tiempo de revisión humana.
- Costo por resultado exitoso.
No optimice únicamente el precio más barato del token de entrada.
Preguntas frecuentes
¿Cuál es el nuevo precio de GPT-5.6 Luna?
GPT-5.6 Luna ahora tiene un precio estándar de token de entrada de contexto corto de 0.20 USD por millón, token de entrada en caché a 0.02 USD por millón y token de salida a 1.20 USD por millón. El precio de escritura en caché es de 0.25 USD por millón de tokens.
¿Cuál es el nuevo precio de GPT-5.6 Terra?
GPT-5.6 Terra ahora tiene un precio estándar de token de entrada de contexto corto de 2.00 USD por millón, token de entrada en caché a 0.20 USD por millón y token de salida a 12.00 USD por millón. El precio de escritura en caché es de 2.50 USD por millón de tokens.
¿Bajó el precio de GPT-5.6 Sol?
Su precio estándar de token no ha cambiado. Sol sigue siendo de 5 USD por millón de tokens de entrada de contexto corto y 30 USD por millón de tokens de salida, mientras que el modo Fast ofrece una velocidad de procesamiento 2.5 veces mayor al doble del precio estándar.
¿Qué ocurrió con Priority Processing?
OpenAI renombró Priority Processing a modo Fast el 30 de julio de
2026. Las solicitudes existentes que usan service_tier: "priority" siguen siendo compatibles, y las nuevas solicitudes pueden usar service_tier: "fast".
¿Cuándo se aplica el precio de contexto largo de GPT-5.6?
La página de modelos actual indica que los prompts con más de 272,000 tokens de entrada utilizarán tarifas de entrada y salida más altas para toda la solicitud. Los desarrolladores deben considerar este umbral al estimar los costos de prompts extremadamente grandes.
¿Qué modelo GPT-5.6 es mejor para cargas de trabajo de alto rendimiento?
OpenAI posiciona a Luna como el modelo orientado a trabajos de alto rendimiento sensibles al costo. Cuando Luna no ofrece suficiente calidad, Terra es la opción equilibrada, mientras que Sol está orientado a las tareas profesionales más difíciles.
¿La reducción de precios reduce las tarifas de suscripción de ChatGPT y Codex?
No. OpenAI indica que los precios de suscripción y los presupuestos de cuotas se mantienen sin cambios. Terra y Luna ahora consumen menos créditos en los flujos de trabajo compatibles con productos de pago.
¿Todos los proveedores de nube ofrecen inmediatamente los precios reducidos?
Los precios directos de la API de OpenAI cambiaron el 30 de julio. OpenAI indicó que los precios de AWS comenzarían a implementarse más tarde ese mismo día, pero los precios y la disponibilidad en plataformas de terceros pueden variar, por lo que los usuarios deben verificar las tarifas actuales del proveedor.
Herramientas relacionadas
- GPT-5.6 Sol: El modelo GPT-5.6 insignia de OpenAI para trabajos profesionales complejos.
- GPT-5.6 Terra: El modelo GPT-5.6 equilibrado
adecuado para cargas que necesitan inteligencia y menores costos.
- GPT-5.6 Luna: El modelo GPT-5.6 más rápido y económico para tareas de alto rendimiento y sensibles al costo.
- Responses API: La API principal de OpenAI para razonamiento, herramientas, flujos de trabajo multimodales y aplicaciones de agentes.
- Codex: El entorno de ingeniería de software con agentes de OpenAI basado en la familia de modelos GPT-5.6.
- OpenAI API Dashboard: El panel oficial para gestionar claves de API, proyectos, uso, límites y facturación.
Enlaces relacionados
- Precios completos de la API de OpenAI: Tarifas actuales de tokens estándar, por lotes, rápidos, entrada en caché, escritura en caché y contexto largo.
- Documentación del modo Fast: Instrucciones oficiales de configuración, detalles de compatibilidad y guía de uso para el nivel de servicio renombrado.
- [Guía de modelos GPT-5.6](https://developers.openai.
/com/api/docs/guides/latest-model): recomendaciones oficiales sobre selección de modelos, migración, inferencia, caché y flujos de trabajo.
- Anuncio de lanzamiento de GPT-5.6: lanzamiento de la serie de modelos original, capacidades del modelo, precios iniciales, disponibilidad y evaluaciones comparativas.
- Ingeniería de eficiencia de GPT-5.6: explicación de OpenAI sobre el trabajo de modelos e infraestructura detrás de las mejoras de eficiencia.
- Guía de caché de indicaciones: documentación oficial sobre el caché de indicaciones automático y explícito.
- Registro de cambios de la API de OpenAI: registro con fechas de actualizaciones de precios, lanzamientos de modo rápido y otros cambios en la API.
Resumen
En la actualización del 30 de julio, OpenAI redujo el precio estándar de la API de GPT-5.6 Luna en un 80% y el de Terra en un 20%. El precio estándar de Sol se mantuvo sin cambios, mientras que el nuevo modo rápido puede acelerar la velocidad de respuesta de la API hasta 2.5 veces, con una tarifa de tokens del doble.
Este anuncio gira en torno a una estrategia más amplia de relación costo-rendimiento. OpenAI afirma que está mejorando los modelos, la pila de inferencia, el enrutamiento, la gestión de contexto y los marcos de agentes para reducir el tiempo, los tokens o la potencia de cómputo necesarios para cada tarea exitosa.
Para los desarrolladores, la elección correcta no consiste simplemente en seleccionar el modelo más barato. Luna está orientada a la ejecución de alto rendimiento, Terra equilibra costo e inteligencia, y Sol se encarga de los trabajos más complejos. Los ahorros derivados del enrutamiento híbrido de modelos, el caché, la evaluación y la medición del costo por éxito podrían superar con creces los de simplemente cambiar de modelo.
El cambio fundamental es que GPT-5.6 ahora ofrece un rango de trabajo más amplio: los niveles Luna y Terra proporcionan inteligencia cotidiana más económica, mientras que, cuando la latencia justifica un mayor costo, se puede acceder a inteligencia de vanguardia más rápida a través de Sol.
Este archivo Markdown es una adaptación editorial independiente del artículo oficial. Conserva el tema, el orden de los hechos y el significado práctico, pero no reproduce textualmente la redacción de OpenAI ni las citas de clientes.



