Poco después de que GPT-5.6 Sol estuviera ampliamente disponible, algunos usuarios de Codex comenzaron a reportar un cambio inesperado: el m...

Poco después del lanzamiento generalizado de GPT-5.6 Sol, algunos usuarios de Codex comenzaron a reportar un cambio inesperado: las respuestas del modelo se volvieron más rápidas, pero su disposición a resolver problemas complejos en profundidad disminuyó.
El debate se intensificó cuando capturas de pantalla de la comunidad mostraron un cambio drástico en una configuración interna denominada "valor de capacidad". Los usuarios interpretaron este valor como un presupuesto de razonamiento oculto y lo asociaron con una disminución en el rendimiento de Sol Max. OpenAI negó que el modelo en sí hubiera sido debilitado intencionalmente, pero reconoció haber ajustado temporalmente la configuración de esfuerzo de razonamiento durante la investigación de un uso anormalmente alto.
Esta distinción es crucial. Los pesos subyacentes del modelo pueden permanecer inalterados, mientras que la configuración de ejecución, el contexto disponible, los permisos de herramientas, el esfuerzo de razonamiento o el comportamiento multiagente pueden cambiar. Desde la perspectiva del usuario, estos ajustes operativos pueden hacer que un modelo con el mismo nombre se comporte de manera diferente en distintos momentos.
Este artículo separa los hechos verificados de las observaciones de la comunidad y explica cómo los desarrolladores pueden probar el comportamiento del modelo de manera más confiable.
OpenAI presentó por primera vez GPT-5.6 Sol el 26 de junio de 2026, describiéndolo como el miembro insignia de una familia de modelos que incluye a Terra y Luna. El lanzamiento más amplio de GPT-5.6 se produjo el 9 de julio de 2026.
Uno de los aspectos más destacados de este lanzamiento fue un rango más amplio de configuraciones de razonamiento. En Codex, Sol puede utilizar varios niveles de razonamiento:
OpenAI describió "Máximo" como la configuración que otorga a Sol el tiempo de razonamiento más profundo. "Extremo" va un paso más allá, utilizando subagentes para descomponer tareas complejas y procesarlas mediante trabajo paralelo.
Un mayor esfuerzo de razonamiento no está exento de costos. Generalmente requiere más tiempo y consume más tokens, pero resulta útil para tareas que necesitan planificación, pruebas iterativas, recuperación de errores o comparación de múltiples soluciones posibles.
Una de las quejas más extendidas provino de un equipo de investigación de mercado japonés que utilizaba Codex Sol Max junto con una herramienta de línea de comandos personalizada.
Según la publicación del equipo en Reddit, Sol Max solía dedicar más de diez minutos a procesar indicaciones complejas, probando ideas repetidamente y utilizando herramientas hasta obtener un resultado fiable. El equipo afirmó que su rendimiento disminuyó repentinamente, y todos los miembros notaron una reducción en la profundidad del razonamiento dentro del mismo día laboral.
Este informe tiene peso como experiencia real de usuario, pero no constituye una prueba comparativa controlada. Hay muchos factores que pueden afectar la ejecución de codificación de un agente:
La diferencia repentina notada por un equipo experimentado merece investigación. Pero esto por sí solo no prueba que OpenAI haya cambiado los pesos del modelo o haya reducido permanentemente las capacidades de Sol.
El término "valor de capacidad" se convirtió en el centro de atención.
La controversia surgió después de que Thibault Sottiaux, de los equipos de Codex y ChatGPT Work, publicara una actualización pública.
En dicha actualización, Sottiaux indicó que OpenAI había realizado experimentos ajustando el esfuerzo de razonamiento, refiriéndose internamente a estas configuraciones como "valores de jugo". También afirmó que el experimento había sido revertido.
La explicación más simple es que el valor de jugo es un parámetro de control interno relacionado con la cantidad de trabajo de razonamiento que se permite invertir al modelo en una tarea, y no debe considerarse automáticamente una puntuación de inteligencia.
Una asignación de razonamiento más baja puede afectar los siguientes comportamientos:
Sin embargo, OpenAI aún no ha publicado un mapeo numérico oficial entre los niveles de razonamiento orientados al usuario y los valores de jugo específicos.
Publicaciones y capturas de pantalla de la comunidad afirmaron que Sol Max solía utilizar un valor de jugo cercano a 960, que luego se mostraba como 128, una reducción de aproximadamente el 87%.
Estas cifras deben tratarse como observaciones comunitarias no verificadas. No aparecen en la documentación del modelo GPT-5.6, y los valores extraídos mediante indicaciones ocultas o técnicas de "huella digital del modelo" pueden no representar de manera fiable la asignación computacional real del servidor.
La parte confirmada es más limitada: OpenAI reconoció haber realizado experimentos con el esfuerzo de razonamiento y afirmó que los cambios correspondientes han sido revertidos.
La actualización de Sottiaux refutó las afirmaciones de que GPT-5.6 Sol había sido debilitado intencionalmente, describiendo en su lugar varios problemas operativos y cambios.
OpenAI indicó que había implementado optimizaciones de razonamiento y estaba trasladando los recursos ahorrados a los suscriptores, estimando que solo esta mejora proporcionaría aproximadamente un 10% de uso adicional.
Las ganancias de eficiencia pueden hacer que el modelo sea más rápido o más económico sin reducir la calidad. Pero si las optimizaciones se lanzan junto con otros experimentos de configuración, los usuarios pueden notar cambios.
OpenAI aumentó el límite de contexto disponible para GPT-5.6 Sol de los 272k de GPT-5.5 a aproximadamente 372k.
Un contexto más grande provocó que el consumo de uso superara las expectativas. OpenAI restableció temporalmente el límite a 272k y afirmó que lo restablecería a 372k después de corregir el comportamiento de facturación.
Esto ayuda a explicar por qué se discuten dos problemas simultáneamente:
El ajuste de la ventana de contexto no está relacionado con cambios en los pesos del modelo, pero aún puede afectar tareas largas de repositorio y flujos de trabajo intensivos en documentación.
OpenAI afirmó que ajustó el esfuerzo de razonamiento mientras rastreaba un aumento anormal en el uso, refiriéndose a estas configuraciones internas como valores de jugo.
La empresa indicó que el experimento había sido revertido.
OpenAI también informó que, en los modos "Alto" y "Muy alto", la tasa de uso real de multiagente era ligeramente superior a la esperada. La empresa afirmó que estaba corrigiendo este comportamiento y mejorando la eficiencia de la revisión automática.
Esto es importante porque la delegación de agentes consume muchos recursos. Las ejecuciones que inician más subagentes o realizan trabajo de revisión adicional pueden consumir cuotas de suscripción mucho más rápido que las ejecuciones de un solo agente.
No necesariamente, pero puede hacer que el modelo parezca menos capaz en tareas difíciles.
Es útil separar tres niveles:
Esto proviene principalmente del modelo entrenado en sí mismo: sus pesos, arquitectura, conocimiento aprendido y capacidad central de resolución de problemas.
Esto determina cuánto tiempo o recursos computacionales permite el sistema que el modelo gaste en una solicitud particular.
Esto incluye herramientas, contexto, memoria, permisos, subagentes, ejecutores de pruebas, acceso a archivos y estrategias de reintento.
Un modelo potente con una asignación de razonamiento limitada aún puede responder correctamente a preguntas simples, pero tendrá un rendimiento inferior en tareas de codificación de ciclo largo. Puede detenerse después de encontrar la primera solución aparentemente razonable, sin intentar alternativas ni recuperarse de un enfoque inicial erróneo.
Esto no significa que la capacidad subyacente del modelo haya desaparecido. Significa que, durante una ejecución particular, la manifestación de esa capacidad puede haberse reducido.
Los sistemas de IA en producción no son archivos estáticos que se entreguen siempre exactamente de la misma manera. Los proveedores pueden cambiar muchos parámetros operativos sin renombrar el modelo.
Por ejemplo, cuando la plataforma cambia lo siguiente, los usuarios pueden percibir diferencias:
Por eso, el nombre del modelo por sí solo no garantiza un comportamiento consistente en diferentes días, productos, planes de suscripción o configuraciones de razonamiento.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Para los usuarios empresariales, la pregunta clave no es solo "¿qué modelo se seleccionó?", sino también "¿qué garantías en tiempo de ejecución acompañan a ese modelo?"
Las pruebas efectivas requieren controlar las variables tanto como sea posible. No es suficiente ejecutar una indicación una vez antes y otra después del momento en que se sospecha un cambio.
Usa la misma versión del commit del repositorio, archivos de entrada, dependencias, variables de entorno y conjunto de pruebas.
Crea un punto de control de Git antes de cada ejecución para garantizar que el estado inicial sea completamente idéntico.
En la CLI de Codex, verifica el modelo activo actual y la configuración de la sesión:
/status
Utiliza el selector de modelos si es necesario:
/model
También puedes iniciar Codex con un modelo específico:
codex
```bash
--model gpt-5.6
Para tareas repetibles no interactivas:
codex exec -m gpt-5.6 "Revisar el cambio actual"
Nivel de razonamiento, permisos, uso de contexto, versión de Codex y cualquier herramienta o plugin habilitado.
Define el resultado esperado antes de empezar. Las métricas útiles incluyen:
Evita calificar únicamente por lo "inteligente" que parece una respuesta.
Realiza varias ejecuciones para la misma condición. Los modelos de razonamiento y los agentes pueden variar entre intentos, por lo que una sola ejecución puede ser engañosa.
Compara la mediana y la tasa de fallos, en lugar de elegir el mejor o el peor ejemplo.
Mantén todo lo demás constante al comparar Medium con Max. Luego compara fechas, versiones o límites de contexto por separado.
Si cambias varias variables a la vez, no podrás determinar cuál de ellas provocó el cambio en los resultados.
Guarda los prompts, la salida del terminal, los diffs, los resultados de pruebas, los tiempos y los datos de uso de recursos. Un registro claro ayuda a reportar regresiones y permite que otros usuarios reproduzcan las pruebas.
Para tareas cotidianas, OpenAI recomienda comenzar con la configuración de razonamiento predeterminada y aumentar el nivel solo cuando se requiera una planificación o un análisis más profundo.
Las siguientes prácticas hacen que las tareas difíciles sean más fiables:
Para proyectos particularmente difíciles, pueden ser apropiados Max o Ultra. Ultra es útil cuando se pueden asignar subproblemas a subagentes, pero también consume más recursos.
El problema mayor no es si un controvertido número interno es 960 o 128. La preocupación más profunda es que los usuarios suelen pensar que el nombre del modelo representa un nivel de comportamiento fijo y estable.
En realidad, la experiencia del usuario depende del modelo y de la configuración del servicio que lo rodea. El proveedor puede optimizar el razonamiento, cambiar los límites de contexto, ajustar la asignación de razonamiento o modificar la orquestación de agentes sin cambiar el nombre del modelo.
Esta flexibilidad es útil para operar servicios a gran escala, pero también crea problemas de transparencia. Los desarrolladores que construyen flujos de trabajo críticos necesitan saber qué características son fiables y cuáles pueden cambiar dinámicamente.
Una documentación más clara debería incluir:
Sin esta información, los usuarios solo pueden inferir cambios en el sistema a través de la velocidad de respuesta, el uso de tokens y la calidad subjetiva de la salida.
OpenAI afirma que no ha debilitado intencionalmente el rendimiento del modelo. Reconocen oficialmente la existencia de experimentos temporales que ajustan la configuración de intensidad de razonamiento, así como parámetros de contexto, multiagente y estadísticas de uso.
OpenAI utiliza este término para referirse a la configuración interna relacionada con la intensidad del razonamiento. Este valor parece controlar o representar los recursos de razonamiento, pero la empresa aún no ha publicado una definición técnica completa ni una escala numérica oficial.
Esta afirmación proviene de capturas de pantalla de la comunidad y experimentos con prompts ocultos. OpenAI no ha confirmado oficialmente ninguno de estos dos valores, por lo que no deben considerarse especificaciones de modelo verificadas.
Una asignación de razonamiento más baja hace que el modelo explore menos enfoques, reduzca el número de verificaciones o termine de forma anticipada. Otros factores, como los límites de contexto, el comportamiento de las herramientas, la configuración del servidor y las fluctuaciones aleatorias, también pueden producir efectos similares.
OpenAI indica que el límite de contexto de GPT-5.6 Sol se incrementó de 272k a 372k, pero este cambio provocó que el consumo de recursos fuera más rápido de lo esperado. Mientras se prepara el relanzamiento con 372k, se ha restaurado temporalmente el límite de 272k.
No. Las configuraciones de razonamiento más altas requieren más tiempo y consumen más recursos. Se recomienda comenzar con la configuración predeterminada y aumentarla solo cuando la tarea realmente requiera planificación profunda, pruebas o recuperación de errores.
Realiza ejecuciones repetidas utilizando el mismo repositorio, prompt, herramientas, permisos, nivel de razonamiento y pruebas. Realiza un seguimiento de métricas objetivas como la tasa de aprobación de pruebas, la tasa de errores, el tiempo de finalización, las llamadas a herramientas y el consumo de recursos.
La controversia sobre GPT-5.6 Sol comenzó con comentarios reales de usuarios que afirmaban que el razonamiento Max se había vuelto más rápido pero menos profundo. Las capturas de pantalla de la comunidad vincularon esta experiencia con un ajuste conocido del "valor juice" interno, pero la afirmación específica de una reducción de 960 a 128 sigue sin confirmarse.
OpenAI niega haber debilitado intencionalmente el modelo, al tiempo que confirma que experimentó con el ajuste del nivel de esfuerzo de razonamiento, modificó temporalmente los límites de contexto y descubrió usos imprevistos en flujos de trabajo con agentes múltiples y revisiones automatizadas. Estos son cambios a nivel operativo, no la confirmación de un reemplazo de los pesos subyacentes del modelo, pero los ajustes operativos aún pueden afectar el rendimiento real.
Para los equipos que dependen de Codex, la mejor respuesta es establecer evaluaciones comparativas reproducibles, documentar la configuración de ejecución y medir los resultados mediante pruebas, no mediante la intuición.
La lección clave es que el nombre del modelo no describe completamente el comportamiento que el usuario realmente obtiene; la asignación de razonamiento, el contexto, las herramientas y la configuración del servicio son igualmente cruciales.
Empieza con una sola frase y obtén un sitio completo en minutos.