Análisis profundo de GPT-6 Astra: flujos de trabajo agénticos, benchmarks, precios y comparación con Claude Fable 5.1

OpenAI presentó GPT-6 Astra el 3 de septiembre de 2026, aunque en Pekín ya era el 4 de septiembre. OpenAI lo denomina su modelo más inteligente y mejor alineado hasta la fecha, y lo posiciona para trabajos difíciles de extremo a extremo en áreas como el uso del ordenador, la navegación web, la ingeniería de software, la ciberseguridad, la ciencia y los flujos de trabajo profesionales.
Este enfoque es importante porque Astra no se entiende mejor como un simple «siguiente chatbot».
Las mejoras más visibles se concentran en tareas en las que un modelo debe continuar trabajando durante muchos pasos: inspeccionar un entorno, utilizar herramientas, revisar un plan, gestionar fallos, operar software y producir un resultado terminado en lugar de una sola respuesta.
El artículo original describe este cambio como el comienzo de una «era nativa de los agentes». La idea es útil como orientación, pero la implementación es más matizada que afirmar que todo el harness de agentes se ha trasladado a los pesos del modelo.
La propia documentación de OpenAI describe dos capas cooperantes:
En otras palabras, Astra está considerablemente más orientado a los agentes, pero una aplicación todavía necesita un entorno de ejecución alrededor del modelo.

Este artículo conserva la estructura original de cinco partes y examina Astra desde cinco ángulos:

Antes de analizar las cifras de los benchmarks, conviene separar el modelo de la pila de productos que lo rodea.
Un flujo de trabajo convencional basado en un modelo de lenguaje es fácil de imaginar:
Solicitud del usuario
→ razonamiento del modelo
→ respuesta del modelo
Para un agente más complejo, la aplicación que lo rodea normalmente añade otra capa:
Objetivo del usuario
→ harness de agentes
→ modelo
→ llamada a una herramienta
→ resultado del entorno
→ modelo
→ siguiente acción
→ resultado final
Ese harness externo decide cómo se exponen las herramientas, cómo se devuelven los resultados, cómo se mantiene el contexto, qué permisos se aplican y cuándo debe detenerse el ciclo.
OpenAI sigue utilizando esta arquitectura. De hecho, ha descrito por separado el harness agéntico de Codex/ChatGPT Work como una capa de orquestación basada en Rust que conecta los modelos, las herramientas y el entorno del usuario.
Astra ha recibido un entrenamiento más profundo para los comportamientos que hacen útil al harness.
La orientación de OpenAI sobre el modelo destaca capacidades como:
Por tanto, la diferencia se describe mejor como un diseño conjunto del modelo y el harness que como una desaparición del harness dentro del modelo.
El objetivo práctico ya no es únicamente:
Astra está orientado principalmente a cargas de trabajo de ejecución más exigentes, como:
Los materiales de lanzamiento de OpenAI hacen hincapié repetidamente en el trabajo de extremo a extremo, no en una personalidad conversacional mejorada.
Una forma útil de entender el cambio generacional es:
Flujo de trabajo anterior centrado en el modelo:
razonamiento sólido + orquestación externa
Flujo de trabajo con GPT-6 Astra:
razonamiento más sólido y entrenado para agentes + orquestación externa diseñada para aprovecharlo
El segundo sistema es más capaz porque el propio modelo es mejor a la hora de planificar, utilizar los comentarios, operar herramientas, delegar trabajo y mantener la coherencia durante trayectorias de tareas prolongadas.

El punto más útil del artículo original es que Astra no debe interpretarse como un sustituto automático de todos los modelos más económicos para cualquier carga de trabajo.
Sus mayores avances aparecen en tareas agénticas y profesionales difíciles.
La siguiente tabla utiliza, cuando están disponibles, los valores de la comparación oficial de lanzamiento de GPT-6 Astra de OpenAI.
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Qué evalúa |
|---|---|---|---|
| ARC-AGI-3 | 99,9 % | 7,8 % | Entornos interactivos novedosos y descubrimiento de reglas abstractas |
| FrontierMath Tier 4 (v2) | 97,6 % | 83,0 % | Matemáticas de nivel de investigación |
| ExploitBench | 100,0 % | 78,5 % | Desarrollo de exploits para vulnerabilidades conocidas en entornos de evaluación |
| ExploitBench, junio-agosto de 2026 | 39,0 % | 5,5 % | Vulnerabilidades recientes posteriores al límite de conocimiento del modelo |
| AutomationBench | 41,4 % | 18,1 % | Automatización profesional de varios pasos |
| Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | Flujos de trabajo científicos mediante código y herramientas de terminal |
| BenchCAD | 95,9 % | 83,3 % | Reconstrucción CAD a partir de representaciones desde múltiples vistas |
| Agents’ Last Exam | 59,3 % | 53,6 % | Tareas profesionales complejas de uso del ordenador |
| Artificial Analysis Intelligence Index v4.1.1 en el lanzamiento | 61,2 | 60,9 | Índice independiente compuesto de inteligencia |
Al leer esta tabla conviene tener en cuenta algunos detalles.
En primer lugar, el texto principal de OpenAI redondea FrontierMath Tier 4 al 98 %, mientras que la tabla del benchmark muestra un 97,6 % para la evaluación v2.
En segundo lugar, el resultado llamativo de ARC-AGI-3 es el de un benchmark interactivo de estilo agéntico. OpenAI señala que Astra se ejecutó con su harness de la Responses API y que la configuración de evaluación puede diferir de ChatGPT en producción.
En tercer lugar, las puntuaciones de ciberseguridad se midieron en condiciones de evaluación controladas. Actualmente, OpenAI clasifica a Astra en el umbral de capacidad de ciberseguridad Crítico según su Preparedness Framework y despliega medidas de protección más sólidas para esas capacidades.
ARC-AGI-3 es el ejemplo más claro.
Astra obtiene un 99,9 % en la evaluación publicada por OpenAI frente al 7,8 % de GPT-5.6 Sol. El benchmark exige que un sistema infiera objetivos y reglas mediante la interacción, en lugar de limitarse a responder a partir de una instrucción estática.
El mismo patrón aparece en varios benchmarks operativos:
Por eso Astra puede sentirse como un salto generacional mucho mayor en los flujos de trabajo agénticos que en la conversación convencional.
En el Artificial Analysis Intelligence Index v4.1.1 disponible en el momento del lanzamiento, OpenAI informó de:
GPT-6 Astra: 61,2
GPT-5.6 Sol: 60,9
Claude Fable 5.1: 65,7
La diferencia entre Astra y Sol en ese índice compuesto era minúscula en comparación con la brecha observada en ARC-AGI-3 o Terminal-Bench Science.
Desde entonces, Artificial Analysis ha pasado a la versión v4.2, con una combinación de benchmarks diferente, por lo que las cifras absolutas han cambiado. La conclusión general se mantiene: la ventaja diferenciadora de Astra no consiste en que todas las métricas de inteligencia general se dupliquen de repente.
El precio estándar de GPT-6 Astra en la API de OpenAI es:
| Tipo de token | Precio por 1 millón de tokens |
|---|---|
| Entrada | 10,00 $ |
| Entrada almacenada en caché | 1,00 $ |
| Escritura de caché | 12,50 $ |
| Salida | 50,00 $ |
GPT-5.6 Sol tiene actualmente un precio inferior: 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida.
Por tanto, Astra tiene más sentido cuando una mejor finalización de las tareas compensa el precio más elevado de los tokens.
Existe otro detalle de precios relacionado con el contexto largo: las solicitudes con más de 272.000 tokens de entrada se facturan con tarifas superiores para la solicitud completa: el doble en las tarifas de entrada y caché, y 1,5 veces más en las tarifas de salida, según la página actual del modelo Astra.
El artículo original utilizaba GPT-4o como opción generalista de bajo coste. GPT-4o todavía existe en el catálogo de la API, pero la orientación actual de OpenAI sobre modelos apunta ahora a los modelos más recientes de la familia GPT-5.6 para la mayoría de las nuevas integraciones.
Una guía de selección más actual es:
| Escenario | Punto de partida recomendado | Motivo |
|---|---|---|
| Tareas generales de gran volumen y sensibles al coste | GPT-5.6 Luna o Terra | Menor coste y capacidad suficiente para muchas cargas de trabajo rutinarias |
| Razonamiento y programación profesionales | GPT-5.6 Sol | Alto rendimiento profesional a un precio inferior al de Astra |
| Flujos de trabajo difíciles de extremo a extremo, uso del ordenador, tareas científicas y trabajo agéntico avanzado | GPT-6 Astra | Mejor opción para ejecuciones difíciles de varios pasos y con muchas herramientas |
| Integración heredada con GPT-4o | GPT-4o puede mantenerse cuando corresponda | Sigue disponible, pero no es la recomendación predeterminada para nuevos flujos de trabajo de frontera |
La regla práctica es sencilla:
Empieza con el modelo más económico que complete la tarea de forma fiable. Pasa a Astra cuando el éxito de la tarea, la autonomía o la calidad de ejecución importen más que el precio bruto de los tokens.

El artículo de origen presenta a OpenAI y Anthropic como empresas que siguen rutas completamente diferentes.
Hay algo de verdad en el énfasis, pero los productos actuales se solapan más de lo que sugiere esa descripción.
Claude Fable 5.1 también está diseñado explícitamente para agentes de larga duración, programación, uso del navegador, flujos de trabajo empresariales y ejecución gestionada de agentes. Astra también es un modelo multimodal con un contexto de 1 millón de tokens y un razonamiento general sólido.
Por tanto, la comparación más precisa no es «uno es un agente y el otro no».
Se trata de determinar dónde muestra actualmente cada sistema las pruebas más sólidas y cuál es su principal énfasis de producto.
Las siguientes cifras proceden de la tabla comparativa del lanzamiento de OpenAI, salvo que se indique lo contrario.
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | Dimensión de capacidad |
|---|---|---|---|---|
| ARC-AGI-3 | 99,9 % | — | 30,2 % | Razonamiento abstracto interactivo |
| FrontierMath Tier 4 (v2) | 97,6 % | 87,8 % | 73,2 % | Matemáticas avanzadas |
| ExploitBench | 100,0 % | — | 70,0 % | Evaluación de ciberseguridad |
| AutomationBench | 41,4 % | 31,4 % | 26,9 % | Automatización profesional |
| Terminal-Bench Science 0.1 | 64,6 % | 52,6 % | 30,0 % | Flujos de trabajo científicos |
| BenchCAD | 95,9 % | 84,3 % | 82,1 % | Ingeniería/CAD |
| Agents’ Last Exam | 59,3 % | — | 55,5 % | Tareas profesionales de uso del ordenador |
| Artificial Analysis Intelligence Index v4.1.1 en el lanzamiento de Astra | 61,2 | 65,7 | 63,1 | Índice independiente compuesto |
Un guion no significa que el modelo no tenga capacidad. Significa que la tabla comparativa de OpenAI no publicó una puntuación directamente comparable para esa entrada.
Anthropic posiciona Claude Fable 5.1 como su modelo más capaz disponible de forma general para programación ambiciosa y trabajo de conocimiento.
Su página oficial de producto destaca:
Fable 5.1 también lideró el índice compuesto Artificial Analysis v4.1.1 en el momento de su lanzamiento y sigue siendo uno de los modelos más sólidos de la clasificación independiente actual.
Por ello, es inexacto reducir Claude a un «modelo conversacional que todavía necesita un harness externo». Al igual que Astra, participa en una pila de agentes; tanto el modelo como el entorno de ejecución que lo rodea son importantes.
Las pruebas de lanzamiento de Astra son especialmente sólidas en:
OpenAI también introdujo funciones de API centradas en agentes alrededor de Astra, como las llamadas asíncronas a herramientas y las instrucciones durante el turno, y documenta que Astra puede dividir el trabajo y delegarlo en subagentes cuando el harness proporciona herramientas de colaboración.
Esto hace que Astra resulte especialmente atractivo cuando el trabajo consiste menos en producir una respuesta pulida y más en terminar un flujo de trabajo difícil a través de herramientas y entornos.
El artículo original califica el contexto largo y la multimodalidad de Astra como meramente «estándar», y los de Claude como superiores.
Las especificaciones actuales hacen que esa conclusión sea demasiado amplia.
GPT-6 Astra admite:
Claude Fable 5.1 también admite un contexto de aproximadamente 1 millón de tokens, entrada de imágenes, comprensión de archivos y PDF, programación, uso del navegador y flujos de trabajo agénticos de larga duración.
Por eso, la decisión correcta debe basarse en la carga de trabajo exacta y en la evaluación, no solo en el tamaño de la ventana de contexto.
Elige primero Claude Fable 5.1 cuando tu carga de trabajo esté dominada por:
Elige primero GPT-6 Astra cuando tu carga de trabajo esté dominada por:
Para los sistemas de producción importantes, compara ambos modelos en tareas representativas propias antes de estandarizar uno de ellos.

Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
El texto de origen atribuye las mejoras de Astra principalmente a la arquitectura y no al número de parámetros.
OpenAI no ha revelado el número de parámetros de Astra, por lo que las afirmaciones sobre el papel del tamaño del modelo no pueden verificarse directamente.
Lo que OpenAI sí ha documentado es una combinación de entrenamiento del modelo, mejoras en la inferencia y diseño del harness agéntico.
La mayor corrección que debe hacerse al texto de origen está aquí.
OpenAI no afirma que todo el Agentic Harness se haya integrado literalmente en los pesos del modelo Astra.
OpenAI documenta por separado su harness agéntico como una capa de orquestación que conecta modelos, herramientas y el entorno del usuario. También afirma que Astra está entrenado para realizar trabajos de varios pasos de forma más eficaz dentro de esos sistemas.
La arquitectura práctica se parece más a esto:
Objetivo del usuario
↓
Harness agéntico / Responses API
↓
GPT-6 Astra
↓
Solicitud de herramienta o subtarea delegada
↓
La aplicación / herramienta ejecuta el trabajo
↓
El resultado vuelve a Astra
↓
Astra actualiza su plan
↓
Continúa hasta completar la tarea
Esta distinción es importante para los desarrolladores porque la aplicación sigue siendo responsable de aspectos críticos como:
Un modelo mejor reduce la cantidad de instrucciones frágiles y lógica de orquestación que necesitas, pero no elimina la necesidad de ingeniería de sistemas.
OpenAI afirma que GPT-6 Astra está entrenado para dividir y delegar el trabajo en subagentes que pueden operar en paralelo.
Sin embargo, la orientación oficial también indica explícitamente que esto ocurre cuando implementas un sistema multiagente en tu harness y proporcionas herramientas de colaboración.
Esto significa que Astra puede aportar un comportamiento similar al de un director de proyecto:
objetivo complejo
→ dividir en flujos de trabajo independientes
→ delegar en paralelo
→ recopilar resultados
→ resolver dependencias
→ continuar la tarea principal
Pero la creación real, el entorno de ejecución y el canal de comunicación de esos subagentes siguen procediendo del sistema de agentes que rodea al modelo.
Los resultados más sólidos de Astra suelen aparecer en benchmarks en los que puede interactuar con un entorno y observar los resultados.
Un ciclo de agentes robusto tiene este aspecto:
Planificar
→ actuar
→ observar el resultado
→ evaluar si funcionó
→ revisar el plan
→ actuar de nuevo
Esto es fundamentalmente distinto de la generación de texto en una sola ejecución.
El modelo puede utilizar los resultados devueltos por las herramientas para decidir si debe continuar, reintentarlo, cambiar de estrategia o pedir aclaraciones al usuario.
Las funciones actuales de la Responses API de OpenAI refuerzan este estilo de trabajo mediante:
Las tareas agénticas prolongadas generan un problema de gestión del contexto.
Cada resultado de una herramienta, archivo, rama de razonamiento y acción anterior puede añadir más historial. Si el sistema simplemente vuelve a reproducirlo todo, el contexto se vuelve costoso y ruidoso.
Astra tiene una ventana de contexto de 1,05 millones de tokens, pero OpenAI también admite la compactación explícita para conversaciones prolongadas de la Responses API.
El patrón útil es:
historial amplio de la tarea
→ conservar el estado reciente importante
→ compactar la información antigua
→ preservar los datos necesarios para continuar
→ seguir trabajando
La compactación no es una memoria mágica. Los desarrolladores deben conservar el estado duradero del proyecto en repositorios, bases de datos, documentos u otros sistemas de almacenamiento, en lugar de depender de una conversación que crece indefinidamente.
Una de las nuevas capacidades de la API de Astra son las llamadas asíncronas a herramientas.
El modelo puede continuar razonando, llamar a otras herramientas o responder a partes independientes de una tarea mientras la aplicación sigue ejecutando otra herramienta. Cuando esa herramienta termina, la aplicación envía el resultado utilizando el identificador de la llamada original.
Esto reduce el tiempo de inactividad innecesario en flujos de trabajo en los que una herramienta es lenta.
También demuestra por qué el salto agéntico es una mejora a nivel de sistema y no simplemente el resultado de una red neuronal más grande.
Una ejecución más autónoma aumenta el coste de los errores.
Por ello, OpenAI combina Astra con medidas de protección más sólidas y supervisión de posibles desalineamientos. Sus materiales de seguridad indican que Astra es el primer modelo de OpenAI clasificado en el umbral de capacidad de ciberseguridad Crítico.
OpenAI también informa de una mejora en el comportamiento de las pruebas diseñadas para medir si el modelo va más allá de los límites de la tarea autorizada.
Para los desarrolladores, esto significa que la arquitectura debe incluir:
Un modelo de agentes más potente hace que estos controles sean más importantes, no menos.
Conclusión principal: el salto de Astra se entiende mejor como una combinación de un comportamiento del modelo más entrenado para agentes y una pila de ejecución más capaz. El razonamiento y la ejecución están coordinados de forma más estrecha, pero el harness, las herramientas, los permisos y el entorno siguen siendo capas de ingeniería independientes.
Astra es una opción sólida cuando trabajas en:
Estas son las áreas en las que las evaluaciones publicadas por OpenAI muestran la separación más clara frente a GPT-5.6 Sol.
Astra suele ser innecesario para:
Para esos escenarios, GPT-5.6 Terra o Luna pueden ser puntos de partida más económicos, mientras que Sol sigue siendo una opción profesional predeterminada sólida.
El precio de 10/50 dólares por token de Astra es muy superior al precio de 4/20 dólares de GPT-5.6 Sol.
Pero los flujos de trabajo agénticos no siempre son más económicos cuando se elige el token más barato.
Un modelo de menor precio puede requerir:
OpenAI afirma que, en varias evaluaciones de lanzamiento, Astra obtuvo mejores resultados utilizando menos tokens de salida y, en ocasiones, con un coste estimado menor por tarea de benchmark completada, a pesar de su precio por token más elevado.
Esta es la forma adecuada de evaluar un modelo de agentes en producción:
Coste total de una tarea completada con éxito
= tokens del modelo
+ costes de las herramientas
+ reintentos
+ latencia
+ revisión humana
+ coste de los fallos
La tendencia general del artículo original resulta convincente.
Durante años, las comparaciones entre modelos de frontera se centraron en gran medida en:
Todo ello sigue siendo importante.
Pero la siguiente etapa plantea cada vez más estas preguntas:
Astra es uno de los ejemplos más claros de este cambio.
Esta es la conclusión de ingeniería más importante.
Un modelo puede ser altamente agéntico y seguir necesitando un harness.
De hecho, cuanto mejor se vuelve el modelo para ejecutar tareas complejas, más valioso resulta un harness bien diseñado, porque proporciona:
Por eso, los desarrolladores no deberían dejar de aprender ingeniería de agentes porque Astra sea mejor en este ámbito.
Deberían aprenderla con mayor profundidad.
GPT-6 Astra no debe considerarse un sustituto universal ni descartarse porque una puntuación compuesta general sea similar a la de otro modelo de frontera.
Su valor más sólido aparece cuando el trabajo es un flujo de trabajo, no una instrucción aislada.
Si tu aplicación necesita principalmente respuestas breves, un modelo más económico puede ser la mejor decisión de ingeniería.
Si tu aplicación necesita que un sistema de IA inspeccione, decida, actúe, verifique, se recupere y continúe durante muchos pasos, Astra resulta mucho más interesante.
Esa es la verdadera señal generacional.
GPT-6 Astra es el modelo insignia actual de OpenAI para trabajos difíciles de extremo a extremo. OpenAI lo posiciona para razonamiento complejo, programación, uso del ordenador, investigación, flujos de trabajo profesionales y tareas agénticas con muchas herramientas.
Es más preciso llamar a Astra un modelo optimizado para agentes que afirmar que todo el harness de agentes vive dentro del modelo. Astra está entrenado para el trabajo de varios pasos, el uso de herramientas y la delegación en subagentes, mientras que Codex, ChatGPT Work o tu propia aplicación siguen proporcionando el harness externo, las herramientas, los permisos y el entorno de ejecución.
El identificador del modelo en la API es gpt-6-astra. Actualmente, OpenAI lo ofrece mediante la Responses API y Chat Completions, aunque la documentación sobre llamadas a herramientas para Astra se centra en la Responses API.
El precio estándar de la API es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. La entrada almacenada en caché cuesta 1 dólar por millón de tokens, las escrituras de caché cuestan 12,50 dólares por millón y las solicitudes que superan los 272.000 tokens de entrada utilizan tarifas superiores para contexto largo según las reglas de precios actuales.
Astra es considerablemente más fuerte en varias evaluaciones agénticas y de interacción con entornos publicadas, entre ellas ARC-AGI-3, AutomationBench, Terminal-Bench Science y tareas recientes de ciberseguridad. Sol sigue siendo mucho más económico y continúa siendo una buena opción para el razonamiento profesional general y la programación cuando no se necesita una ejecución de tareas al nivel de Astra.
Ambos son modelos de frontera diseñados para trabajos complejos y prolongados. Astra muestra actualmente resultados especialmente sólidos en las comparaciones de OpenAI sobre uso del ordenador, automatización, ciencia, CAD y ciberseguridad, mientras que Claude Fable 5.1 es muy fuerte en programación y trabajo de conocimiento, y ha liderado evaluaciones compuestas recientes de Artificial Analysis, según la versión del índice y la configuración de esfuerzo.
OpenAI documenta una ventana de contexto de 1.050.000 tokens con hasta 128.000 tokens de salida. Las solicitudes muy largas son más costosas y los desarrolladores deberían utilizar igualmente la compactación y un estado externo persistente para los flujos de trabajo agénticos prolongados.
Elige Astra cuando unas tasas de finalización superiores en trabajos difíciles y de varios pasos puedan justificar el precio premium. Para extracción rutinaria, atención al cliente, redacción, RAG sencillo o tareas de gran volumen y bajo riesgo, un modelo de menor coste suele ser un mejor punto de partida.
GPT-6 Astra representa un avance importante para los flujos de trabajo agénticos, pero la descripción más precisa no es «OpenAI introdujo todo el Agent Harness dentro del modelo». Astra está mejor entrenado para la ejecución prolongada y de varios pasos, mientras que Codex, ChatGPT Work, la Responses API y las aplicaciones personalizadas siguen proporcionando la orquestación, las herramientas, los permisos y el entorno que lo rodean.
Sus mejoras publicadas más destacadas aparecen en razonamiento interactivo, uso del ordenador, automatización profesional, flujos de trabajo científicos, CAD y evaluaciones de ciberseguridad. En las métricas compuestas amplias de inteligencia, la diferencia frente a otros modelos de frontera puede ser mucho menor, por lo que Astra no debería sustituir automáticamente a los modelos más económicos en el trabajo rutinario.
Para los desarrolladores, el cambio estratégico es claro: la selección de modelos depende cada vez más de la finalización satisfactoria de tareas dentro de un sistema, y no solo de la calidad de una respuesta en un chat.
GPT-6 Astra importa sobre todo cuando el problema no es «¿Qué debería decir la IA?», sino «¿Puede la IA llevar el trabajo de forma segura desde el principio hasta el final?»
Empieza con una sola frase y obtén un sitio completo en minutos.