Подробный разбор GPT-6 Astra: агентные рабочие процессы, бенчмарки, цены и сравнение с Claude Fable 5.1

OpenAI представила GPT-6 Astra 3 сентября 2026 года, хотя в Пекине уже было 4 сентября. OpenAI называет его своей самой интеллектуальной и лучше всего согласованной моделью на сегодняшний день и позиционирует для сложной сквозной работы с компьютером, браузером, разработкой программного обеспечения, кибербезопасностью, научными задачами и профессиональными рабочими процессами.
Такая формулировка важна, поскольку Astra не стоит воспринимать как простой «следующий чат-бот».
Наиболее заметные улучшения сосредоточены в задачах, где модели необходимо работать в течение множества этапов: исследовать среду, использовать инструменты, пересматривать план, обрабатывать сбои, управлять программным обеспечением и выдавать готовый результат, а не один отдельный ответ.
В исходной статье этот сдвиг описывается как начало «нативной эры агентов». Это полезная характеристика в общем направлении, однако реализация сложнее, чем утверждение о том, что весь агентный исполнительный контур был перенесён непосредственно в веса модели.
Собственная документация OpenAI описывает два взаимодействующих уровня:
Иными словами, Astra значительно сильнее ориентирована на работу в качестве агента, но приложению по-прежнему нужна исполнительная среда вокруг модели.

В этой статье сохраняется исходная структура из пяти частей. Astra рассматривается с пяти сторон:

Прежде чем рассматривать показатели бенчмарков, полезно отделить модель от окружающего продуктового стека.
Обычный рабочий процесс языковой модели легко представить так:
Запрос пользователя
→ рассуждение модели
→ ответ модели
Для более сложного агента окружающее приложение обычно добавляет ещё один уровень:
Цель пользователя
→ агентный исполнительный контур
→ модель
→ вызов инструмента
→ результат из среды
→ модель
→ следующее действие
→ итоговый результат
Именно внешний исполнительный контур определяет, как предоставляются инструменты, как возвращаются результаты, как переносится контекст, какие разрешения применяются и когда цикл должен завершиться.
OpenAI по-прежнему использует такую архитектуру. Более того, компания отдельно описывала агентный исполнительный контур Codex/ChatGPT Work как слой оркестрации на Rust, соединяющий модели, инструменты и пользовательскую среду.
Astra глубже обучена поведению, которое делает исполнительный контур эффективным.
В рекомендациях OpenAI по работе с моделью выделяются такие возможности, как:
Поэтому эту разницу точнее описывать как совместное проектирование модели и исполнительного контура, а не как «исчезновение исполнительного контура внутри модели».
Практическая цель теперь заключается не только в следующем:
Astra прежде всего ориентирована на более сложные задачи выполнения, включая:
В материалах о запуске OpenAI неоднократно подчёркивает сквозную работу, а не улучшение разговорного характера модели.
Полезный способ понять смену поколений выглядит так:
Рабочий процесс, ориентированный на старые модели:
сильное рассуждение + внешняя оркестрация
Рабочий процесс GPT-6 Astra:
более сильное рассуждение, обученное для агентной работы + внешняя оркестрация, спроектированная для его использования
Вторая система более эффективна, поскольку сама модель лучше справляется с планированием, использованием обратной связи, работой с инструментами, делегированием и сохранением последовательности на протяжении длительных траекторий выполнения задач.

Наиболее полезная мысль исходной статьи заключается в том, что Astra не следует автоматически считать заменой каждой более дешёвой модели для любой рабочей нагрузки.
Самые значительные улучшения проявляются в сложных агентных и профессиональных задачах.
В приведённой ниже таблице используются значения из официального сравнения при запуске GPT-6 Astra, опубликованного OpenAI, если они доступны.
| Бенчмарк | GPT-6 Astra | GPT-5.6 Sol | Что проверяется |
|---|---|---|---|
| ARC-AGI-3 | 99,9% | 7,8% | Новые интерактивные среды и выявление абстрактных правил |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | Математика исследовательского уровня |
| ExploitBench | 100,0% | 78,5% | Разработка эксплойтов для известных уязвимостей в условиях оценки |
| ExploitBench, июнь—август 2026 года | 39,0% | 5,5% | Недавние уязвимости после даты отсечения знаний модели |
| AutomationBench | 41,4% | 18,1% | Профессиональная автоматизация в несколько этапов |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | Научные рабочие процессы с использованием кода и терминальных инструментов |
| BenchCAD | 95,9% | 83,3% | Восстановление CAD-моделей по изображениям с нескольких ракурсов |
| Agents’ Last Exam | 59,3% | 53,6% | Сложные профессиональные задачи с использованием компьютера |
| Artificial Analysis Intelligence Index v4.1.1 на момент запуска | 61,2 | 60,9 | Составной независимый индекс интеллектуальных возможностей |
При чтении этой таблицы важно учитывать несколько деталей.
Во-первых, в заголовочном тексте OpenAI округляет результат FrontierMath Tier 4 до 98%, тогда как в таблице бенчмарка для оценки v2 указано 97,6%.
Во-вторых, впечатляющий результат ARC-AGI-3 получен в интерактивном бенчмарке агентного типа. OpenAI отмечает, что Astra запускалась с исполнительным контуром Responses API, а конфигурация оценки может отличаться от той, что используется в рабочем ChatGPT.
В-третьих, показатели кибербезопасности измерялись в контролируемых условиях оценки. Теперь OpenAI относит Astra к уровню Critical по возможностям в области кибербезопасности в соответствии с Preparedness Framework и применяет усиленные меры защиты для таких возможностей.
ARC-AGI-3 — наиболее наглядный пример.
В опубликованной OpenAI оценке Astra набирает 99,9% против 7,8% у GPT-5.6 Sol. Бенчмарк требует от системы выводить цели и правила через взаимодействие, а не просто отвечать на статический запрос.
Та же закономерность проявляется в нескольких операционных бенчмарках:
Именно поэтому Astra может восприниматься как гораздо более существенный скачок поколения в агентных рабочих процессах, чем в обычном чате.
В Artificial Analysis Intelligence Index v4.1.1 на момент запуска OpenAI сообщала следующие значения:
GPT-6 Astra: 61,2
GPT-5.6 Sol: 60,9
Claude Fable 5.1: 65,7
Разрыв между Astra и Sol в этом составном индексе был минимальным по сравнению с разрывом в ARC-AGI-3 или Terminal-Bench Science.
С тех пор Artificial Analysis перешла на версию v4.2 с другим набором бенчмарков, поэтому абсолютные значения изменились. Однако общий вывод сохраняется: главное преимущество Astra заключается не в том, что каждый общий показатель интеллектуальных возможностей внезапно удвоился.
Стандартные цены OpenAI API для GPT-6 Astra составляют:
| Тип токенов | Цена за 1 млн токенов |
|---|---|
| Входные токены | $10,00 |
| Кэшированные входные токены | $1,00 |
| Запись в кэш | $12,50 |
| Выходные токены | $50,00 |
Сейчас GPT-5.6 Sol стоит дешевле: $4 за миллион входных токенов и $20 за миллион выходных токенов.
Поэтому Astra имеет наибольший смысл в тех случаях, когда более высокая вероятность успешного выполнения задачи компенсирует повышенную цену токенов.
Есть и ещё одна деталь ценообразования при работе с длинным контекстом: запросы более чем с 272 тыс. входных токенов тарифицируются по повышенным ставкам для всего запроса — согласно текущей странице модели Astra, ставки для входных токенов и кэша увеличиваются в 2 раза, а для выходных токенов — в 1,5 раза.
В исходной статье GPT-4o использовалась как недорогой вариант общего назначения. GPT-4o по-прежнему присутствует в каталоге API, однако текущие рекомендации OpenAI для большинства новых интеграций указывают на более современные модели семейства GPT-5.6.
Более актуальное руководство по выбору выглядит так:
| Сценарий | С чего рекомендуется начать | Почему |
|---|---|---|
| Задачи общего назначения с большим объёмом и высокой чувствительностью к стоимости | GPT-5.6 Luna или Terra | Более низкая цена и достаточные возможности для многих стандартных рабочих нагрузок |
| Профессиональное рассуждение и программирование | GPT-5.6 Sol | Сильные профессиональные результаты при меньшей цене по сравнению с Astra |
| Сложные сквозные рабочие процессы, управление компьютером, научные задачи и продвинутая агентная работа | GPT-6 Astra | Лучше всего подходит для сложного многоэтапного выполнения и работы с большим числом инструментов |
| Устаревшая интеграция с GPT-4o | GPT-4o можно оставить при необходимости | Модель по-прежнему доступна, но не является стандартной рекомендацией для новых передовых рабочих процессов |
Практическое правило простое:
Начинайте с самой дешёвой модели, которая надёжно выполняет задачу. Переходите на Astra, когда успешность, автономность или качество выполнения важнее непосредственной цены токенов.

В исходной статье утверждается, что OpenAI и Anthropic движутся по полностью разным направлениям.
В акценте есть доля истины, однако текущие продукты пересекаются сильнее, чем предполагает такая формулировка.
Claude Fable 5.1 также специально создана для длительных агентных задач, программирования, работы в браузере, корпоративных процессов и управляемого выполнения задач агентами. Astra также является мультимодальной моделью с контекстом на 1 млн токенов и сильными общими возможностями рассуждения.
Поэтому точнее сравнивать их не по принципу «одна является агентом, а другая — нет».
Важнее понять, в каких направлениях каждая система сейчас демонстрирует наиболее убедительные результаты и делает основной продуктовый акцент.
Следующие значения взяты из таблицы сравнения OpenAI при запуске, если не указано иное.
| Бенчмарк | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | Измеряемое направление |
|---|---|---|---|---|
| ARC-AGI-3 | 99,9% | — | 30,2% | Интерактивное абстрактное рассуждение |
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% | 73,2% | Продвинутая математика |
| ExploitBench | 100,0% | — | 70,0% | Оценка возможностей в сфере кибербезопасности |
| AutomationBench | 41,4% | 31,4% | 26,9% | Профессиональная автоматизация |
| Terminal-Bench Science 0.1 | 64,6% | 52,6% | 30,0% | Научные рабочие процессы |
| BenchCAD | 95,9% | 84,3% | 82,1% | Инженерия и CAD |
| Agents’ Last Exam | 59,3% | — | 55,5% | Профессиональные задачи с использованием компьютера |
| Artificial Analysis Intelligence Index v4.1.1 на момент запуска Astra | 61,2 | 65,7 | 63,1 | Составной независимый индекс |
Прочерк не означает, что модель не способна выполнять задачу. Он означает, что в таблице сравнения OpenAI для этой позиции не был опубликован сопоставимый показатель.
Anthropic позиционирует Claude Fable 5.1 как свою самую мощную общедоступную модель для амбициозного программирования и интеллектуальной работы.
На официальной странице продукта подчёркиваются:
Fable 5.1 также возглавляла составной индекс Artificial Analysis v4.1.1 на момент запуска и остаётся одной из сильнейших моделей в текущем независимом рейтинге.
Поэтому неправильно сводить Claude к «чат-модели, которой по-прежнему нужен внешний исполнительный контур». Как и Astra, она участвует в агентном стеке; значение имеют и модель, и окружающая среда выполнения.
Данные запуска Astra особенно сильны в следующих направлениях:
OpenAI также представила ориентированные на агентов возможности API для Astra, включая асинхронные вызовы инструментов и управление в середине хода выполнения. В документации указано, что Astra может разделять работу и делегировать задачи субагентам, если исполнительный контур предоставляет инструменты для совместной работы.
Это делает Astra особенно привлекательной, когда задача заключается не в подготовке одного отшлифованного ответа, а в завершении сложного рабочего процесса в нескольких инструментах и средах.
В исходной статье длинный контекст и мультимодальность Astra названы лишь «стандартными», а возможности Claude — более сильными.
С учётом текущих спецификаций такой вывод слишком широк.
GPT-6 Astra поддерживает:
Claude Fable 5.1 также поддерживает контекст класса примерно 1 млн токенов, ввод изображений, понимание файлов и PDF, программирование, работу в браузере и длительные агентные рабочие процессы.
Поэтому правильное решение следует принимать на основе конкретной рабочей нагрузки и результатов тестирования, а не только размера контекстного окна.
Сначала выбирайте Claude Fable 5.1, если ваша рабочая нагрузка в основном связана со следующими задачами:
Сначала выбирайте GPT-6 Astra, если ваша рабочая нагрузка в основном связана со следующими задачами:
Для важных производственных систем протестируйте обе модели на собственных репрезентативных задачах, прежде чем выбирать стандартную модель.

Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Исходная статья связывает улучшения Astra главным образом с архитектурой, а не с количеством параметров.
OpenAI не раскрыла количество параметров Astra, поэтому утверждения о роли размера модели нельзя напрямую проверить.
Из опубликованных материалов OpenAI известно о сочетании обучения модели, улучшений на этапе вывода и проектирования агентного исполнительного контура.
Именно здесь исходный материал нуждается в наиболее существенном уточнении.
OpenAI не утверждает, что весь агентный исполнительный контур буквально встроен в веса модели Astra.
OpenAI отдельно описывает агентный исполнительный контур как слой оркестрации, соединяющий модели, инструменты и пользовательскую среду. Компания также сообщает, что Astra обучена эффективнее выполнять многоэтапную работу внутри таких систем.
Практическая архитектура скорее выглядит так:
Цель пользователя
↓
Агентный исполнительный контур / Responses API
↓
GPT-6 Astra
↓
Запрос инструмента или делегированная подзадача
↓
Приложение или инструмент выполняет работу
↓
Результат возвращается Astra
↓
Astra обновляет план
↓
Работа продолжается до завершения
Это различие важно для разработчиков, поскольку приложение по-прежнему отвечает за критически важные компоненты, такие как:
Более сильная модель уменьшает объём хрупких промптов и оркестрационной логики, которые необходимо создавать, но не устраняет потребность в системной инженерии.
OpenAI сообщает, что GPT-6 Astra обучена разделять работу и делегировать задачи субагентам, которые могут действовать параллельно.
Однако в официальных рекомендациях также прямо указано, что это происходит при реализации мультиагентной системы в собственном исполнительном контуре, если вы предоставляете инструменты для совместной работы.
Это означает, что Astra может выполнять функцию своеобразного руководителя проекта:
сложная цель
→ разделение на независимые направления работы
→ параллельное делегирование
→ сбор результатов
→ устранение зависимостей
→ продолжение основной задачи
Но создание субагентов, среда их выполнения и канал коммуникации по-прежнему предоставляются окружающей агентной системой.
Наиболее сильные результаты Astra часто получаются в бенчмарках, где модель может взаимодействовать со средой и наблюдать последствия своих действий.
Надёжный агентный цикл выглядит так:
Планирование
→ действие
→ наблюдение за результатом
→ проверка успешности
→ пересмотр плана
→ новое действие
Это принципиально отличается от одноразовой генерации текста.
Модель может использовать возвращённые инструментом результаты, чтобы решить, продолжать ли работу, повторить попытку, изменить стратегию или запросить у пользователя уточнение.
Текущие возможности Responses API OpenAI поддерживают такой стиль работы благодаря следующим функциям:
Длительные агентные задачи создают проблему управления контекстом.
Каждый результат инструмента, файл, ветка рассуждений и предыдущее действие могут увеличивать историю. Если система просто продолжает передавать всё целиком, контекст становится дорогим и зашумлённым.
У Astra есть контекстное окно на 1,05 млн токенов, однако OpenAI также поддерживает явную компактизацию для длительных диалогов Responses API.
Полезный подход выглядит так:
большая история задачи
→ сохранение важного недавнего состояния
→ компактизация старой информации
→ сохранение фактов, необходимых для продолжения
→ продолжение работы
Компактизация не является магической памятью. Разработчикам по-прежнему следует сохранять долговременное состояние проекта в репозиториях, базах данных, документах или других хранилищах, а не полагаться на один бесконечно растущий диалог.
Одной из новых возможностей API Astra является асинхронный вызов инструментов.
Модель может продолжать рассуждение, вызывать другие инструменты или отвечать на независимые части задачи, пока приложение выполняет другой инструмент. После завершения работы этого инструмента приложение отправляет его результат обратно, используя исходный идентификатор вызова.
Это сокращает ненужное время ожидания в рабочих процессах, где один из инструментов работает медленно.
Кроме того, данный механизм показывает, почему агентный скачок является улучшением на уровне системы, а не просто результатом создания более крупной нейронной сети.
Чем автономнее становится выполнение, тем выше цена ошибки.
Поэтому OpenAI сочетает Astra с более строгими мерами защиты и мониторингом несогласованного поведения. В материалах по безопасности говорится, что Astra стала первой моделью OpenAI, отнесённой к уровню Critical по возможностям в области кибербезопасности.
OpenAI также сообщает об улучшении поведения в тестах, предназначенных для проверки того, выходит ли модель за пределы авторизованной задачи.
Для разработчиков это означает, что архитектура должна включать:
Более сильная агентная модель делает эти средства контроля ещё более важными, а не менее важными.
Ключевой вывод: скачок Astra лучше всего понимать как сочетание более сильного поведения модели, обученной для агентной работы, и более развитого стека выполнения. Рассуждение и выполнение теснее согласованы, но исполнительный контур, инструменты, разрешения и среда остаются отдельными инженерными уровнями.
Astra — сильный вариант, если вы работаете над следующими задачами:
Именно в этих направлениях опубликованные OpenAI оценки показывают наиболее заметное преимущество над GPT-5.6 Sol.
Astra часто избыточна для следующих задач:
Для таких сценариев GPT-5.6 Terra или Luna могут быть более экономичными отправными вариантами, а Sol остаётся сильным профессиональным выбором по умолчанию.
Цена Astra — $10/$50 за токены — значительно выше, чем $4/$20 у GPT-5.6 Sol.
Однако агентные рабочие процессы не всегда оказываются дешевле при выборе модели с самой низкой стоимостью токенов.
Более дешёвая модель может потребовать:
OpenAI сообщает, что в нескольких оценках при запуске Astra показала более сильные результаты с меньшим числом выходных токенов и иногда с более низкой расчётной стоимостью одной завершённой задачи бенчмарка, несмотря на более высокую цену отдельных токенов.
Именно так следует оценивать агентную модель в производственной среде:
Полная стоимость успешной задачи
= токены модели
+ стоимость инструментов
+ повторные попытки
+ задержка
+ проверка человеком
+ стоимость ошибки
Более широкий тренд, описанный в исходной статье, выглядит убедительно.
В течение многих лет сравнение передовых моделей в значительной степени основывалось на следующих параметрах:
Все они по-прежнему важны.
Но следующий этап всё чаще ставит другие вопросы:
Astra — один из наиболее очевидных примеров этого сдвига.
Это самый важный инженерный вывод.
Модель может быть высокоориентированной на агентную работу и при этом требовать исполнительного контура.
Более того, чем лучше модель справляется со сложными задачами, тем ценнее хорошо спроектированный исполнительный контур, поскольку он предоставляет:
Поэтому разработчикам не следует прекращать изучение агентной инженерии только потому, что Astra лучше работает с агентами.
Напротив, её следует изучать ещё глубже.
GPT-6 Astra не следует считать универсальной заменой, но и не стоит недооценивать её только потому, что общий составной показатель близок к показателям другой передовой модели.
Её наибольшая ценность проявляется тогда, когда задача представляет собой рабочий процесс, а не просто запрос.
Если вашему приложению в основном нужны короткие ответы, более дешёвая модель может быть лучшим инженерным выбором.
Если приложению требуется система искусственного интеллекта, которая может исследовать, принимать решения, действовать, проверять результат, восстанавливаться и продолжать работу в течение множества этапов, Astra становится гораздо более интересной.
В этом и заключается настоящий сигнал смены поколения.
GPT-6 Astra — текущая флагманская модель OpenAI для сложной сквозной работы. OpenAI позиционирует её для комплексного рассуждения, программирования, управления компьютером, исследований, профессиональных рабочих процессов и агентных задач с большим количеством инструментов.
Точнее называть Astra моделью, оптимизированной для агентной работы, чем утверждать, что весь агентный исполнительный контур находится внутри модели. Astra обучена многоэтапной работе, использованию инструментов и делегированию задач субагентам, тогда как Codex, ChatGPT Work или ваше собственное приложение по-прежнему предоставляют внешний исполнительный контур, инструменты, разрешения и среду выполнения.
Идентификатор модели в API — gpt-6-astra. Сейчас OpenAI предоставляет её через Responses API и Chat Completions, однако описание вызова инструментов для Astra ориентировано на Responses API.
Стандартная цена API составляет $10 за миллион входных токенов и $50 за миллион выходных токенов. Кэшированные входные токены стоят $1 за миллион, запись в кэш — $12,50 за миллион, а для запросов объёмом более 272 тыс. входных токенов действуют повышенные ставки для длинного контекста в соответствии с текущими правилами ценообразования.
Astra значительно сильнее в нескольких опубликованных оценках агентных возможностей и взаимодействия со средой, включая ARC-AGI-3, AutomationBench, Terminal-Bench Science и недавние задачи по кибербезопасности. Sol стоит существенно дешевле и остаётся сильным выбором для общего профессионального рассуждения и программирования, когда выполнение задач на уровне Astra не требуется.
Обе модели предназначены для сложной длительной работы. Astra особенно сильна в опубликованных OpenAI сравнениях управления компьютером, автоматизации, научных задач, CAD и кибербезопасности, тогда как Claude Fable 5.1 чрезвычайно эффективна в программировании и интеллектуальной работе и возглавляла последние составные оценки Artificial Analysis — в зависимости от версии индекса и настроек усилий рассуждения.
OpenAI указывает контекстное окно на 1 050 000 токенов и возможность вывода до 128 000 токенов. Очень длинные запросы стоят дороже, поэтому разработчикам всё равно следует использовать компактизацию и долговременное внешнее состояние для длительных агентных рабочих процессов.
Выбирайте Astra, когда более высокий процент успешного выполнения сложной многоэтапной работы оправдывает премиальную цену. Для стандартного извлечения данных, поддержки, подготовки текстов, простого RAG или задач с большим объёмом и низким риском обычно лучше начать с более дешёвой модели.
GPT-6 Astra — существенный шаг вперёд для агентных рабочих процессов, однако точнее всего описывать её не как модель, в которую OpenAI встроила весь агентный исполнительный контур. Astra лучше обучена длительному многоэтапному выполнению задач, тогда как Codex, ChatGPT Work, Responses API и пользовательские приложения по-прежнему предоставляют окружающие оркестрацию, инструменты, разрешения и среду выполнения.
Наиболее заметные опубликованные улучшения проявляются в интерактивном рассуждении, управлении компьютером, профессиональной автоматизации, научных рабочих процессах, CAD и оценках кибербезопасности. В широких составных показателях интеллектуальных возможностей разница с другими передовыми моделями может быть значительно меньше, поэтому Astra не должна автоматически заменять более дешёвые модели в стандартных задачах.
Для разработчиков стратегическое изменение очевидно: выбор модели всё чаще определяется успешным выполнением задачи внутри системы, а не только качеством ответа в окне чата.
GPT-6 Astra наиболее важна тогда, когда вопрос звучит не «что должен сказать ИИ?», а «может ли ИИ безопасно довести работу от начала до конца?»
Начните с одной фразы и получите полноценный сайт за считанные минуты.