Введение
Серия GPT-5.6 от OpenAI включает три уровня моделей: Sol, Terra и Luna.
Вместо единой модели для всех рабочих нагрузок OpenAI дифференцирует серию по возможностям, стоимости и пропускной способности:
- GPT-5.6 Sol — флагманская модель, предназначенная для сложных профессиональных задач, программирования, исследований, кибербезопасности и долгосрочных агентских задач.
- GPT-5.6 Terra ориентирована на рабочие нагрузки, которые по-прежнему требуют высокой производительности, но с более строгими требованиями к стоимости.
- GPT-5.6 Luna — самый быстрый и самый дешевый участник серии, подходящий для чувствительных к стоимости и высокопроизводительных рабочих нагрузок.
OpenAI впервые представила серию в июне 2026 года, а полный запуск состоялся 9 июля. Оригинальная статья AIBase была опубликована 30 июля и посвящена эффективности, лежащей в основе этого запуска: лучшая производительность на токен, более дешёвые уровни моделей, а также оптимизация инфраструктуры и агентских циклов, направленная на снижение общей стоимости выполнения реальных задач.
Этот акцент имеет решающее значение. Для производственных систем ИИ всё более важным показателем становится не только то, насколько умной выглядит модель в изоляции, но и какой объём полезной работы она может выполнить за заданное время, вычислительные ресурсы и деньги.
Три модели GPT-5.6 для разных рабочих нагрузок
OpenAI описывает Sol, Terra и Luna как постоянные уровни возможностей, а не временные суффиксы.
Номер поколения идентифицирует серию GPT-5.6, а названия различают ожидаемые уровни производительности и стоимости.
| Модель | Позиционирование | Цена API (ввод) | Цена API (вывод) | Контекстное окно | Макс. вывод |
|---|---|---|---|---|---|
| GPT-5.6 Sol | Флагманская модель для сложных профессиональных задач | $5 за 1 млн токенов | $30 за 1 млн токенов | 1 050 000 токенов | 128 000 токенов |
| GPT-5.6 Terra | Баланс интеллекта и стоимости | $2,50 за 1 млн токенов | $15 за 1 млн токенов | 1 050 000 токенов | 128 000 токенов |
| GPT-5.6 Luna | Чувствительные к стоимости высокопроизводительные нагрузки | $1 за 1 млн токенов | $6 за 1 млн токенов | 1 050 000 токенов | 128 000 токенов |
На страницах всех трёх моделей указана дата завершения знаний: 16 февраля 2026 года, и они поддерживают ввод текста с изображениями и вывод текста.
Псевдоним API gpt-5.6 направляет к GPT-5.6 Sol.
GPT-5.6 Sol: флагманская модель
Sol — самый мощный уровень GPT-5.6 от OpenAI.
OpenAI позиционирует его для:
- Сложного программирования
- Долгосрочных агентских рабочих процессов
- Профессиональной экспертной работы
- Научных исследований
- Кибербезопасности
- Использования компьютера
- Мультимодального анализа
- Высокоценных задач рассуждения
Согласно рейтингу Artificial Analysis Coding Agent Index v1.1, OpenAI сообщает, что GPT-5.6 Sol в режиме максимального рассуждения набрал 80 баллов, в то время как Claude Fable 5 в той же таблице получил 77,2 балла.
OpenAI также утверждает, что в этом сравнении Sol использовал менее половины выходных токенов и менее половины времени, при этом его предполагаемая стоимость задачи была ниже.
Это не означает, что Sol превосходит всех по каждому показателю. Собственные таблицы OpenAI показывают, что модели конкурентов лидируют в некоторых оценках. Более последовательным преимуществом GPT-5.6 является производительность на токен и на доллар, а не абсолютное лидерство в каждой категории задач.
GPT-5.6 Terra: сбалансированный уровень
Terra — промежуточная модель в серии.
OpenAI описывает её возможности как сопоставимые с уровнем GPT-5.5, при этом тарифы составляют:
- $2,50 за миллион входных токенов
- $15 за миллион выходных токенов
Это вдвое меньше цены в $5/$30, соответствующей предыдущему флагманскому уровню.
Таким образом, Terra подходит для рабочих нагрузок, где командам требуются мощные рассуждения и агентские возможности, но нет необходимости задействовать Sol для каждого запроса.
Типичные примеры включают:
- Внутренние агенты предприятий
- Под-агенты кодирования
- Анализ документов
- Исследовательские процессы
- Автоматизация с интенсивным использованием инструментов
- Высокообъёмные профессиональные задачи
Модель поддерживает такое же контекстное окно в 1,05 млн токенов и максимальный вывод в 128 000 токенов, как и Sol.
GPT-5.6 Luna: самый дешёвый уровень GPT-5.6
Luna разработана для рабочих нагрузок, где пропускная способность и стоимость имеют первостепенное значение.
Её цена API составляет:
- $1 за миллион входных токенов
- $6 за миллион выходных токенов
Это делает ввод и вывод на 80% дешевле, чем у Sol.
OpenAI описывает Luna как свою самую быструю и самую доступную модель GPT-5.6. Она подходит для следующих рабочих нагрузок:
- Классификация
- Извлечение
- Маршрутизация
- Высокообъёмная обработка
- Лёгкие под-агенты
- Повторяющиеся структурированные задачи
- Приложения, которые могут передавать сложные случаи Terra или Sol
Более низкая цена не означает, что Luna — это просто практическая модель без рассуждений. Она по-прежнему поддерживает функции рассуждения GPT-5.6 и экосистему инструментов OpenAI, но её пиковые возможности ниже, чем у Sol.

Эффективность — ключевая тема GPT-5.6
В статье AIBase подчёркивается, что GPT-5.6 — это не просто обновление качества модели.
Более масштабная инженерная цель — увеличить объём полезной работы, производимой на один токен, и уменьшить накладные расходы на выполнение агентских задач.
Официальные материалы OpenAI поддерживают это более широкое направление.
Компания утверждает, что GPT-5.6 обучена выполнять полезную работу с меньшим количеством выходных токенов, и её руководство для разработчиков рекомендует при миграции с GPT-5.5 или GPT-5.4 тестировать ту же степень усилий рассуждения — обычно снижая уровень на одну ступень.
Это важно, потому что рекламируемая цена на токены — лишь часть стоимости агентских задач.
Многошаговый рабочий процесс может потреблять бюджет через:
- Большие промпты
- Повторяющийся контекст
- Токены рассуждения
- Определения инструментов
- Выводы инструментов
- Циклы повторных попыток
- Множественные раунды модели
- Под-агенты
- Длинные финальные ответы
Поэтому модель, требующая меньше шагов, даже если её номинальная ставка за токен кажется сопоставимой, может на практике оказаться дешевле.
Производительность Sol в кодировании улучшает соотношение цены и производительности
Основное внимание в статье уделено производительности кодирующего агента Sol.
Текущая эталонная таблица OpenAI
Отчет:
| Оценка кодирования | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 |
|---|---|---|---|---|
| Индекс кодирующего интеллекта AI-анализа v1.1 | 80 | 77,4 | 74,6 | 76,4 |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% | 59,4% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% | 67,0% |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% | 85,6% |
Эти данные взяты из стартовой таблицы, опубликованной OpenAI, и должны рассматриваться в контексте конкретных оценочных фреймворков и настроек.
Например, результаты бенчмаркинга могут варьироваться в зависимости от:
- глубины рассуждений
- фреймворка агента
- доступности инструментов
- временных ограничений
- количества оценочных сидов
- снимков модели
- формата подсказок
OpenAI также отмечает, что часть сравнений стоимости и задержки основана на автономных оценках производственного поведения, а не на прямых счетах от каждого конкурирующего сервиса.
Практический урок заключается в том, что модели следует тестировать на репрезентативных производственных задачах, а не выбирать только на основе рейтингов.
Оптимизируется стек вывода, а не только модель
В источнике AIBase описывается оптимизация всего стека сервисов, включая:
- балансировку нагрузки
- спекулятивное декодирование
- оптимизацию кэша
- оптимизированные GPU-ядра
Также сообщается, что работа вывода повысила эффективность генерации токенов более чем на 15%.
Эти детали инфраструктурного обслуживания представлены в отчете AIBase. Текущая публичная стартовая страница GPT-5.6 от OpenAI подтверждает более широкие усилия по улучшению сервиса и эффективности исследований, но точные базовые данные следует рассматривать как отчет источника, если они не воспроизведены в технических публикациях OpenAI или бенчмарках, документирующих полную методологию.
Из документации OpenAI можно независимо подтвердить, что GPT-5.6 добавил множество механизмов, направленных на сокращение ненужной работы модели.
К ним относятся:
- более эффективная генерация токенов
- явный кэш подсказок
- персистентный вывод
- программные вызовы инструментов
- мультиагентное выполнение для подходящих рабочих нагрузок
- настраиваемая глубина рассуждений
Инженерное направление последовательно: уменьшение избыточной работы вокруг каждого успешного задания.
Кэш подсказок становится более явным
GPT-5.6 вводит более предсказуемый кэш подсказок.
Документация OpenAI поддерживает явные точки разрыва кэша, позволяя разработчикам решать, какие повторно используемые префиксы подсказок следует кэшировать.
Для моделей GPT-5.6:
- Запись в кэш тарифицируется в 1,25 раза по сравнению с обычной некэшированной скоростью ввода.
- Чтение из кэша может получить скидку 90% на кэшированный ввод.
- Документация OpenAI указывает минимальный срок жизни кэша для нового поведения — 30 минут.
Это меняет подход разработчиков к долгоживущим агентам.
Если большие системные подсказки, каталоги инструментов, разделы политик или стабильный контекст проекта многократно отправляются как некэшированный ввод, затраты могут быть высокими.
Когда повторно используемые префиксы остаются стабильными, кэш может снизить эти затраты.
В то же время ненужная запись в кэш может увеличить расходы. Поэтому OpenAI рекомендует отслеживать использование как кэшированных токенов, так и токенов записи в кэш, а не предполагать, что кэш всегда дешевле.
Оркестровка инструментов может сократить количество круговых вызовов модели
Вторая основная область эффективности — фреймворк агента.
Традиционный цикл инструментов обычно выглядит так:
-
Модель решает вызвать
-
Приложение выполняет этот инструмент.
-
Полный результат инструмента возвращается модели.
-
Модель читает результат и решает, что делать дальше.
-
Вызывается другой инструмент.
-
Цикл повторяется.

Хотя этот метод гибок, он может стать дорогим.
Большие промежуточные результаты инструментов могут многократно попадать в контекст модели, даже если нужна лишь небольшая часть данных.
Программные вызовы инструментов GPT-5.6 предлагают альтернативу.
Документация OpenAI показывает, что GPT-5.6 может писать JavaScript в управляемой среде выполнения, чтобы:
- вызывать инструменты, соответствующие условиям
- передавать результаты между вызовами
- фильтровать промежуточные данные
- объединять записи
- сортировать результаты
- дедуплицировать данные
- проверять данные
- возвращать модели меньшие структурированные результаты
Для ограниченных рабочих процессов это может сократить:
- раунды модели
- рост подсказок
- промежуточные токены
- количество сетевых круговых вызовов
OpenAI отмечает, что эта модель особенно полезна, когда код может обрабатывать множество предсказуемых результатов инструментов без необходимости повторного семантического суждения после каждого вызова.
Она подходит не для всех задач агента.
Прямое взаимодействие модели с инструментом остается лучшим выбором в случаях, когда:
- достаточно одного вызова инструмента
- каждый результат может привести к существенному изменению в дальнейших рассуждениях
- требуется одобрение человека
- промежуточные результаты уже малы
- конечный ответ должен сохранять нативные ссылки или артефакты
Цель — не минимизировать количество вызовов любой ценой, а избегать передачи ненужной информации через модель.
История разговора и рассуждения могут управляться более тонко
В статье AIBase также отмечается, что более строгое управление историей разговора является способом повышения коэффициента повторного использования кэша.
Текущие руководства для разработчиков GPT-5.6 от OpenAI предоставляют соответствующий официальный механизм: персистентный вывод.
Разработчики могут настраивать, как сделать рассуждения предыдущих раундов доступными.
Это важно для долгоживущих рабочих процессов, поскольку не все предыдущие идеи одинаково полезны всегда.
Если задача остается стабильной, более ранние рассуждения могут улучшить непрерывность.
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Если цель меняется, сохранение всех предыдущих рассуждений увеличивает затраты и вносит устаревшие предположения.
Поэтому OpenAI позволяет приложениям управлять контекстом рассуждений и рекомендует правильно сохранять необходимые элементы ответа при ручном управлении историей.
Это дает разработчикам еще один рычаг для баланса между:
- непрерывностью
- эффективностью кэша
- размером контекста
- затратами
- качеством
Упрощение подсказок также может снизить затраты агента
Руководства для разработчиков GPT-5.6 от OpenAI особенно рекомендуют упрощение подсказок.
В образцах внутренних оценок кодирующего агента OpenAI сообщает, что упрощение подсказок и описаний инструментов:
- повысило оценочные баллы примерно на 10–15%
- уменьшило общее количество токенов на 41–66%
- снизило затраты на 33–67%
OpenAI прямо указывает, что эти цифры предназначены только для справки и результаты могут варьироваться в зависимости от рабочей нагрузки.
Рекомендация не заключается в удалении полезных ограничений.
Ее цель — устранить дублирование.
Практический процесс миграции выглядит следующим образом:
- Начните с рабочей подсказки и набора инструментов.
- Удалите одну группу дублирующихся инструкций за раз.
- Повторно запустите ту же оценочную задачу.
- Сохраните ограничения, которые повышают измеримое качество.
- Удалите инструкции, которые увеличивают количество токенов, но не улучшают результат.
Это особенно важно для продуктов-агентов, где одна и та же системная подсказка и описания инструментов могут отправляться тысячи раз в день.
Выбор модели должен соответствовать рабочей нагрузке
Серия GPT-5.6 предлагает разработчикам три основных варианта по соотношению стоимости и качества.
Используйте Sol, когда качество является первостепенным ограничением
Выбирайте Sol, когда задача может получить существенную выгоду от передовых возможностей.
Сценарии применения включают:
- сложную программную инженерию
- сложные исследования
- долгосрочное планирование
- работы по кибербезопасности
- высокоценный профессиональный анализ
- задачи, где небольшое повышение качества оправдывает большие затраты на модель
Используйте Terra для мощных общих производственных задач
Когда задача требует сильных рассуждений, но не уровня Sol, Terra является прагматичным выбором.
Она подходит для:
- повседневных корпоративных агентов
- помощи в кодировании
- рабочих процессов с документами
- исследовательских под-агентов
- использования инструментов средней сложности
- высокообъемных профессиональных задач
Используйте Luna, когда стоимость и объем преобладают
Luna — естественный выбор для следующих сценариев:
- Классификация
- Извлечение
- Маршрутизация
- Преобразование данных
- Легковесные инструментальные рабочие процессы
- Высоконагруженная фоновая автоматизация
Типичная архитектура направляет стандартные задачи на Luna или Terra, передавая на Sol только самые сложные.
Цена — лишь отправная точка
Для агентных систем простое сравнение по токенам может вводить в заблуждение.
Рассмотрим две модели.
Модель A дешевле за выходной токен, но требует:
- вдвое больше токенов для рассуждения
- больше вызовов инструментов
- больше повторных попыток
- больше контекста
- больше раундов
У модели B цена выше, но для выполнения задачи требуется вдвое меньше шагов.
Вторая модель всё равно может оказаться дешевле в пересчёте на выполненную задачу.
Поэтому командам, оценивающим GPT‑5.6, следует отслеживать:
- процент успешного выполнения задач
- общее количество входных токенов
- общее количество выходных токенов
- количество кэшированных токенов (чтение)
- количество записанных кэшированных токенов
- количество раундов модели
- количество вызовов инструментов
- задержку
- процент повторных попыток
- время ручного исправления
- полную стоимость за успешно выполненную задачу
Вот что на самом деле означает «интеллект на токен».
Практическое миграционное тестирование
Для команд, уже использующих GPT‑5.5 или более ранние модели, контролируемое сравнение полезнее немедленной полной миграции.
Шаг 1: Сформируйте репрезентативный оценочный набор
Включите:
- простые запросы
- сложные запросы
- задачи с длинным контекстом
- инструментально‑насыщенные рабочие процессы
- известные случаи отказов
- производственные примеры
Шаг 2: Примите текущее усилие рассуждения за базовое
OpenAI рекомендует начинать с того же усилия рассуждения, что и для предыдущей модели.
Затем протестируйте на один уровень ниже.
GPT‑5.6 может сохранять качество при меньшем числе токенов рассуждения, но это нужно подтвердить на вашей нагрузке.
Шаг 3: Сравните Sol, Terra и Luna
Не предполагайте, что флагманская модель автоматически является лучшим производственным выбором.
Оцените, могут ли Terra или Luna удовлетворить те же критерии приемки с меньшими затратами.
Шаг 4: Протестируйте кэширование подсказок
Отслеживайте чтение и запись кэша.
При высокой частоте повторного использования стабильный контекст может стать значительно дешевле, но часто меняющийся префикс подсказки может не дать большого выигрыша.
Шаг 5: Протестируйте программный вызов инструментов там, где это уместно
Применяйте его к чётко ограниченным этапам обработки, например:
- фильтрация
- агрегация
- сортировка
- объединение
- дедупликация
Сравните результаты с обычным прямым вызовом инструментов.
Шаг 6: Оцените экономику выполнения задачи
Более низкий счёт за токены имеет смысл только в том случае, если конечная задача по‑прежнему достигает стандартов качества.
Правильная цель оптимизации — не минимальное количество токенов.
А получение успешного результата с наименьшей надёжной стоимостью.
Почему GPT‑5.6 отражает более широкий сдвиг в сторону эффективности
В течение нескольких лет конкуренция на переднем крае моделей определялась одним вопросом: какая модель мощнее?
Этот вопрос всё ещё важен.
Но с выходом ИИ в крупномасштабное производство не менее важен другой вопрос:
Сколько полезной работы система выполняет на единицу вычислений и на каждый потраченный доллар?
Агентные системы усиливают это давление.
Один пользовательский запрос может запустить:
- несколько раундов рассуждения
- поиск
- выполнение кода
- внешние API
- под‑агентов
- большие контекстные окна
- многочисленные проверки
Без тщательной оркестрации общий счёт быстро растёт.
GPT‑5.6 отражает переход от простого наращивания интеллектуальных возможностей к более экономичному развёртыванию интеллекта.
Sol продвигает интеллектуальные способности на высший уровень.
Terra снижает стоимость мощных универсальных задач.
Luna выводит модельное семейство в область высокопроизводительных нагрузок.
Кэширование подсказок и программная оркестрация инструментов нацелены на системные накладные расходы вокруг самой модели.
В результате получается модельное семейство, разработанное не только вокруг бенчмарков, но и вокруг производственной экономики.
Часто задаваемые вопросы
Что такое GPT‑5.6?
GPT‑5.6 — это семейство моделей OpenAI для сложного рассуждения, программирования, профессиональной работы, агентных рабочих процессов и высокопроизводительных AI‑приложений. В серию входят Sol, Terra и Luna.
В чём разница между GPT‑5.6 Sol, Terra и Luna?
Sol — флагманский, самый мощный уровень. Terra обеспечивает баланс между интеллектом и стоимостью, а Luna оптимизирована для низкозатратных высокопроизводительных нагрузок.
Сколько стоит использование GPT‑5.6 через API?
OpenAI устанавливает цены: Sol — 5 долларов за миллион входных токенов и 30 долларов за выходные; Terra — 2,50 доллара / 15 долларов; Luna — 1 доллар / 6 долларов. Входной кэш дешевле; для очень длинных подсказок могут действовать особые правила.
Какой контекстный окно у GPT‑5.6?
Текущая страница моделей API OpenAI указывает контекстный окно в 1 050 000 токенов для Sol, Terra и Luna. Каждая модель поддерживает до 128 000 выходных токенов.
GPT‑5.6 Sol лучше в программировании, чем GPT‑5.5?
OpenAI сообщает, что Sol набирает более высокие баллы в нескольких оценках программирования с агентами, включая Artificial Analysis Programming Agent Index, SWE‑Bench Pro, DeepSWE и Terminal‑Bench 2.1. Реальная производственная производительность по‑прежнему зависит от репозитория, агентного фреймворка, подсказки и инструментов.
Что такое программный вызов инструментов?
Программный вызов инструментов позволяет GPT‑5.6 писать код для координации подходящих инструментов и обработки промежуточных результатов в управляемой среде выполнения. Он может сократить количество циклов модели и использование токенов в чётко определённых рабочих процессах.
Например, такие операции, как фильтрация, объединение, сортировка и агрегация.
GPT‑5.6 поддерживает кэширование подсказок?
Да. GPT‑5.6 поддерживает автоматическое кэширование и явные точки кэширования. OpenAI заявляет о 90% скидке на чтение из кэша, тогда как запись нового кэша стоит в 1,25 раза дороже цены некэшированных входных данных.
Следует ли использовать Sol для каждого запроса?
Обычно нет. Если Terra или Luna могут удовлетворить те же оценочные критерии с меньшими затратами, использование меньшего уровня модели улучшает экономику приложения. Сложные задачи следует направлять на Sol только тогда, когда более высокая способность приносит измеримую выгоду.
Связанные инструменты
- OpenAI API: Официальная платформа разработчика для доступа к моделям GPT‑5.6 и инструментам OpenAI.
- Руководство по моделям GPT‑5.6: Руководство OpenAI по миграции и оптимизации для модельного семейства GPT‑5.6.
- GPT‑5.6 Sol: Официальные характеристики модели, цены, контекстные ограничения и поддерживаемые функции Sol.
- GPT‑5.6 Terra: Официальная страница модели для сбалансированного уровня GPT‑5.6.
- GPT‑5.6 Luna: Официальная страница модели для самого дешёвого уровня GPT‑5.6.
- OpenAI Codex: Интеллектуальная среда программирования OpenAI для рабочих процессов разработки ПО.
Связанные ссылки
- Релиз OpenAI GPT‑5.6: Официальное объявление о запуске от OpenAI, включающее таблицы бенчмарков, детали безопасности, цены и доступность продуктов.
- Превью GPT‑5.6 Sol: Раннее анонсирование Sol, Terra и Luna от OpenAI.
- Модели OpenAI API: Текущая страница моделей OpenAI API.
Официальный каталог моделей и их основные характеристики.
- Руководство по модели GPT-5.6: официальные инструкции по объему потребления при логическом выводе, кэшированию подсказок, непрерывному логическому выводу и вызову инструментов программирования.
- Страница API GPT-5.6 Sol: текущие цены Sol, размер контекстного окна, дата прекращения обучения и поддерживаемые функции API.
- Страница API GPT-5.6 Terra: текущие цены и характеристики модели Terra.
- Страница API GPT-5.6 Luna: текущие цены и характеристики модели Luna.
Резюме
GPT-5.6 — это серия моделей, состоящая из трех уровней, а не единая универсальная модель. Sol ориентирован на максимальную производительность, Terra предлагает более экономичный баланс для обычных производственных задач, а Luna оптимизирована для сценариев с высокой пропускной способностью.
Главная тема — эффективность. OpenAI снижает вычислительную нагрузку при выполнении сложных задач за счет сочетания более эффективных по токенам моделей, явного кэширования подсказок, непрерывного логического вывода, настраиваемого объема потребления при логическом выводе и вызова инструментов программирования.
Источник сообщений AIBase также сообщает о дальнейших оптимизациях стека логического вывода, включая спекулятивное декодирование и работу с ядрами GPU, что увеличивает скорость генерации токенов более чем на 15%.
Эффективность. Эти низкоуровневые данные следует рассматривать как сообщения источников, если они не воспроизводятся в полностью задокументированных технических публикациях OpenAI.
Наилучшее понимание GPT-5.6 заключается не просто в выпуске более мощной модели, а в попытке улучшить экономику интеллекта во всем рабочем процессе агентов.



