Gemini 4 Pro мог появиться в Arena — но более важная история связана с рекурсивным самоулучшением

Google необычно мало сообщает о Pro-линейке Gemini, тогда как модели Flash продолжают быстро развиваться.
Gemini 3.6 Flash, 3.7 Flash и 3.8 Flash вышли почти один за другим. Google официально выпустила Gemini 3.8 Flash 2 сентября 2026 года, назвав её своей самой производительной моделью Flash для длительной разработки программного обеспечения, автономных агентов и сложных многоэтапных задач.
Затем произошло нечто странное.
Модель с тем же обозначением gemini-3.8-flash начала появляться в Arena, однако разработчики, тестировавшие её, заявили, что её поведение заметно превосходит возможности уже знакомой им публичной версии Gemini 3.8 Flash.
Модель создавала более проработанные SVG-изображения, более полноценные веб-интерфейсы, более детализированные 3D-сцены и более сильные результаты в задачах агентного типа, чем тестировщики ожидали от публичного релиза 3.8 Flash.
Это быстро породило теорию:
Модель из Arena может быть скрытой тестовой контрольной точкой Gemini 4 Pro.
Доказательства вызывают интерес, но пока остаются косвенными. Google не анонсировала Gemini 4 Pro, а по состоянию на 20 сентября в публичной документации Google по моделям Gemini не указана ни одна модель Gemini 4.
Поэтому наиболее важная часть этой истории может находиться в другом месте: в ускоряющемся использовании ИИ-систем для оценки, оптимизации и создания следующего поколения ИИ-систем.
Именно здесь появляется тема рекурсивного самоулучшения, или RSI.
Подтверждённая история релизов Google помогает понять контекст.
Gemini 3.8 Flash вышла 2 сентября, всего через три недели после Gemini 3.7 Flash. Google назвала её третьим релизом Flash за шесть недель и заявила, что модель улучшила результаты в разработке программного обеспечения, агентных задачах и сложных многоэтапных рассуждениях, сохранив скорость и стоимость уровня Flash.
Поскольку настоящая 3.8 Flash уже доступна публично, у разработчиков есть прямая точка сравнения.
Поэтому, когда в Arena появилась вторая модель с тем же названием, которая выглядела существенно сильнее, это быстро заметили.
В одном из широко распространённых сравнений моделям предложили нарисовать домашнюю кошку в профиль с помощью SVG.
Три результата, показанные в исходном материале, были подписаны слева направо как предполагаемая «Gemini 4 Pro», GPT-6 Astra и выпущенная Gemini 3.8 Flash.
Анонимный результат из Arena выглядел более полным и пропорционально проработанным, чем результат рабочей версии Flash.
Само по себе это не позволяет определить скрытую модель. Arena основана на слепой или частично слепой оценке, а более сильная анонимная модель может быть новой контрольной точкой, системой с другой конфигурацией или другим невыпущенным вариантом Gemini.
Однако разрыв оказался достаточно большим, чтобы слух продолжил распространяться.
Другие тестировщики направили модель на более сложные задачи генерации.
Один пользователь сообщил, что предполагаемой модели потребовалось около восьми минут для создания интерактивной сцены с пагодой в стиле воксельной графики.
Тот же тестировщик также описал подробную страницу с вертолётом Airbus H145, созданную примерно за десять минут, и монохромный сайт, завершённый приблизительно за четырнадцать минут.
Другой участник сообщества использовал предполагаемую модель для создания игры и сообщил о высоком визуальном качестве и полноте генерации игрового мира.
Общей особенностью была не максимальная скорость. Казалось, что модель часто тратит больше времени на рассуждения или генерацию, чем обычная модель Flash.
Именно это поведение также подогрело теорию о том, что за обозначением Arena может скрываться контрольная точка уровня Pro.
Более сенсационное заявление сделал разработчик Qwinah, который сообщил, что ему удалось «перенаправиться через обходной маршрут» к бэкенду Gemini 4 Pro.
Он опубликовал скриншот, на котором, судя по всему, отображались внутренние метаданные модели со строками вроде G4P-ARGON и VIA_3.8_FLASH.
На скриншоте также заявлялись следующие возможности:
Эти заявления не подтверждены Google, Google DeepMind, Arena или официальной документацией Gemini.
Поэтому скриншот следует рассматривать как неподтверждённый материал сообщества, а не как спецификацию.
По состоянию на 20 сентября опубликованная документация Google по Gemini API указывает для Gemini 3.8 Flash лимит входного контекста в 1 048 576 токенов и лимит выходных данных в 65 536 токенов. Официальной страницы модели Gemini 4 Pro или идентификатора API не существует.
Отдельная таблица бенчмарков также широко распространялась.
В таблице утверждалось, что предполагаемая Gemini 4 Pro достигла примерно следующих результатов:
| Бенчмарк | Вирусное заявление |
|---|---|
| DeepSWE v1.1 | 88,7% |
| Terminal-Bench 2.1 | 95,3% |
| HLE-Verified | 72,1% |
| OSWorld 2.0 | 86,8% |
| GDPval-AA v2 | 2064 Elo |
Если бы эти показатели были реальными, они вывели бы модель выше нескольких ведущих передовых систем в задачах программирования, работы агентов, рассуждений и управления компьютером.
Но у таблицы есть серьёзные проблемы.
У неё нет официального источника Google, подтверждения со стороны Arena, опубликованной конфигурации оценки или воспроизводимого запуска бенчмарков. Некоторые сравнительные значения для других моделей также не совпадают с их официально опубликованными результатами.
Например, в официальных материалах OpenAI о запуске GPT-6 Astra для Astra указан результат 74,1% в DeepSWE v1.1, а для нескольких других категорий используются иные версии бенчмарков.
Поэтому таблицу с результатами не следует представлять как подтверждённый результат Gemini 4.
Правильный статус выглядит просто:
загадочная более сильная модель в Arena: наблюдалась
идентичность Gemini 4 Pro: не подтверждена
вирусная таблица бенчмарков: не подтверждена
заявления о контексте 10 млн / выводе 256 тыс.: не подтверждены
Публичная документация Google показывает гораздо более сдержанную картину.
По состоянию на 20 сентября 2026 года:
gemini-3.8-flash доступна в общем режиме.Это не доказывает, что Gemini 4 не тестируется внутри компании.
Передовые лаборатории регулярно оценивают невыпущенные контрольные точки до официального запуска.
Это лишь означает, что имеющиеся публичные доказательства пока не позволяют считать «Gemini 4 Pro» анонсированным продуктом.
Вторая часть исходной статьи отходит от самой утечки и обращается к более широкой идее: рекурсивному самоулучшению.
RSI описывает процесс, в котором ИИ-системы всё активнее участвуют в создании, оценке или улучшении будущих ИИ-систем, формируя цикл обратной связи: более совершенные модели помогают ускорить создание ещё более совершенных моделей.
Упрощённо это выглядит так:
ИИ помогает улучшать разработку ИИ
↓
ИИ следующего поколения становится сильнее
↓
более сильный ИИ активнее участвует в исследованиях и разработке
↓
цикл разработки ускоряется
Важно отличать это от утверждения, что современные передовые лаборатории уже достигли полностью автономного взрыва интеллекта.
Люди по-прежнему определяют исследовательские цели, проектируют системы обучения, распределяют вычислительные ресурсы, одобряют рискованные изменения и решают, когда модели можно выпускать.
Меняется доля цикла разработки, которую ИИ уже способен выполнять.
Официальный анонс Gemini 3.8 от Google — одно из наиболее сильных подтверждений того, что эта тенденция реальна.
Компания заявляет, что Gemini 3.8 Flash и 3.8 Flash Cyber ускоряются за счёт длительных агентных циклов, предназначенных для рекурсивной оценки и доработки базовых моделей.
Эта формулировка важна, поскольку исходит непосредственно от Google, а не из предположений сообщества.
Она не означает, что Google добилась полностью автономного RSI.
Но она означает, что циклы оценки с использованием ИИ уже являются частью процесса разработки производственных моделей Gemini.
Исследователь Google DeepMind Shunyu Yao коротко описал значение этого события в публичной публикации после релиза 3.8:
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Сообщение перефразировало фразу Apollo 11: небольшой шаг для модели, но гораздо больший шаг для RSI.
14 сентября исследователи из Google, Google DeepMind, Университета Мэриленда и Университета Вирджинии опубликовали работу Dream-RSI: Recursive Self-Improvement through Evolving Worlds.
Статья посвящена конкретному узкому месту: тому, как агент может улучшать способы исследования сложных пространств поиска, не оплачивая снова и снова дорогостоящие эксперименты в реальной среде.
Dream-RSI использует цикл, построенный на истории предыдущих исследований:
Исследователи сообщают об улучшениях в таких областях, как:
Эта работа гораздо уже популярной идеи о том, что ИИ автономно перепроектирует все части самого себя.
Тем не менее она демонстрирует реальный рекурсивный механизм: предыдущая работа системы становится учебным материалом для улучшения способов поиска будущих улучшений.
В ту же неделю Anthropic опубликовала необычно подробные внутренние показатели, показывающие, насколько ИИ уже интегрирован в её собственный исследовательский процесс.
По состоянию на август 2026 года Anthropic сообщает:
Anthropic определяет «ведущую роль ИИ» как выполнение моделью большей части задачи от начала до конца по высокоуровневому запросу при надзоре человека.
Показатель в 26% особенно примечателен, поскольку, по словам Anthropic, в начале года эта доля была ниже 1%.
Anthropic опубликовала эту метрику отчасти потому, что считает: внешним наблюдателям необходима большая прозрачность в отношении того, насколько быстро передовые лаборатории автоматизируют собственные процессы разработки моделей.
Z.ai опубликовала ещё один полезный пример.
Компания заявляет, что Infra Agent на базе GLM-5.3 помог создать и оптимизировать инфраструктуру вывода, обслуживающую GLM-5.3-Flash.
Согласно сентябрьскому раскрытию информации Z.ai:
Z.ai прямо заявляет, что это не полное рекурсивное самоулучшение.
Компания описывает результат скромнее: появился цикл минимального масштаба, в котором модель помогает оптимизировать систему, обслуживающую другую модель.
Это различие важно.
Современным системам по-прежнему необходимы цели, заданные людьми, проектирование обратной связи, инфраструктурные ограничения и проверка высокорисковых изменений.
Но такой цикл больше не является чисто теоретическим.
Заключительная часть исходной статьи связывает RSI с новой дискуссией среди лидеров передовых ИИ-компаний.
12 сентября генеральный директор Anthropic Dario Amodei публично призвал индустрию снизить темп развития передовых моделей, чтобы работа над безопасностью успевала за ростом возможностей моделей.
Его предложение включало постоянный доступ независимых сторонних оценщиков на уровне сотрудников, а в дальнейшем — более широкую координацию вокруг порогов возможностей и мер безопасности.
Sam Altman, Elon Musk и Demis Hassabis выразили разную степень поддержки общей идее о том, что разработка передовых моделей при определённых условиях может потребовать более строгих ограничений или замедления.
Но согласиться с необходимостью осторожности проще, чем договориться о том, кто замедлится первым.
Перед каждой передовой лабораторией стоит одна и та же стратегическая проблема.
Если одна компания замедлит развитие возможностей, пока конкуренты продолжат двигаться вперёд, она рискует уступить техническое лидерство, специалистов, клиентов и долю рынка.
Та же логика действует на уровне государств.
Страна, рассматривающая строгие ограничения на развитие передовых моделей, может опасаться, что конкуренты продолжат ускоряться.
Поэтому предложения о согласованном замедлении структурно сложно реализовать, даже когда крупнейшие лаборатории согласны с серьёзностью рисков.
Это противоречие заметно в текущем цикле моделей.
Google быстро выпускает модели Flash и, возможно, тестирует более сильные скрытые контрольные точки. Anthropic публично измеряет, какую долю собственных исследований и разработок уже выполняет Claude, одновременно рассматривая будущие релизы моделей. OpenAI продолжает выпускать передовые системы и расширяет стороннюю оценку и требования безопасности.
Результат не сводится к простому противоречию.
Это проблема координации: одни и те же организации могут искренне беспокоиться о рисках передовых моделей и одновременно сталкиваться с мощными стимулами оставаться на переднем крае.
В исходной статье также упоминаются сообщения сообщества о том, что другие лаборатории могут тестировать модели следующего поколения за существующими интерфейсами продуктов.
В одной широко распространённой публикации утверждалось, что некоторые запросы Claude Code отображали идентификатор claude-opus-5-2.
Это не официальный анонс продукта Anthropic.
Аналогичным образом публикации сообщества сообщали о возможных обнаружениях дополнительных идентификаторов моделей OpenAI, помимо текущей официально объявленной линейки.
К таким сообщениям следует относиться так же, как к теории о Gemini 4 Pro: они могут указывать на тестирование чего-либо, но не являются официальным релизом, спецификацией или датой запуска.
| Утверждение | Статус по состоянию на 20 сентября 2026 года |
|---|---|
| Google выпустила Gemini 3.8 Flash 2 сентября | Подтверждено |
| Gemini 3.8 использует длительные агентные циклы для рекурсивной оценки и доработки базовых моделей | Подтверждено Google |
Более сильная модель с обозначением gemini-3.8-flash появилась в Arena | Сообщалось и широко наблюдалось |
| Модель из Arena — это Gemini 4 Pro | Не подтверждено |
| Google официально анонсировала Gemini 4 Pro | Нет |
| В публичной документации моделей Google сейчас указана Gemini 4 | Нет |
G4P-ARGON — настоящий внутренний идентификатор модели Google | Не подтверждено |
| Gemini 4 Pro имеет контекст более 10 млн токенов и вывод 256 тыс. токенов | Не подтверждено |
| Вирусные результаты Gemini 4 в бенчмарках официальны | Нет |
| Dream-RSI — настоящая исследовательская работа, опубликованная в сентябре 2026 года | Подтверждено |
| Anthropic заявляет, что Claude ведёт 26% измеряемой работы в области исследований и разработок ИИ | Подтверждено |
| Anthropic заявляет, что более 90% измеряемой работы в области исследований и разработок ИИ выполняется как минимум в сотрудничестве с ИИ | Подтверждено |
| Z.ai заявляет, что Infra Agent GLM-5.3 помог увеличить пропускную способность GLM-5.3-Flash в 3,2 раза | Подтверждено как результат, сообщённый поставщиком |
| Сообщения сообщества о Claude Opus 5.2 означают официальный запуск | Нет |
Нет. Google официально не анонсировала Gemini 4 Pro, а текущая публичная документация Google по Gemini API не содержит модели Gemini 4. История основана на необычно производительной модели из Arena и предположениях сообщества о её идентичности.
Скрытая модель использовала обозначение gemini-3.8-flash, но в тестах SVG, веб-интерфейсов, 3D и агентных задач выглядела сильнее публичной рабочей модели. Более медленное и обдуманное поведение также заставило некоторых тестировщиков предположить, что перед ними контрольная точка класса Pro, а не модель Flash.
Они не подтверждены. Вирусная таблица не имеет официальной поддержки со стороны Google или Arena, не содержит воспроизводимой конфигурации оценки, а некоторые сравнительные значения не полностью совпадают с официальными публикациями других поставщиков.
Рекурсивное самоулучшение означает, что ИИ-системы помогают улучшать процесс создания более сильных ИИ-систем, формируя цикл обратной связи. Современные передовые лаборатории не заявляют о полностью автономном RSI, однако ИИ уже участвует в оценке, программировании, оптимизации инфраструктуры и исследованиях и разработке моделей.
Google заявляет, что Gemini 3.8 ускоряется за счёт длительных агентных циклов, которые рекурсивно оценивают и дорабатывают базовые модели. Это реальный механизм самоулучшения, хотя он гораздо уже полностью автономной системы, самостоятельно проектирующей своего преемника без контроля человека.
Dream-RSI — это исследовательская платформа, опубликованная в сентябре 2026 года Google, Google DeepMind и академическими партнёрами. Она использует историю предыдущих исследований как симулятор воспроизведения, чтобы агент мог недорого улучшать стратегию исследования, а затем применять улучшенную стратегию в реальной среде.
Anthropic сообщает, что Claude ведёт 26% измеряемой работы в области исследований и разработок ИИ, а более 90% этой работы выполняется как минимум в сотрудничестве с ИИ. Anthropic также заявляет, что Claude не является полностью автономным ни в одной измеряемой части этой работы.
Компания, которая замедлится в одиночку, рискует уступить конкурентам, продолжающим развитие. Та же проблема существует между государствами, поэтому общие правила оценки и пороги возможностей проще предложить, чем реализовать.
Модель с обозначением gemini-3.8-flash, которая оказалась сильнее ожидаемого, появилась в Arena, а тестировщики из сообщества получили достаточно необычные результаты, чтобы теория о Gemini 4 Pro выглядела правдоподобной. Но правдоподобие не равно подтверждению: Google не анонсировала Gemini 4 Pro, вирусный скриншот бэкенда не подтверждён, а распространяемая в интернете таблица бенчмарков не имеет официальной поддержки.
Более устойчивая часть истории — ускорение разработки ИИ с помощью ИИ. Google открыто заявляет, что Gemini 3.8 использует длительные циклы для рекурсивной оценки и доработки базовых моделей. Dream-RSI формализует самоулучшающийся цикл исследования. Anthropic сообщает, что Claude уже ведёт 26% измеряемой работы в области исследований и разработок ИИ, а Z.ai утверждает, что инфраструктурный агент на базе GLM помог утроить пропускную способность обслуживания GLM-5.3-Flash.
Это делает дискуссию о замедлении развития индустрии не проще, а сложнее. Передовые лаборатории могут соглашаться с необходимостью независимой оценки и более строгих мер безопасности и одновременно сталкиваться с мощными стимулами продолжать развитие.
Gemini 4 Pro остаётся слухом; переход к ИИ-системам, помогающим создавать следующее поколение ИИ, уже реален.
Начните с одной фразы и получите полноценный сайт за считанные минуты.