Введение
Одним из августовских уикендов 2026 года появился один из самых ясных на сегодняшний день признаков того, что передовой ИИ выходит за пределы эталонной математики и переходит в сферу активных исследований.
1 августа OpenAI опубликовала «Десять достижений в математике и теоретической информатике». Эти результаты были получены внутренней версией Astra, которую OpenAI описывает как следующую основную модель.
Пакет результатов включает:
- Рукопись на 249 страниц.
- Десять результатов в области математики и теоретической информатики.
- 62-страничное подробное описание процесса открытия.
- Десять формальных доказательств в Lean 4.
- Открытый исходный код для реконструкции и независимой проверки сертификатов.
Менее чем через 24 часа исследователь Anthropic Левент Альпёге сообщил, что публично доступная модель Claude Fable 5 воспроизвела пять из десяти результатов.
Он подтвердил, что это проблемы с 4-й по 8-ю:
- Гипотеза жёсткости Конна.
- Сложность арифметических схем.
- Квантовое параллельное повторение.
- Задача о ближайшем векторе.
- Гипотеза объёма Эрхарта.
Альпёге заявил, что эти запуски были автономными, использовались универсальные подсказки, не было доступа к интернету, и были приняты меры для предотвращения утечки решений OpenAI в контекст.
Если эти пять доказательств выдержат всестороннюю публичную проверку, это событие будет означать, что результаты исследований, полученные одной передовой моделью, иногда могут быть практически немедленно независимо переоткрыты другой моделью.
Однако доказательства несимметричны. OpenAI опубликовала рукопись, подробное описание процесса и машинно-проверяемые сертификаты. Заявления же Fable в настоящее время подтверждаются в основном публичными высказываниями, а не полным пакетом доказательств.
Поэтому полезный вывод не просто в том, что какая-то модель победила.
ИИ теперь способен генерировать математику исследовательского уровня с достаточной скоростью, что проверка, интерпретация, атрибуция и рецензирование могут масштабироваться сложнее, чем само производство доказательств.

OpenAI публикует десять результатов исследовательского уровня
OpenAI описывает эти работы как десять достижений, которые решают или существенно продвигают давние открытые проблемы.
Темы охватывают геометрию высоких размерностей, теорию кодирования, теорию групп, теорию операторных алгебр, сложность арифметических схем, квантовую сложность, задачи о решётках, выпуклую геометрию, теорию Рамсея и экстремальную теорию графов.
OpenAI сообщает, что математические аргументы были сгенерированы внутренней моделью Astra. Затем люди с помощью той же модели помогли оформить эти аргументы в рукопись, после чего модель формализовала каждый результат в Lean.
Более точный рабочий процесс выглядит так:
Astra ищет математические аргументы
→ Выбор успешных аргументов
→ Человек и модель готовят читаемую рукопись
→ Модель проводит формализацию
Результат в Lean
→ Опубликованы формальные сертификаты и исходный код
→ Внешние математики проверяют корректность, новизну и значимость
Вклад модели является центральным, но конечный исследовательский результат по-прежнему включает человеческую подготовку, формальную инфраструктуру, программные библиотеки и экспертное рецензирование.
Десять достижений

| № | Область | Результат, опубликованный OpenAI |
|---|---|---|
| 1 | Упаковка шаров в высоких размерностях | Определена асимптотическая сила линейного программирования Кон–Элкиса и улучшена универсальная граница упаковки в высоких размерностях |
| 2 | Бинарные и сферические коды | Классические границы для кодов с фиксированным расстоянием улучшены с экспоненциальным множителем |
| 3 | Несофические группы | Построена явная несофическая группа, что решает вопрос о том, допускает ли каждая счётная группа приближение конечными подстановками |
| 4 | Гипотеза жёсткости Конна | Построены группы со свойством (T) с одинаковой групповой алгеброй фон Неймана, но не изоморфные, что опровергает гипотезу |
| 5 | Сложность арифметических схем | Установлены новые нижние границы для вычисления перманента, включая нижнюю границу порядка (n^4/\log n) для арифметических формул |
| 6 | Квантовое параллельное повторение | Доказано экспоненциальное параллельное повторение для общих конечных двухчастных запутанных игр |
| 7 | Задача о ближайшем векторе | Установлена полиномиальная факторная приближённая сложность евклидовой CVP и связанных задач о решётках |
| 8 | Гипотеза объёма Эрхарта | В каждой размерности доказана оптимальная максимальная граница объёма для указанного класса выпуклых тел |
| 9 | Многоцветные числа Рамсея | Доказана сверхэкспоненциальная нижняя граница для многоцветных чисел Рамсея для треугольников, что решает проблему Эрдёша № 183 |
| 10 | Экстремальная теория графов | Построены примеры, опровергающие гипотезы компактности и вырожденности, связанные с проблемами Эрдёша № 146 и № 180 |
Это не обычные олимпиадные задачи. Некоторые из них касаются проблем, остававшихся открытыми в течение многих лет и требующих глубоких специальных знаний для оценки.
Рукопись — лишь часть публикации
OpenAI также опубликовала 62-страничный документ под названием «Как формировались идеи: заметки о математических открытиях».
Доказательства отвечают на вопрос:
Почему эта теорема верна?
Записи об открытиях пытаются ответить на вопрос:
Как система нашла этот аргумент?
Это два разных вопроса.
Пошаговый разбор может помочь исследователям определить, перекомбинировала ли модель известные идеи, обнаружила ли некоторую аналогию, провела ли обширный поиск, нашла ли новую конструкцию или использовала известные теоремы неожиданным образом.
К этому содержанию всё ещё нужно относиться с осторожностью. Сгенерированные моделью повествования не обязательно являются идеальной каузальной записью каждого внутреннего вычисления.
OpenAI опубликовала десять сертификатов Lean
Официальный репозиторий openai/ten-proofs содержит по одному модулю Lean для каждого результата.
Проект использует:
Lean 4.32.0
mathlib
Lake
После установки elan официальный README предписывает пользователям собрать все десять формальных доказательств следующей командой:
lake exe cache get
lake build All
Также можно собрать отдельный модуль:
lake build SpherePacking
Репозиторий содержит:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
Код опубликован под лицензией Apache 2.0 и включает независимые верификационные ресурсы.
Что доказывают сертификаты Lean
Lean — это интерактивный доказатель теорем, основанный на зависимой типизированной теории.
Доказательства, проверенные ядром Lean, устанавливают, что формализованная теорема выводится из определений, предположений, импортированных аксиом и библиотек, а также формализованного доказательственного терма.
Это исключает многие ошибки, возможные в неформальных рассуждениях:
- Пропущенные логические шаги.
- Некорректные алгебраические преобразования.
- Скрытые противоречия.
- Необоснованные случаи.
- Несовпадение кванторов.
- Ошибочные промежуточные леммы.
Сертификаты могут быть проверены механически, а не приниматься на веру лишь потому, что автор звучит убедительно.
Что сертификаты Lean не доказывают
Формальная верификация не устраняет всех вопросов рецензирования.
Соответствует ли формальное утверждение неформальному заявлению?
Проверщик теорем проверяет закодированное утверждение. Человек всё ещё должен оценить, точно ли оно отражает математическую задачу.
Корректны ли определения и предположения?
Lean проверяет следствия формальных определений. Он не может решить, отражают ли эти определения общепринятые понятия или существуют ли скрытые предположения, подрывающие заявленный результат.
Является ли результат новым?
Формальная корректность не равна новизне. Обзор литературы и экспертные знания по-прежнему необходимы.
Является ли результат значимым?
Машина может проверить, что теорема верна. Но она не может судить, меняет ли результат область исследований или вносит ли ценные идеи.
Позволяет ли доказательство чему-то научиться?
Два формально корректных доказательства могут сильно различаться по объяснительной ценности. Одно может раскрыть переиспользуемые принципы; другое — быть трудно усваиваемым человеком.
Формальная проверка решает вопросы корректности. Математическое понимание остаётся отдельной задачей.
Claude Fable 5 утверждает, что воспроизвёл пять результатов за 24 часа
Менее чем через день после анонса OpenAI Alpöge написал, что «выполнил половину из них с помощью Fable».
Он описал настройку как:
- Полностью автономную.
- С использованием общих подсказок.
- Без доступа к сети.
- С дополнительными мерами предосторожности против утечки информации.

Позже Alpöge подтвердил, что эти пять пунктов — с 4-го по 8-й.

| Проект OpenAI | Тема | Публичный статус заявлений Fable |
|---|---|---|
| 4 | Гипотеза жёсткости Конна | Заявлено воспроизведение |
| 5 | Сложность арифметических схем | Заявлено воспроизведение |
| 6 | Квантовый параллельный повтор | Заявлено воспроизведение |
| 7 | Задача о ближайшем векторе | Заявлено воспроизведение |
| 8 | Гипотеза об объёме Эрхарта | Заявлено воспроизведение |
Alpöge отметил, что результат по Эрхарту — единственный, где Astra и Fable, по-видимому, использовали по сути одинаковое рассуждение.
Если это точно, остальные четыре могут быть альтернативными доказательствами, а не реконструкцией пути OpenAI.
Доказательства Fable пока не равнозначны публикации OpenAI
Для десяти результатов OpenAI публичный пакет включает формулировки теорем, полные рукописи, цепочки рассуждений, исходный код Lean, инструкции по сборке и независимые верификационные ресурсы.
Для пяти результатов Fable я могу проверить утверждения Alpöge, указанные им номера задач, описанные им экспериментальные условия и его наблюдение об аргументации Эрхарта.
Я не могу проверить публичный пакет, содержащий:
- Пять полных рукописей.
- Точные общие подсказки.
- Полные журналы выполнения.
- Объём использованных токенов.
- Настройки модели.
- Методы защиты от утечек.
- Сертификаты Lean.
- Внешнее рецензирование каждого аргумента.
Строгое описание таково:
Исследователь Anthropic публично сообщил, что Fable 5 в контролируемых условиях независимо выполнил пять из десяти задач, однако на момент проверки подробные доказательства, необходимые для всесторонней независимой оценки, ещё не были опубликованы.
Это не доказывает ложность утверждения. Это означает, что утверждение ещё не достигло той же стадии доказательности, что и опубликованный пакет OpenAI.
Почему 24 часа всё равно важны
Даже с учётом вышеуказанных оговорок временные рамки заслуживают внимания.
В традиционной математике значимый новый результат может потребовать месяцев или даже лет для независимой реконструкции.
Исследователям сначала нужно изучить контекст, прочитать рукопись, проверить технические детали, восстановить аргументацию, опробовать альтернативы, обсудить вопросы и опубликовать рецензию или последующую статью.
Способная модель может сжать отдельные части этого процесса.
Если результат одной модели может быть независимо достигнут другой моделью за один день, окно приоритета для ИИ-генерируемых открытий может значительно сократиться.
Первая команда всё равно заслуживает признания за выбор задач, первое публичное доказательство, подготовку рукописи, формализацию результата и создание записи, к которой могут обратиться другие.
Однако, когда другие исследователи могут немедленно поручить аналогичные задачи передовым системам, преимущество первопроходца может длиться лишь дни, а не годы.
Это ближе к воспроизведению, чем к соревнованию бенчмарков
Большинство бенчмарков моделей сравнивают системы на задачах с известными ответами.
Бенчмарк спрашивает:
При одинаковом тестовом наборе какая модель набирает больше баллов?
Данный набор ставит иной вопрос:
Могут ли две системы независимо прийти к одному и тому же новому передовому результату?
Это похоже на научное воспроизведение.
Независимое воспроизведение может выявить, зависит ли результат от ошибки одной модели, хрупкой подсказки, утечки информации или необычного пути доказательства.
Два независимых аргумента могут укрепить уверенность, особенно если они используют разные подходы.
Но они всё равно требуют рецензирования.
Две модели могут разделять схожие источники обучения, математические заблуждения, оптимизационные смещения или скрытые предположения.
Независимость моделей не автоматически означает когнитивную независимость.
Как оценивать заявление о воспроизведении с помощью ИИ
Кредибельный пакет воспроизведения должен раскрывать достаточно информации, чтобы другие могли повторить эксперимент.
Определение задачи
- Точная формулировка теоремы.
- Точные предположения.
- Версия исходной задачи.
- Ссылки, доказывающие, что задача ранее была открытой.
Конфигурация модели
- Название и версия модели.
- Настройки рассуждений или усилий.
- Длина контекста.
- Доступ к инструментам.
- Соответствующие параметры выборки.
Дизайн подсказок
- Начальная подсказка.
- Последующие подсказки.
- Ручные исправления.
- Любые подсказки по области знаний.
- Любые вспомогательные конструкции.
Контроль утечек
-
Доступ к сети и поиску.
-
Исходные документы, включённые в контекст.
-
Время создания снапшота модели.
-
Метод, используемый для обнаружения копирования языка или структуры.
Журнал выполнения
- Полная транскрипция.
- Вызовы инструментов.
- Неудачные попытки.
- Время выполнения.
- Использование токенов.
- Количество параллельных запусков.
Математические доказательства
- Полное доказательство.
- Проверяемые формальные сертификаты.
- Список зависимостей.
- Сравнение с первым доказательством.
Внешняя экспертиза
- Указанные рецензенты.
- Отзывы рецензентов.
- Исправления.
- Оставшиеся возражения.
- Статус публикации.
Без этой информации «независимое воспроизведение» по-прежнему трудно отличить от многообещающего предварительного отчёта.
Fable 5 — публично доступная передовая модель
Anthropic выпустила Claude Fable 5 в июне 2026 года.
Anthropic описывает её как модель уровня Mythos, предназначенную для широкого использования с обеспечением безопасности.
Компания заявляет, что модель особенно сильна в долгосрочной автономной работе, программной инженерии, интеллектуальном труде, визуальных задачах, научных исследованиях и задачах с длинным контекстом.
Официальный идентификатор модели в API:
claude-fable-5
Anthropic объявила следующие цены:
10 долларов за миллион входных токенов
50 долларов за миллион выходных токенов
Публичный выпуск Fable тесно связан с математической историей.
Astra по-прежнему является неопубликованной внутренней моделью OpenAI.
Fable доступна исследователям и разработчикам через поддерживаемые продукты Anthropic и API.
Это позволяет внешним командам легче пробовать собственные исследовательские вопросы, хотя доступ к модели не гарантирует наличия опыта, необходимого для выбора хороших задач или проверки выходных данных.
Цифра в 2000 долларов — это оценка предельных затрат на поиск
OpenAI утверждает, что общее количество токенов, необходимое для нахождения этих десяти решений по ценам Sol API, составляет около 2000 долларов.

Эта цифра впечатляет, но требует точной формулировки.
Её лучше всего понимать как оценку стоимости токенов для успешного поиска решения.
Это не общая экономическая стоимость исследовательского проекта.
Более крупный стек затрат может включать:
- Обучение Astra.
- Создание и эксплуатацию инфраструктуры для логического вывода.
- Отбор исследователями кандидатных задач.
- Пробные запуски на нерешённых задачах.
- Неудачные подходы к успешным задачам.
- Написание рукописи вручную.
- Формализацию.
- Программную инженерию.
- Внешнее математическое рецензирование.
- Публикацию и поддержку.
OpenAI сообщает, что оно пробовало другие крупные задачи без успеха и не решило ни одной задачи премии тысячелетия.
Таким образом, оценка в 2000 долларов отвечает на вопрос:
Какова стоимость токенов успешного поиска по публичным ценам API?
Она не отвечает на вопрос:
Какова стоимость создания модели и генерации, проверки и публикации исследовательских результатов?
Обе цифры полезны, но они измеряют разные вещи.
Почему предельные издержки всё равно изменят подход к исследованиям
Даже с учётом косвенных затрат низкие предельные издержки повторной серьёзной попытки могут изменить то, как проводятся исследования.
Человек-математик может потратить недели на решение, стоит ли исследовать тот или иной путь.
ИИ-систему можно попросить исследовать множество путей параллельно.
Исследователи могут использовать модель для:
- поиска контрпримеров;
- проверки вариантов гипотез;
- перевода между математическими языками;
- поиска связанных лемм;
- формализации кандидатных доказательств;
- генерации вычислительных экспериментов;
- сравнения стратегий доказательства;
- выявления пробелов;
- поиска более простых формулировок.
Этот эффект может быть аналогичен высокопроизводительным экспериментам в других науках.
Когда стоимость проверки очередной гипотезы снижается, количество проверяемых гипотез растёт.
Ограниченный ресурс смещается в сторону выбора перспективных задач и оценки потока кандидатов, который за этим следует.
Неудачные попытки также должны учитываться
Учёт только успешных затрат может создать искажённую картину.
Предположим, системе поручено 100 открытых задач, и она решает 10 из них.
Если цель — измерить экономику полного поискового проекта, то стоимость каждого успешного решения должна включать ресурсы, затраченные на 90 неудач.
Полный учёт должен сообщать:
Общая стоимость логического вывода
÷
Количество проверенных результатов
Он должен различать успешные финальные запуски, неудачные полные запуски, частичный прогресс, перезапуски с участием человека, параллельные кандидаты и затраты на проверку.
Без этого знаменателя низкая цифра может описывать лишь выбранные успешные случаи, а не экономику всего процесса открытия.
Fable также была использована для новой открытой задачи
Одна из критик в адрес воспроизведения звучит прямо:
Почему бы не поручить Fable повторить результат Astra, а не назначить новую открытую задачу?
Воспроизведение и открытие служат разным целям.
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Воспроизведение проверяет надёжность.
Решение новой задачи проверяет возможности на переднем крае.
Fable также
оказалась связана с новым математическим результатом.
В июле 2026 года Альпёге сообщил о контрпримере к гипотезе Якоби в трёхмерном случае и приписал Fable роль в процессе открытия.
Контрпример был формально проверен, обсуждался математиками, после чего последовала дальнейшая работа. Статья, опубликованная в конце июля на arXiv, содержит полное самодостаточное изложение и обобщает механизм на более высокие размерности.
Это событие выявляет повторяющуюся закономерность:
- ИИ порождает конкретный объект или аргумент.
- Инструменты формализации проверяют ключевое утверждение.
- Математики-люди ищут концептуальное объяснение.
- Последующая работа обобщает результат.
Финальный этап может быть именно тем местом, где заключена основная долговременная математическая ценность.
Контрпримеры и доказательства создают разные нагрузки на проверку
Явный контрпример иногда может быть проверен очень быстро.
Если гипотеза утверждает, что не существует объекта с определёнными свойствами, то одного действительного объекта достаточно для её опровержения.
Рецензент может проверить:
- что объект корректно определён;
- что он удовлетворяет предположениям;
- что он нарушает заключение.
Однако длинная общая теорема может потребовать сотен взаимосвязанных лемм и широкого понимания литературы.
Это различие частично объясняет, почему контрпримеры, порождённые ИИ, могут быстро распространяться.
Пример Якоби достаточно компактен, чтобы исследователи могли быстро проверить и формализовать его.
Некоторые из десяти результатов Astra включают более длинные цепочки теории, которые могут потребовать от сообщества больше времени для осмысления.
Новое узкое место — человеческое рецензирование
Ключевой вопрос:
Если ИИ может быстро создавать передовые доказательства, сможет ли математическое сообщество проверять их достаточно быстро?
Научный результат требует признания в нескольких формах.
Логическое признание
Действительно ли доказательство следует из предположений?
Здесь может помочь Lean.
Семантическое признание
Соответствует ли формальное утверждение тому смыслу, который автор вкладывает в свои слова?
Эксперт должен проверить этот перевод.
Историческое признание
Была ли задача действительно нерешённой и является ли результат новым?
Для этого требуется знание литературы.
Концептуальное признание
Раскрывает ли доказательство новые идеи или просто подтверждает факт?
Для этого требуется математическое суждение.
Признание сообществом
Была ли работа рецензирована, обсуждена, исправлена и помещена в должный контекст?
Для этого требуется время и институциональные процессы.
ИИ ускоряет генерацию доказательств гораздо быстрее, чем университеты и журналы успевают расширять штат экспертов, способных рецензировать узкоспециализированные работы.
Большинство людей не могут самостоятельно оценить эти результаты
Мощную модель программирования можно проверить, попросив её создать приложение.
Мощную модель генерации изображений можно оценить визуально.
Передовая математика — другое дело.
Большинство читателей не могут самостоятельно оценить существование несофических групп, контрпример к гипотезе жесткости Конна, параллельную теорему повторения для запутанных игр или сложность задач на решётках.
Они полагаются на цепочку доверия:
Выход модели
→ Формальный сертификат
→ Ассистент доказательств и его библиотеки
→ Эксперты в предметной области
→ Независимые рецензенты
→ Журналы и исследовательское сообщество
Это делает прозрачность ещё более важной, а не менее.
Когда публика не может напрямую проверить способность, уверенность
должна исходить из доказательств и институтов.

Формальные доказательства по-прежнему опираются на инфраструктуру, созданную человеком
Описывать это событие как ситуацию, в которой искусственный интеллект в изоляции заменяет математику, было бы неверно.
Эти модели зависят от:
- Многовековой математической литературы.
- Определений, созданных человеком.
- Опубликованных теорем.
- Ассистентов формальных доказательств.
- Mathlib.
- Доверенного ядра Lean.
- Исследователей, выбирающих задачи.
- Экспертов, интерпретирующих результаты.
- Инженеров, создающих системы обучения и логического вывода.
Сертификаты Lean от Astra стали возможны потому, что огромное сообщество потратило годы на формализацию математических основ и создание переиспользуемых библиотек.
Достижения моделей реальны.
Человеческая инфраструктура, которая их поддерживает, столь же реальна.
Более честное описание звучит так:
Передовые модели становятся мощными участниками системы математических знаний, созданной и поддерживаемой человеком.
Правильность не равна пониманию
Доказательство может быть корректным, но при этом не быть поучительным.
Математики часто ценят результат за то, что он вводит новые инварианты, конструкции, переиспользуемые методы, связи между областями, более ясные объяснения или лучшие вопросы.
Когда ИИ генерирует длинное доказательство, рецензент может спросить:
- На каком шаге содержится настоящая ключевая идея?
- Почему эта конструкция работает?
- Какие предположения являются существенными?
- Можно ли упростить это доказательство?
- Можно ли применить этот метод к смежным задачам?
- Какие новые гипотезы из этого следуют?
В этом и заключается разница между проверкой теоремы и её интеграцией в человеческую математику.
Количество корректных результатов имеет значение.
Способность превращать эти результаты в понимание может быть ещё важнее.
Математический вкус может стать ещё более ценным
Если поиск доказательств станет дешевле, выбор задач может стать гораздо более значимой частью исследовательского преимущества.
Самыми сложными решениями могут стать:
- Какую гипотезу стоит проверять?
- Какая версия может оказаться ошибочной?
- Какой частный случай может раскрыть общую проблему?
- Какой результат может связать несколько областей?
- Какая формализация является точной и надёжной?
- Какое сгенерированное доказательство содержит переиспользуемые идеи?
Это вопросы математического вкуса.
Модели могут помогать генерировать задачи, но текущая исследовательская экосистема по-прежнему сильно зависит от экспертов, которые оценивают, какие задачи имеют смысл.
Экспертная оценка может потребовать нового технологического стека
Традиционная экспертная оценка предполагает относительно небольшое количество рукописей.
ИИ может производить больше кандидатных результатов, чем способны обработать существующие журналы.
Процесс рецензирования может потребовать новых уровней.
Автоматизированная формальная проверка
Каждый результат, поддающийся формализации, должен сопровождаться машиночитаемым сертификатом.
Воспроизводимые записи генерации
Промпты, версии моделей, доступ к инструментам и условия запуска должны архивироваться.
Автоматизированный поиск по литературе
Системы должны сверять новые утверждения с базами данных статей и теорем.
Воспроизведение независимыми моделями
Различные модели или исследовательские группы могут пытаться решить одну и ту же задачу, не глядя на предложенное доказательство.
Экспертная сортировка
Эксперты определяют, какие результаты заслуживают углублённого рассмотрения.
Объясняющее переписывание
Корректные доказательства преобразуются в форму, доступную для изучения человеком.
Постпубликационное рецензирование
Открытые репозитории позволяют постоянно фиксировать ошибки, упрощения и альтернативные аргументы.
Это не заменяет журналы или экспертов, а предоставляет им более совершенные инструменты для работы с гораздо большими объёмами.
Лейденская декларация поднимает вопросы управления
Лейденская декларация об искусственном интеллекте и математике призывает к ответственному использованию ИИ в математических исследованиях.
Среди её проблем:
- Правдоподобные, но ненадёжные аргументы.
- Прозрачность участия ИИ.
- Указание авторства.
- Ответственность за корректность.
- Неравный доступ к дорогостоящим проприетарным системам.
- Чрезмерные ожидания.
- Контроль человека над исследовательской повесткой.
Публикация OpenAI ответила на некоторые из этих вопросов с необычной прямотой.
Она приписывает математические аргументы модели, объясняет роль человека в подготовке рукописи, публикует формальные сертификаты и приглашает сообщество к рецензированию.
Остаются открытые вопросы:
- Кто должен быть указан как автор?
- Кто несёт ответственность за ошибки?
- Как результаты, полученные моделями, должны ссылаться на источники обучения?
- Как должен распределяться доступ?
- Когда результаты готовы для публичного объявления?
- Какие доказательства должны сопровождать заявления об автономных открытиях?
Эти вопросы больше не являются гипотетическими политическими темами.
Теперь они применимы к реальным исследовательским результатам.
Практический контрольный список проверки
Шаг первый: подтвердите проблему
- Найдите авторитетную формулировку.
- Проверьте её точные предположения.
- Убедитесь, что заявленная версия доступна публично.
- Определите уже существующие частичные результаты.
Шаг второй: разграничьте вехи
Различайте:
- Модель предложила идею.
- Модель написала доказательство.
- Человек отредактировал доказательство.
- Доказательство было формализовано.
- Формальная проверка прошла компиляцию.
- Эксперты приняли результат.
- Результат прошёл публикационное рецензирование.
Шаг третий: прочитайте неформальное доказательство
Ищите скрытые предположения, циклические рассуждения, необъяснённые переходы, ошибочные ссылки, изменения области определения и неоднозначные обозначения.
Шаг четвёртый: проверьте формальное утверждение
Убедитесь, что теорема Lean точно выражает предполагаемое математическое содержание.
Шаг пятый: восстановите сертификат
Для репозитория OpenAI:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
Шаг шестой: проверьте зависимости
Проверьте импортированные модули, аксиомы, заглушки, небезопасные объявления, пользовательские определения и доверенный внешний код.
Шаг седьмой: сравните неформальное и формальное доказательства
Формальное доказательство может устанавливать теорему иным путём, чем рукопись.
Шаг восьмой: попробуйте независимое воспроизведение
Передайте формулировку теоремы — но не предложенное доказательство — другой модели или исследовательской группе.
Шаг девятый: проведите поиск по литературе
Подтвердите новизну и выявите пересекающиеся работы.
Шаг десятый: подумайте о том, что было изучено
После корректного результата должны следовать концептуальные вопросы:
- Почему эта конструкция работает?
- Можно ли её упростить?
- Что она обобщает?
- Какие прежние представления следует изменить?
Что может подтвердить легенду пять?
Если Alpöge или Anthropic опубликуют следующее, это утверждение значительно усилится:
- Точные формулировки использованных теорем.
- Промпты и конфигурацию моделей.
- Рукописи доказательств всех пяти результатов.
- Временные метки и полные журналы запусков.
- Подробности автономной среды.
- Методы предотвращения утечек.
- Сравнение с аргументацией Astra.
- Сертификаты Lean или другие машиночитаемые форматы.
- Независимая экспертная оценка.
Самый интересный результат — не обязательно пять идентичных доказательств.
Четыре по-настоящему различных аргумента могут быть более ценными, поскольку они могут выявить альтернативные структуры, стоящие за одними и теми же результатами.
Что уже установила публикация OpenAI
OpenAI предоставила публично:
- Десять подробных математических результатов.
- Полные рукописи.
- Пошаговый разбор процесса открытия.
- Десять формальных файлов.
- Инструкции по сборке.
- Кодовую базу под лицензией Apache.
- Чёткие заявления о вкладе ИИ и человека.
Это не заменяет экспертную оценку.
Но это создаёт серьёзный, проверяемый исследовательский пакет.
Ответственность сместилась с «покажите нам доказательства» на «оцените большой объём доказательств».
О чём говорит 24-часовой ответ
Ответ, о котором сообщает легенда, показывает, что передовые исследовательские возможности могут распространяться быстрее, чем публикации моделей.
Компания может держать модель в тайне.
Но она не может предполагать, что математические результаты, полученные этой моделью, останутся эксклюзивными надолго после публикации.
Как только формулировка теоремы становится публичной, другие способные системы могут немедленно атаковать её.
Поэтому организации могут выбирать быструю публикацию полных доказательств, формализацию до объявления, приглашение независимых воспроизведений и координацию с профильными экспертами до публикации.
Приоритет по-прежнему важен.
Пакет доказательств, сопровождающий заявление о приоритете, может быть не менее важен.
Часто задаваемые вопросы
Что доказала OpenAI Astra?
OpenAI опубликовал десять результатов в области математики и теоретической информатики, включая работы по упаковке шаров, теории кодирования, несофовским группам, гипотезе жёсткости Конна, арифметическим схемам, квантовому параллельному повторению, сложности решёток, гипотезе об объёме Эрхарта, числам Рамсея и экстремальной теории графов. OpenAI описывает их как результаты, которые решают или существенно продвигают давние открытые проблемы.
Доступен ли OpenAI Astra публично?
Нет. OpenAI описывает Astra как внутреннюю версию своей следующей основной модели. Статья, пошаговые разборы рассуждений и сертификаты Lean являются общедоступными, но сама модель Astra, использованная для генерации доказательств, не была выпущена.
Действительно ли Claude Fable 5 воспроизвёл пять доказательств Astra?
Исследователь Anthropic Левент Алпёге публично заявил, что Fable завершил задачи 4–8 за 24 часа в автономных условиях. При проверке полные рукописи, журналы, промпты и сертификаты Lean для этих пяти запусков не были найдены в открытом доступе, поэтому до публикации более полных доказательств это утверждение следует рассматривать как предварительное.
Какие пять задач, по сообщениям, решил Fable?
Алпёге подтвердил гипотезу жёсткости Конна, сложность арифметических схем, квантовое параллельное повторение, задачу о ближайшем векторе и гипотезу об объёме Эрхарта. Он отметил, что результат Эрхарта, по-видимому, по существу использует те же аргументы, что и Astra, тогда как остальные четыре результата могут отличаться.
Были ли доказательства OpenAI формально проверены?
OpenAI опубликовал формальные доказательства в Lean 4 для всех десяти результатов, а также инструкции по сборке и ресурсы для независимой проверки. Компилируемые сертификаты Lean позволяют проверить формальные теоремы, но экспертам всё ещё необходимо подтвердить, что закодированные утверждения точно соответствуют предполагаемым математическим утверждениям.
Действительно ли эти десять результатов обошлись в 2000 долларов?
OpenAI сообщает, что по тарифам Sol API токены, необходимые для нахождения успешных решений, стоили примерно 2000 долларов. Эта оценка не включает обучение модели, неудачные исследовательские попытки, ручную работу над рукописью, инфраструктуру, формальную верификацию или внешнее математическое рецензирование.
Почему сертификаты Lean важны?
Сертификаты Lean позволяют небольшому доверенному ядру механически проверить, что формальная теорема выводится из её предположений и зависимостей. Они снижают риск скрытых логических пробелов, но не подтверждают новизну, значимость или точность неформального математического перевода.
Заменит ли ИИ математиков?
Текущие данные свидетельствуют скорее об изменении способов математической работы, чем о простой замене. Модели могут ускорять поиск, генерацию доказательств, поиск контрпримеров и формализацию, тогда как люди остаются незаменимыми в выборе задач, интерпретации, литературном контексте, рецензировании и превращении доказательств в понимание.
Связанные инструменты
- Lean: интерактивный доказатель теорем и язык программирования для формальной математики и верификации программного обеспечения.
- Mathlib: поддерживаемая сообществом математическая библиотека, используемая многими проектами формализации на Lean.
- OpenAI Ten Proofs: официальный репозиторий с сертификатами Lean 4 для десяти опубликованных результатов Astra.
- Elan: менеджер цепочек инструментов для установки и управления версиями Lean.
- Lake: система сборки и менеджер пакетов Lean для компиляции формальных доказательств OpenAI.
- Claude Fable 5: публичная модель Anthropic для длительных задач в области знаний, программирования, зрения и науки.
- Formal Conjectures: репозиторий с формулировками формальных математических гипотез, поддерживающий проверяемые машиной исследовательские рабочие процессы.
Связанные ссылки
- OpenAI: десять достижений в математике: официальное объявление OpenAI, сводка теорем, заявления об авторстве и ссылки на вспомогательные материалы.
- Полная рукопись на 249 страниц: полный сборник результатов по математике и теоретической информатике.
- Пошаговый разбор математических открытий: 62-страничное объяснение OpenAI того, как возникли идеи модели.
- Сертификаты OpenAI Lean: исходный код, команды сборки, отдельные модули теорем и инструкции по независимой проверке.
- Anthropic: Claude Fable 5 и Claude Mythos 5: официальные возможности, доступность, меры безопасности, идентификаторы API и цены Fable 5.
- Лейденская декларация по ИИ и математике: математическая инициатива, охватывающая надёжность, авторство, прозрачность, доступность и ответственность человека.
- Контрпримеры к гипотезе Якобиана в размерности выше двух: последующая статья, описывающая и обобщающая механизм недавних контрпримеров.
Резюме
OpenAI опубликовал необычайно полный исследовательский пакет, охватывающий десять достижений, полученных Astra: рукопись на 249 страниц, подробные описания процесса открытия и десять формальных доказательств в Lean, которые могут быть воспроизведены внешними исследователями.
По сообщениям, Claude Fable 5 завершил пять из этих задач за 24 часа, что может представлять собой новый тип воспроизведения с помощью моделей. Это утверждение значимо, но его публичные доказательства в настоящее время менее полны, чем рукопись и формальные сертификаты, предоставленные OpenAI, поэтому его следует чётко маркировать как вывод, ожидающий проверки.
Оценку в 2000 долларов правильнее всего понимать как стоимость токенов для успешного поиска решений по тарифам Sol API, а не общую стоимость всего исследовательского проекта. Обучение, неудачные попытки, подготовка материалов человеком, формализация, инфраструктура и рецензирование остаются частью реальных экономических затрат.
Более масштабный сдвиг происходит от «дефицита доказательств» к «дефициту рецензирования». Модели скоро смогут генерировать математические утверждения быстрее, чем эксперты смогут их проверять, интерпретировать и помещать в контекст.
Когда доказательства становятся дешёвыми и доступными, самая ценная работа, возможно, заключается в определении того, какие из них верны, значимы, новы и достойны понимания.



