OpenAI 发布了由 Astra 生成的十项数学与理论计算机科学进展,并公开手稿、发现过程和 Lean 证书;Claude Fable 5 随后声称在 24 小时内独立复现了其中五项。

2026年8月的一个周末,产生了迄今为止最清晰的迹象之一,表明前沿AI正在超越基准数学,进入主动研究领域。
8月1日,OpenAI发表了《数学与理论计算机科学十项进展》。这些成果由Astra的内部版本生成,OpenAI将其描述为下一代主要模型。
该成果包包括:
不到24小时后,Anthropic研究员Levent Alpöge表示,公开可用的模型Claude Fable 5已复现了十项成果中的五项。
他确认这五项分别是第4至第8个问题:
Alpöge表示,这些运行是自主的,使用了通用提示词,没有互联网访问权限,并采取了旨在防止OpenAI的解决方案泄漏到上下文中的预防措施。
如果这五个证明经受住了全面的公开审查,这一事件将表明,由一个前沿模型产生的研究成果有时几乎可以立即被另一个模型独立重新发现。
然而,证据并不对称。OpenAI已发布手稿、过程详解和机器可验证的证书。而Fable的声明目前主要由公开陈述支持,而非完整的证明包。
因此,有用的结论并不仅仅是某个模型胜出。
AI现在能够以足够快的速度生成研究级数学,以至于验证、解释、归因和审查可能比证明生产本身更难规模化。

OpenAI将这些工作描述为十项成果,它们解决或在长期悬而未决的开放问题上取得了重大进展。
这些课题涵盖高维几何、编码理论、群论、算子代数、算术电路复杂度、量子复杂性、格问题、凸几何、Ramsey理论和极值图论。
OpenAI表示,这些数学论证由内部Astra模型生成。随后,人类利用同一模型协助将这些论证整理成手稿,之后该模型在Lean中将每项成果形式化。
更准确的工作流程是:
Astra搜索数学论证
→ 选择成功的论证
→ 人类和模型准备可读的手稿
→ 模型进行形式化
在 Lean 中的结果
→ 正式证书和源代码已发布
→ 外部数学家检查正确性、新颖性和重要性
模型的贡献是核心,但最终的研究成果仍然包括人工准备、正式基础设施、软件库和专家评审。

| 序号 | 领域 | OpenAI 发布的结果 |
|---|---|---|
| 1 | 高维球堆积 | 确定了 Cohn–Elkies 线性规划的渐近强度,并改进了通用高维堆积界 |
| 2 | 二元码和球形码 | 以指数因子改进了经典固定距离码界 |
| 3 | 非 sofic 群 | 构造了一个显式非 sofic 群,解决了是否每个可数群都允许有限置换逼近的问题 |
| 4 | Connes 刚性猜想 | 构造了具有相同群 von Neumann 代数但不同构的性质 (T) 群,从而否证了该猜想 |
| 5 | 算术电路复杂性 | 建立了计算永续式的新下界,包括阶为 (n^4/\log n) 的算术公式下界 |
| 6 | 量子平行重复 | 证明了一般有限双人纠缠博弈的指数级平行重复性质 |
| 7 | 最近向量问题 | 给出了欧几里得 CVP 及相关格问题的多项式因子近似硬度 |
| 8 | Ehrhart 体积猜想 | 在每一维中证明了指定凸体类的最优最大体积界 |
| 9 | 多色拉姆齐数 | 证明了多色三角形拉姆齐数的超指数下界,解决了 Erdős 问题 183 |
| 10 | 极值图论 | 构造了否证与 Erdős 问题 146 和 180 相关的紧性和退化性猜想的例子 |
这些不是常规的奥林匹克竞赛题。其中几个涉及多年悬而未决的问题,需要深厚的专业知识才能评估。
OpenAI 还发布了一份 62 页的文档,题为《思路是如何形成的:数学发现笔记》。
证明回答的是:
为什么这个定理成立?
发现记录试图回答:
系统是如何找到这个论证的?
这是两个不同的问题。
逐步解析可以帮助研究人员判断模型是重新组合了已知思想、识别出某种类比、进行了广泛的搜索、找到了新的构造,还是以出人意料的方式使用了已知定理。
这些内容仍然需要谨慎对待。模型生成的叙述并不一定是每次内部计算的完美因果记录。
官方的 openai/ten-proofs 仓库包含每个结果对应的一个 Lean 模块。
该项目使用:
Lean 4.32.0
mathlib
Lake
安装了 elan 后,官方 README 指示用户通过以下命令构建全部十个形式化证明:
lake exe cache get
lake build All
也可以单独构建某个模块:
lake build SpherePacking
该仓库包含:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
代码以 Apache 2.0 许可证发布,并包含独立验证资源。
Lean 是一个基于依赖类型理论的交互式定理证明器。
通过 Lean 内核验证的证明,确立了形式化定理是从定义、假设、导入的公理和库以及形式化证明项中推导出来的。
这排除了非正式论证中可能出现的许多错误:
证书可以被机械地检查,而不是因为作者听起来有说服力就被接受。
形式化验证并不能消除所有审阅问题。
定理证明器检查的是编码后的陈述。人类仍然需要判断它是否准确地捕捉到了数学问题。
Lean 验证的是形式化定义的推论。它不能决定这些定义是否反映了公认的概念,或者是否存在隐藏的假设削弱了标题结果。
形式正确性并不等于新颖性。文献综述和专家知识仍然是必要的。
机器可以验证定理是成立的。但它无法判断结果是否改变了该领域,或是否引入了有价值的思想。
两个形式正确的证明在解释价值上可能有很大差异。一个可能揭示了可复用的原理;另一个可能难以被人类内化。
形式化检查解决的是正确性问题。数学理解仍然是一个独立的任务。
在 OpenAI 发布公告不到一天后,Alpöge 写道他“用 Fable 完成了其中一半”。
他将设置描述为:

Alpöge 后来确认这五项是第4项至第8项。

| OpenAI 项目 | 主题 | Fable 主张的公开状态 |
|---|---|---|
| 4 | Connes 刚性猜想 | 声称已复现 |
| 5 | 算术电路复杂度 | 声称已复现 |
| 6 | 量子并行重复 | 声称已复现 |
| 7 | 最近向量问题 | 声称已复现 |
| 8 | Ehrhart 体积猜想 | 声称已复现 |
Alpöge表示,Ehrhart结果是唯一一个Astra和Fable似乎使用了本质上相同论证的。
如果准确的话,其他四项可能是替代性证明,而非对OpenAI路径的重构。
对于OpenAI的十项结果,公开包中包含定理陈述、完整手稿、推理过程、Lean源代码、构建说明和独立验证资源。
对于Fable的五项,我能验证Alpöge的陈述、所提及的问题编号、他所述的实验条件,以及他对Ehrhart论证的观察。
我无法验证包含以下内容的公开包:
严谨的描述是:
一位Anthropic研究员公开报告称,Fable 5在受控条件下独立完成了十个问题中的五个,但验证时,全面独立评估所需的详细证据尚未公开。
这并不证明该说法是假的。这意味着该说法尚未达到与OpenAI已发布包相同的证据阶段。
即使有上述保留意见,时间点也值得注意。
在传统数学中,一项重大新结果可能需要数月甚至数年才能被独立重构。
研究人员首先需要学习背景知识、阅读手稿、检查技术细节、重建论证、尝试替代方案、讨论问题并发表评审或后续论文。
一个能力强的模型可以压缩这一过程的某些部分。
如果一个模型的结果能在一天内被另一个模型独立达到,那么AI生成发现的优先权窗口可能会大幅缩短。
第一个团队仍然值得称赞,因为他们选择了问题、提出了首个公开论证、准备了手稿、形式化了结果,并创建了他人可以查阅的记录。
然而,当其他研究人员能立即将类似问题分配给前沿系统时,先发优势可能只会持续几天而非数年。
大多数模型基准是在已知答案的问题上比较系统。
基准问的是:
给定相同的测试集,哪个模型得分更高?
本集提出了一个不同的问题:
两个系统能否独立地得出相同的新前沿结果?
这类似于科学复现。
独立复现可以揭示某个结果是否依赖于单一模型的错误、某个脆弱的提示、信息泄露或某条不寻常的证明路径。
两个独立的论证可以增强信心,尤其是当它们采用不同思路时。
但它们仍需审查。
两个模型可能共享相似的训练来源、数学误解、优化偏差或隐性假设。
模型独立性并不自动等同于认知独立性。
一份可信的复现材料包应披露足够的信息,以便他人重复实验。
若无这些信息,“独立复现”仍难以与有前景的初步报告区分开来。
Anthropic 于2026年6月发布了 Claude Fable 5。
Anthropic 将其描述为一款面向大众使用并提供安全保障的 Mythos 级模型。
该公司表示,该模型在长期自主工作、软件工程、知识工作、视觉、科学研究和长上下文任务方面尤为突出。
官方 API 模型标识符为:
claude-fable-5
Anthropic 公布的定价为:
每百万输入令牌10美元
每百万输出令牌50美元
Fable 的公开发布与数学故事密切相关。
Astra 仍是 OpenAI 内部未发布的模型。
Fable 可通过受支持的 Anthropic 产品和 API 供研究人员和开发者访问。
这使得外部团队更容易尝试他们自己的研究问题,尽管模型访问并不保证具备选择好问题或验证输出所需的专业知识。
OpenAI 表示,以 Sol API 价格找到那十个解决方案所需的总令牌数约为 2000美元。

这个数字很惊人,但它需要一个精确的标签。
它最好被理解为成功找到解的令牌成本的估算。
它不是该研究项目的总经济成本。
更大的成本堆栈可能包括:
OpenAI 表示,它尝试过其他重大问题但未成功,并且没有解决任何千禧年大奖难题。
因此,这 2000 美元的估算回答的是:
按公开 API 费率计算,成功搜索的令牌成本是多少?
它并不回答:
创建模型并生成、验证和发布研究成果的成本是多少?
这两个数字都有用,但它们衡量的是不同的东西。
即使将间接成本纳入考量,再次进行严肃尝试的低边际成本也可能改变研究的开展方式。
人类数学家可能会花数周时间决定某条路径是否值得探索。
而人工智能系统可以被要求并行探索许多路径。
研究人员可能会使用模型来:
这种效果可能类似于其他科学中的高通量实验。
当测试另一个假设的成本下降时,被测试的假设数量就会上升。
稀缺资源转向选择有前景的问题,并评估随之而来的候选方案洪流。
仅统计成功的成本核算可能会造成误导性图景。
假设一个系统被分配了 100 个开放问题并解决了其中 10 个。
如果目标是衡量完整搜索项目的经济性,那么每个成功解决方案的成本应该包含花费在 90 个失败上的资源。
完整的核算应该报告:
总推理成本
÷
已验证结果的数量
它应该区分成功的最终运行、失败的完整运行、部分进展、人工引导的重新启动、并行候选方案以及验证成本。
如果没有这个分母,一个较低的数字可能描述的只是被挑选出来的成功案例,而不是整个发现过程的经济性。
对复现工作的一项批评直截了当:
为什么让 Fable 重做 Astra 的结果,而不是分配新的开放问题?
复现和发现服务于不同的目的。
复现测试的是可靠性。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
解决新问题测试的是前沿能力。
Fable 也被
与一个新的数学结果产生了联系。
2026年7月,Alpöge报告了雅可比猜想在三维情形下的一个反例,并将Fable在发现过程中所起的作用归功于它。
该反例经过了形式化验证,数学家们对其进行了讨论,随后又有后续工作跟进。7月底发布在arXiv上的一篇论文给出了一个自洽的完整论述,并将该机制推广到了更高维度。
这一事件揭示了一种反复出现的模式:
最终阶段可能正是大部分持久数学价值所在之处。
一个明确的反例有时可以很快得到检验。
如果一个猜想声称不存在具有某些性质的对象,那么一个有效的对象就足以将其推翻。
审阅者可以验证:
而一个冗长的一般性定理可能需要数百个相互关联的引理以及对文献的广泛理解。
这种差异部分解释了为什么人工智能生成的反例能够迅速传播。
雅可比例子足够紧凑,研究人员能够快速检查并将其形式化。
Astra的十项成果中有一些涉及更长的理论链条,可能需要社区花更多时间来消化。
核心问题是:
如果人工智能能快速生成前沿证明,数学社区能否以足够快的速度加以验证?
一项研究成果需要获得多种形式的认可。
证明是否确实从假设中推出?
Lean在这方面可以提供帮助。
形式化陈述是否与作者所声称的含义一致?
专家必须检查这种转译。
该问题是否确实是未解决的,结果是否具有新颖性?
这需要文献知识。
证明是揭示了新的思想,还是仅仅确认了一个事实?
这需要数学判断。
该工作是否经过了评审、讨论、修正并被置于恰当的语境中?
这需要时间和制度性流程。
人工智能加速证明生成的速度,远远超过了大学和期刊扩充能够评审高度专业化工作的专家队伍的速度。
一个强大的编程模型可以通过要求它构建一个应用程序来测试。
一个强大的图像模型可以通过视觉来判断。
而前沿数学则不同。
大多数读者无法亲自评估非sofic群的存在性、Connes刚性猜想的一个反例、纠缠博弈的平行重复定理或格上的困难性。
他们依赖于一条信任链:
模型输出
→ 形式化证书
→ 证明助手及其库
→ 领域专家
→ 独立评审者
→ 期刊与研究社区
这使得透明度变得更加重要,而不是更不重要。
当公众无法直接检验一种能力时,信心
必须来自证据和制度。

将这一事件描述为人工智能孤立地取代数学,是一种误导。
这些模型依赖于:
Astra的Lean证书之所以成为可能,是因为一个庞大的社区花费多年时间将数学基础形式化,并构建了可复用的库。
模型的成就是真实的。
支撑它的人类基础设施同样真实。
更诚实的描述是:
前沿模型正成为人类构建并维护的数学知识系统中的强大参与者。
一个证明可以是正确的,却未必具有启发性。
数学家们往往重视一个结果,是因为它引入了新的不变量、构造、可复用方法、领域间的联系、更简洁的解释,或更好的问题。
当人工智能生成了一个冗长的证明,审阅者可能会问:
这就是验证一个定理与将其融入人类数学之间的区别。
正确结果的数量很重要。
将这些结果转化为理解的能力可能更重要。
如果证明搜索变得更廉价,问题选择可能成为研究优势中更大的一部分。
最困难的决策可能是:
这些是数学品味的问题。
模型可能有助于生成问题,但当前的研究生态系统仍然严重依赖专家来判断哪些问题是有意义的。
传统的同行评审假设稿件数量相对较少。
人工智能可能产生比现有期刊能处理的更多的候选结果。
评审过程可能需要新的层次。
每个适合形式化的结果都应附带机器可检查的证书。
提示词、模型版本、工具访问和运行条件都应被存档。
系统应将新声明与论文和定理数据库进行比对。
独立模型复现
不同的模型或研究团队可以在不查看所提议证明的情况下尝试解决同一问题。
专家识别哪些结果值得深入审查。
正确的证明被转换为人类可以学习的形式。
开放的存储库允许错误、简化和替代论证被持续记录。
这并不会取代期刊或专家,而是为他们提供更好的工具来处理更大规模的工作量。
《莱顿人工智能与数学宣言》呼吁在数学研究中负责任地使用人工智能。
其关注点包括:
OpenAI 的发布以非同寻常的直接方式回应了其中一些问题。
它将数学论证归功于模型,说明了人类在手稿准备中的角色,发布了形式化证书,并邀请社区进行评审。
仍然存在的问题:
这些问题不再是假设性的政策议题。
它们现在适用于真实的研究成果。
区分:
查找隐藏假设、循环论证、未解释的过渡、错误引用、范围变化和模糊符号。
确认 Lean 定理忠实表达了预期的数学内容。
对于 OpenAI 的存储库:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
检查导入的模块、公理、占位符、不安全声明、自定义定义和受信任的外部代码。
形式化证明可能通过一条与手稿不同的路径来确立该定理。
将定理陈述——但不提供所提议的证明——交给另一个模型或研究团队。
确认新颖性并识别重叠的工作。
一个正确的结果之后应伴随概念性问题:
施工工作?
如果 Alpöge 或 Anthropic 发布以下内容,这一主张将大幅增强:
最有趣的结果不一定是一模一样的五个证明。
四个真正不同的论证可能更有价值,因为它们可能揭示相同结果背后的替代结构。
OpenAI 已公开提供:
这不能替代同行评审。
但它确实创建了一个严肃的、可检查的研究包。
责任已从“给我们看证据”转变为“评估大量证据”。
寓言所报告的响应表明,前沿研究能力可能比模型发布传播得更快。
公司可以保持模型私有。
但它不能假设由该模型产生的数学结果在发表后很长时间内仍保持独占性。
一旦定理表述公开,其他有能力的系统可以立即对其发起攻击。
因此,组织可能会选择快速发布完整证据,在宣布之前进行形式化,邀请独立复现,并在公开之前与领域专家协调。
优先权仍然重要。
围绕优先权主张的证据包可能同样重要。
OpenAI 发表了数学和理论计算机科学领域的十项结果,包括球堆积、编码理论、非 sofic 群、Connes 刚性猜想、算术电路、量子平行重复、格困难性、Ehrhart 体积猜想、Ramsey 数和极值图论方面的工作。OpenAI 将它们描述为解决或大幅推进长期未解开放问题的结果。
不。OpenAI 将 Astra 描述为其下一个主要模型的内部版本。论文、推理逐步解析和 Lean 证书是公开的,但用于生成论证的 Astra 模型尚未发布。
Anthropic 研究员 Levent Alpöge 公开表示,Fable 在自主、离线条件下于 24 小时内完成了问题 4-8。在验证过程中,这五次运行的完整手稿、日志、提示词和 Lean 证书未公开找到,因此在该更完整证据发布之前,这一主张应被视为初步性的。
Alpöge 确认了 Connes 刚性
猜想、算术电路复杂度、量子并行重复、最近向量问题以及埃哈特体积猜想。他表示,埃哈特的结果似乎本质上是使用了与Astra相同的论证,而另外四个结果可能有所不同。
OpenAI发布了全部十项结果的Lean 4形式化证明,并附有构建说明和独立验证资源。编译通过的Lean证书可以验证形式化定理,但专家仍需确认编码后的陈述是否忠实匹配预期的数学主张。
OpenAI表示,按照Sol API的费率,找到成功解决方案所需的令牌大约花费2000美元。该估算不包括模型训练、失败的研究尝试、人工手稿工作、基础设施、形式化验证或外部数学评审。
Lean证书允许一个小型可信内核机械地验证形式化定理是否从其假设和依赖关系中推导出来。它们降低了隐藏逻辑漏洞的风险,但不能确证新颖性、重要性或非形式化数学转换的忠实性。
当前证据支持的是数学工作方式的改变,而非简单的取代论断。模型可以加速搜索、证明生成、反例发现和形式化,而人类在问题选择、解释、文献背景、评审以及将证明转化为理解方面仍然不可或缺。
已开发。
OpenAI 发布了一个异常完整的研究包,涵盖十项 Astra 生成的进展:一份 249 页的手稿、详细的发现过程说明,以及十项可由外部研究人员重建的 Lean 形式化证明。
Claude Fable 5 据报道在 24 小时内完成了其中五个问题,这可能代表一种新型的模型辅助复制。这一说法意义重大,但其公开证据目前不及 OpenAI 提供的手稿和形式化证书完整,因此应明确标注为有待验证的结论。
2,000 美元的估算最合适的理解是:在 Sol API 费率下成功搜索解法的代币成本,而非整个研究项目的总成本。训练、失败尝试、人工准备、形式化、基础设施和评审仍然是实际经济成本的一部分。
更大的转变是从“证明稀缺”转向“评审稀缺”。模型可能很快生成数学论断的速度会超过专家验证、阐释并将其置于上下文中的速度。
当证明变得廉价易得时,最有价值的工作或许在于判断哪些证明是正确的、有意义的、新颖的,以及值得去理解。
从一句话开始,几分钟内拿到完整网站。