引言
2026年8月的一个周末,产生了迄今为止最清晰的迹象之一,表明前沿AI正在超越基准数学,进入主动研究领域。
8月1日,OpenAI发表了《数学与理论计算机科学十项进展》。这些成果由Astra的内部版本生成,OpenAI将其描述为下一代主要模型。
该成果包包括:
- 一份249页的手稿。
- 涵盖数学和理论计算机科学的十项成果。
- 一份62页的发现过程详解。
- 十个Lean 4形式化证明。
- 用于重建和独立验证证书的公开源代码。
不到24小时后,Anthropic研究员Levent Alpöge表示,公开可用的模型Claude Fable 5已复现了十项成果中的五项。
他确认这五项分别是第4至第8个问题:
- Connes刚性猜想。
- 算术电路复杂度。
- 量子并行重复。
- 最近向量问题。
- Ehrhart体积猜想。
Alpöge表示,这些运行是自主的,使用了通用提示词,没有互联网访问权限,并采取了旨在防止OpenAI的解决方案泄漏到上下文中的预防措施。
如果这五个证明经受住了全面的公开审查,这一事件将表明,由一个前沿模型产生的研究成果有时几乎可以立即被另一个模型独立重新发现。
然而,证据并不对称。OpenAI已发布手稿、过程详解和机器可验证的证书。而Fable的声明目前主要由公开陈述支持,而非完整的证明包。
因此,有用的结论并不仅仅是某个模型胜出。
AI现在能够以足够快的速度生成研究级数学,以至于验证、解释、归因和审查可能比证明生产本身更难规模化。

OpenAI发布十项研究级成果
OpenAI将这些工作描述为十项成果,它们解决或在长期悬而未决的开放问题上取得了重大进展。
这些课题涵盖高维几何、编码理论、群论、算子代数、算术电路复杂度、量子复杂性、格问题、凸几何、Ramsey理论和极值图论。
OpenAI表示,这些数学论证由内部Astra模型生成。随后,人类利用同一模型协助将这些论证整理成手稿,之后该模型在Lean中将每项成果形式化。
更准确的工作流程是:
Astra搜索数学论证
→ 选择成功的论证
→ 人类和模型准备可读的手稿
→ 模型进行形式化
在 Lean 中的结果
→ 正式证书和源代码已发布
→ 外部数学家检查正确性、新颖性和重要性
模型的贡献是核心,但最终的研究成果仍然包括人工准备、正式基础设施、软件库和专家评审。
十大成果

| 序号 | 领域 | OpenAI 发布的结果 |
|---|---|---|
| 1 | 高维球堆积 | 确定了 Cohn–Elkies 线性规划的渐近强度,并改进了通用高维堆积界 |
| 2 | 二元码和球形码 | 以指数因子改进了经典固定距离码界 |
| 3 | 非 sofic 群 | 构造了一个显式非 sofic 群,解决了是否每个可数群都允许有限置换逼近的问题 |
| 4 | Connes 刚性猜想 | 构造了具有相同群 von Neumann 代数但不同构的性质 (T) 群,从而否证了该猜想 |
| 5 | 算术电路复杂性 | 建立了计算永续式的新下界,包括阶为 (n^4/\log n) 的算术公式下界 |
| 6 | 量子平行重复 | 证明了一般有限双人纠缠博弈的指数级平行重复性质 |
| 7 | 最近向量问题 | 给出了欧几里得 CVP 及相关格问题的多项式因子近似硬度 |
| 8 | Ehrhart 体积猜想 | 在每一维中证明了指定凸体类的最优最大体积界 |
| 9 | 多色拉姆齐数 | 证明了多色三角形拉姆齐数的超指数下界,解决了 Erdős 问题 183 |
| 10 | 极值图论 | 构造了否证与 Erdős 问题 146 和 180 相关的紧性和退化性猜想的例子 |
这些不是常规的奥林匹克竞赛题。其中几个涉及多年悬而未决的问题,需要深厚的专业知识才能评估。
论文只是发布内容的一部分
OpenAI 还发布了一份 62 页的文档,题为《思路是如何形成的:数学发现笔记》。
证明回答的是:
为什么这个定理成立?
发现记录试图回答:
系统是如何找到这个论证的?
这是两个不同的问题。
逐步解析可以帮助研究人员判断模型是重新组合了已知思想、识别出某种类比、进行了广泛的搜索、找到了新的构造,还是以出人意料的方式使用了已知定理。
这些内容仍然需要谨慎对待。模型生成的叙述并不一定是每次内部计算的完美因果记录。
OpenAI 发布了十个 Lean 证书
官方的 openai/ten-proofs 仓库包含每个结果对应的一个 Lean 模块。
该项目使用:
Lean 4.32.0
mathlib
Lake
安装了 elan 后,官方 README 指示用户通过以下命令构建全部十个形式化证明:
lake exe cache get
lake build All
也可以单独构建某个模块:
lake build SpherePacking
该仓库包含:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
代码以 Apache 2.0 许可证发布,并包含独立验证资源。
Lean 证书证明了什么
Lean 是一个基于依赖类型理论的交互式定理证明器。
通过 Lean 内核验证的证明,确立了形式化定理是从定义、假设、导入的公理和库以及形式化证明项中推导出来的。
这排除了非正式论证中可能出现的许多错误:
- 缺少逻辑步骤。
- 无效的代数变换。
- 隐藏的矛盾。
- 无根据的案例。
- 量词不匹配。
- 错误的中间引理。
证书可以被机械地检查,而不是因为作者听起来有说服力就被接受。
Lean 证书不能证明什么
形式化验证并不能消除所有审阅问题。
形式化陈述是否与非正式主张一致?
定理证明器检查的是编码后的陈述。人类仍然需要判断它是否准确地捕捉到了数学问题。
定义和假设是否恰当?
Lean 验证的是形式化定义的推论。它不能决定这些定义是否反映了公认的概念,或者是否存在隐藏的假设削弱了标题结果。
结果是否新颖?
形式正确性并不等于新颖性。文献综述和专家知识仍然是必要的。
结果是否重要?
机器可以验证定理是成立的。但它无法判断结果是否改变了该领域,或是否引入了有价值的思想。
证明是否能让我们学到东西?
两个形式正确的证明在解释价值上可能有很大差异。一个可能揭示了可复用的原理;另一个可能难以被人类内化。
形式化检查解决的是正确性问题。数学理解仍然是一个独立的任务。
Claude Fable 5 声称 24 小时内复现了五项成果
在 OpenAI 发布公告不到一天后,Alpöge 写道他“用 Fable 完成了其中一半”。
他将设置描述为:
- 完全自主。
- 使用通用提示词。
- 无网络接入。
- 额外采取预防措施以防止信息泄露。

Alpöge 后来确认这五项是第4项至第8项。

| OpenAI 项目 | 主题 | Fable 主张的公开状态 |
|---|---|---|
| 4 | Connes 刚性猜想 | 声称已复现 |
| 5 | 算术电路复杂度 | 声称已复现 |
| 6 | 量子并行重复 | 声称已复现 |
| 7 | 最近向量问题 | 声称已复现 |
| 8 | Ehrhart 体积猜想 | 声称已复现 |
Alpöge表示,Ehrhart结果是唯一一个Astra和Fable似乎使用了本质上相同论证的。
如果准确的话,其他四项可能是替代性证明,而非对OpenAI路径的重构。
Fable的证据尚不等同于OpenAI的发布
对于OpenAI的十项结果,公开包中包含定理陈述、完整手稿、推理过程、Lean源代码、构建说明和独立验证资源。
对于Fable的五项,我能验证Alpöge的陈述、所提及的问题编号、他所述的实验条件,以及他对Ehrhart论证的观察。
我无法验证包含以下内容的公开包:
- 五份完整手稿。
- 确切的通用提示。
- 完整执行日志。
- 令牌使用量。
- 模型设置。
- 防泄露方法。
- Lean证书。
- 对每个论证的外部评审。
严谨的描述是:
一位Anthropic研究员公开报告称,Fable 5在受控条件下独立完成了十个问题中的五个,但验证时,全面独立评估所需的详细证据尚未公开。
这并不证明该说法是假的。这意味着该说法尚未达到与OpenAI已发布包相同的证据阶段。
为什么24小时仍然重要
即使有上述保留意见,时间点也值得注意。
在传统数学中,一项重大新结果可能需要数月甚至数年才能被独立重构。
研究人员首先需要学习背景知识、阅读手稿、检查技术细节、重建论证、尝试替代方案、讨论问题并发表评审或后续论文。
一个能力强的模型可以压缩这一过程的某些部分。
如果一个模型的结果能在一天内被另一个模型独立达到,那么AI生成发现的优先权窗口可能会大幅缩短。
第一个团队仍然值得称赞,因为他们选择了问题、提出了首个公开论证、准备了手稿、形式化了结果,并创建了他人可以查阅的记录。
然而,当其他研究人员能立即将类似问题分配给前沿系统时,先发优势可能只会持续几天而非数年。
这更接近复制而非基准竞争
大多数模型基准是在已知答案的问题上比较系统。
基准问的是:
给定相同的测试集,哪个模型得分更高?
本集提出了一个不同的问题:
两个系统能否独立地得出相同的新前沿结果?
这类似于科学复现。
独立复现可以揭示某个结果是否依赖于单一模型的错误、某个脆弱的提示、信息泄露或某条不寻常的证明路径。
两个独立的论证可以增强信心,尤其是当它们采用不同思路时。
但它们仍需审查。
两个模型可能共享相似的训练来源、数学误解、优化偏差或隐性假设。
模型独立性并不自动等同于认知独立性。
如何评估一项AI复现声明
一份可信的复现材料包应披露足够的信息,以便他人重复实验。
问题定义
- 确切的定理陈述。
- 确切的假设。
- 源问题的版本。
- 证明该问题此前为开放问题的参考文献。
模型配置
- 模型名称和版本。
- 推理或努力设置。
- 上下文长度。
- 工具访问权限。
- 相关的采样设置。
提示设计
- 初始提示。
- 后续提示。
- 人工修正。
- 任何领域提示。
- 任何脚手架。
泄漏控制
- 网络和搜索访问权限。
- 上下文中包含的源文档。
- 模型快照的时间。
- 用于检测复制语言或结构的方法。
执行记录
- 完整转录。
- 工具调用。
- 失败尝试。
- 运行时间。
- 令牌使用量。
- 并行运行次数。
数学证据
- 完整证明。
- 可行的形式化证书。
- 依赖列表。
- 与首次证明的对比。
外部审查
- 具名审阅者。
- 审阅意见。
- 修正内容。
- 剩余异议。
- 发表状态。
若无这些信息,“独立复现”仍难以与有前景的初步报告区分开来。
Fable 5 是一款公开可用的前沿模型
Anthropic 于2026年6月发布了 Claude Fable 5。
Anthropic 将其描述为一款面向大众使用并提供安全保障的 Mythos 级模型。
该公司表示,该模型在长期自主工作、软件工程、知识工作、视觉、科学研究和长上下文任务方面尤为突出。
官方 API 模型标识符为:
claude-fable-5
Anthropic 公布的定价为:
每百万输入令牌10美元
每百万输出令牌50美元
Fable 的公开发布与数学故事密切相关。
Astra 仍是 OpenAI 内部未发布的模型。
Fable 可通过受支持的 Anthropic 产品和 API 供研究人员和开发者访问。
这使得外部团队更容易尝试他们自己的研究问题,尽管模型访问并不保证具备选择好问题或验证输出所需的专业知识。
2000美元的数字是边际搜索成本的估算值
OpenAI 表示,以 Sol API 价格找到那十个解决方案所需的总令牌数约为 2000美元。

这个数字很惊人,但它需要一个精确的标签。
它最好被理解为成功找到解的令牌成本的估算。
它不是该研究项目的总经济成本。
更大的成本堆栈可能包括:
- 训练 Astra。
- 构建和运营推理基础设施。
- 研究人员筛选候选问题。
- 对未解决的问题进行尝试运行。
- 对成功问题采用过的失败方法。
- 人工撰写手稿。
- 形式化工作。
- 软件工程。
- 外部数学评审。
- 出版和维护。
OpenAI 表示,它尝试过其他重大问题但未成功,并且没有解决任何千禧年大奖难题。
因此,这 2000 美元的估算回答的是:
按公开 API 费率计算,成功搜索的令牌成本是多少?
它并不回答:
创建模型并生成、验证和发布研究成果的成本是多少?
这两个数字都有用,但它们衡量的是不同的东西。
为什么边际成本仍然会改变研究方式
即使将间接成本纳入考量,再次进行严肃尝试的低边际成本也可能改变研究的开展方式。
人类数学家可能会花数周时间决定某条路径是否值得探索。
而人工智能系统可以被要求并行探索许多路径。
研究人员可能会使用模型来:
- 搜索反例。
- 测试猜想的变体。
- 在数学语言之间进行转换。
- 寻找相关引理。
- 形式化候选证明。
- 生成计算实验。
- 比较证明策略。
- 识别漏洞。
- 寻找更简化的表述。
这种效果可能类似于其他科学中的高通量实验。
当测试另一个假设的成本下降时,被测试的假设数量就会上升。
稀缺资源转向选择有前景的问题,并评估随之而来的候选方案洪流。
失败的尝试也需要被计入
仅统计成功的成本核算可能会造成误导性图景。
假设一个系统被分配了 100 个开放问题并解决了其中 10 个。
如果目标是衡量完整搜索项目的经济性,那么每个成功解决方案的成本应该包含花费在 90 个失败上的资源。
完整的核算应该报告:
总推理成本
÷
已验证结果的数量
它应该区分成功的最终运行、失败的完整运行、部分进展、人工引导的重新启动、并行候选方案以及验证成本。
如果没有这个分母,一个较低的数字可能描述的只是被挑选出来的成功案例,而不是整个发现过程的经济性。
Fable 也被用于一个新的开放问题
对复现工作的一项批评直截了当:
为什么让 Fable 重做 Astra 的结果,而不是分配新的开放问题?
复现和发现服务于不同的目的。
复现测试的是可靠性。
解决新问题测试的是前沿能力。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
Fable 也被
与一个新的数学结果产生了联系。
2026年7月,Alpöge报告了雅可比猜想在三维情形下的一个反例,并将Fable在发现过程中所起的作用归功于它。
该反例经过了形式化验证,数学家们对其进行了讨论,随后又有后续工作跟进。7月底发布在arXiv上的一篇论文给出了一个自洽的完整论述,并将该机制推广到了更高维度。
这一事件揭示了一种反复出现的模式:
- 人工智能产生一个明确的对象或论证。
- 形式化工具验证核心论断。
- 人类数学家寻求概念层面的解释。
- 后续工作将结果加以推广。
最终阶段可能正是大部分持久数学价值所在之处。
反例与证明造成不同的验证负担
一个明确的反例有时可以很快得到检验。
如果一个猜想声称不存在具有某些性质的对象,那么一个有效的对象就足以将其推翻。
审阅者可以验证:
- 该对象定义良好。
- 它满足假设条件。
- 它违反了结论。
而一个冗长的一般性定理可能需要数百个相互关联的引理以及对文献的广泛理解。
这种差异部分解释了为什么人工智能生成的反例能够迅速传播。
雅可比例子足够紧凑,研究人员能够快速检查并将其形式化。
Astra的十项成果中有一些涉及更长的理论链条,可能需要社区花更多时间来消化。
新的瓶颈在于人类评审
核心问题是:
如果人工智能能快速生成前沿证明,数学社区能否以足够快的速度加以验证?
一项研究成果需要获得多种形式的认可。
逻辑认可
证明是否确实从假设中推出?
Lean在这方面可以提供帮助。
语义认可
形式化陈述是否与作者所声称的含义一致?
专家必须检查这种转译。
历史认可
该问题是否确实是未解决的,结果是否具有新颖性?
这需要文献知识。
概念认可
证明是揭示了新的思想,还是仅仅确认了一个事实?
这需要数学判断。
社区认可
该工作是否经过了评审、讨论、修正并被置于恰当的语境中?
这需要时间和制度性流程。
人工智能加速证明生成的速度,远远超过了大学和期刊扩充能够评审高度专业化工作的专家队伍的速度。
大多数人无法独立评判这些结果
一个强大的编程模型可以通过要求它构建一个应用程序来测试。
一个强大的图像模型可以通过视觉来判断。
而前沿数学则不同。
大多数读者无法亲自评估非sofic群的存在性、Connes刚性猜想的一个反例、纠缠博弈的平行重复定理或格上的困难性。
他们依赖于一条信任链:
模型输出
→ 形式化证书
→ 证明助手及其库
→ 领域专家
→ 独立评审者
→ 期刊与研究社区
这使得透明度变得更加重要,而不是更不重要。
当公众无法直接检验一种能力时,信心
必须来自证据和制度。

形式化证明仍依赖人类构建的基础设施
将这一事件描述为人工智能孤立地取代数学,是一种误导。
这些模型依赖于:
- 数百年的数学文献。
- 人类创建的定义。
- 已发表的定理。
- 形式化证明助手。
- Mathlib。
- Lean的可信内核。
- 选择问题的研究人员。
- 解读结果的专家。
- 构建训练和推理系统的工程师。
Astra的Lean证书之所以成为可能,是因为一个庞大的社区花费多年时间将数学基础形式化,并构建了可复用的库。
模型的成就是真实的。
支撑它的人类基础设施同样真实。
更诚实的描述是:
前沿模型正成为人类构建并维护的数学知识系统中的强大参与者。
正确性不等于理解
一个证明可以是正确的,却未必具有启发性。
数学家们往往重视一个结果,是因为它引入了新的不变量、构造、可复用方法、领域间的联系、更简洁的解释,或更好的问题。
当人工智能生成了一个冗长的证明,审阅者可能会问:
- 哪一步包含了真正的核心思想?
- 为什么这种构造有效?
- 哪些假设是必不可少的?
- 这个证明能否被简化?
- 这种方法能否解决相关问题?
- 由此可以得出哪些新的猜想?
这就是验证一个定理与将其融入人类数学之间的区别。
正确结果的数量很重要。
将这些结果转化为理解的能力可能更重要。
数学品味可能变得更加有价值
如果证明搜索变得更廉价,问题选择可能成为研究优势中更大的一部分。
最困难的决策可能是:
- 哪个猜想值得验证?
- 哪个版本可能是错误的?
- 哪个特例可能解开一般性问题?
- 哪个结果能连接多个领域?
- 哪种形式化是忠实可靠的?
- 哪个生成的证明包含可复用的思想?
这些是数学品味的问题。
模型可能有助于生成问题,但当前的研究生态系统仍然严重依赖专家来判断哪些问题是有意义的。
同行评审可能需要新的技术栈
传统的同行评审假设稿件数量相对较少。
人工智能可能产生比现有期刊能处理的更多的候选结果。
评审过程可能需要新的层次。
自动化形式化检查
每个适合形式化的结果都应附带机器可检查的证书。
可复现的生成记录
提示词、模型版本、工具访问和运行条件都应被存档。
自动化文献检索
系统应将新声明与论文和定理数据库进行比对。
独立模型复现
不同的模型或研究团队可以在不查看所提议证明的情况下尝试解决同一问题。
专家分诊
专家识别哪些结果值得深入审查。
解释性重写
正确的证明被转换为人类可以学习的形式。
发表后评审
开放的存储库允许错误、简化和替代论证被持续记录。
这并不会取代期刊或专家,而是为他们提供更好的工具来处理更大规模的工作量。
《莱顿宣言》提出了治理问题
《莱顿人工智能与数学宣言》呼吁在数学研究中负责任地使用人工智能。
其关注点包括:
- 似是而非但不可靠的论证。
- 人工智能参与的透明度。
- 署名归属。
- 对正确性的责任。
- 对昂贵专有系统的不平等访问。
- 过度炒作。
- 人类对研究议程的控制。
OpenAI 的发布以非同寻常的直接方式回应了其中一些问题。
它将数学论证归功于模型,说明了人类在手稿准备中的角色,发布了形式化证书,并邀请社区进行评审。
仍然存在的问题:
- 谁应被列为作者?
- 谁对错误负责?
- 模型生成的发现应如何引用训练来源?
- 访问权限应如何分配?
- 结果何时适合公开宣布?
- 自主发现的声明应附带哪些证据?
这些问题不再是假设性的政策议题。
它们现在适用于真实的研究成果。
实用验证清单
第一步:确认问题
- 找到权威陈述。
- 检查其确切假设。
- 验证所声称的版本是公开的。
- 识别已有的部分先期结果。
第二步:区分里程碑
区分:
- 模型提出了一个想法。
- 模型撰写了证明。
- 人类编辑了证明。
- 证明被形式化。
- 形式化验证通过编译。
- 专家接受了结果。
- 结果通过了发表评审。
第三步:阅读非形式化证明
查找隐藏假设、循环论证、未解释的过渡、错误引用、范围变化和模糊符号。
第四步:检查形式化陈述
确认 Lean 定理忠实表达了预期的数学内容。
第五步:重建证书
对于 OpenAI 的存储库:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
第六步:检查依赖
检查导入的模块、公理、占位符、不安全声明、自定义定义和受信任的外部代码。
第七步:比较非形式化与形式化证明
形式化证明可能通过一条与手稿不同的路径来确立该定理。
第八步:尝试独立复现
将定理陈述——但不提供所提议的证明——交给另一个模型或研究团队。
第九步:检索文献
确认新颖性并识别重叠的工作。
第十步:反思学到了什么
一个正确的结果之后应伴随概念性问题:
- 为什么该
施工工作?
- 能否简化?
- 它概括了什么?
- 哪些先前的信念应该改变?
什么能证实寓言五?
如果 Alpöge 或 Anthropic 发布以下内容,这一主张将大幅增强:
- 所使用的精确定理表述。
- 提示词和模型配置。
- 全部五项结果的证明手稿。
- 时间戳和完整运行日志。
- 离线环境的详细信息。
- 防泄漏方法。
- 与 Astra 论证的比较。
- Lean 证书或其他机器可检查格式。
- 独立专家评审。
最有趣的结果不一定是一模一样的五个证明。
四个真正不同的论证可能更有价值,因为它们可能揭示相同结果背后的替代结构。
OpenAI 的发布已经确立了什么
OpenAI 已公开提供:
- 十个详细的数学结果。
- 完整的手稿。
- 发现过程的逐步解析。
- 十个形式化文件。
- 构建说明。
- 一个 Apache 许可的代码库。
- 关于 AI 和人类贡献的清晰声明。
这不能替代同行评审。
但它确实创建了一个严肃的、可检查的研究包。
责任已从“给我们看证据”转变为“评估大量证据”。
24 小时响应揭示了什么
寓言所报告的响应表明,前沿研究能力可能比模型发布传播得更快。
公司可以保持模型私有。
但它不能假设由该模型产生的数学结果在发表后很长时间内仍保持独占性。
一旦定理表述公开,其他有能力的系统可以立即对其发起攻击。
因此,组织可能会选择快速发布完整证据,在宣布之前进行形式化,邀请独立复现,并在公开之前与领域专家协调。
优先权仍然重要。
围绕优先权主张的证据包可能同样重要。
常见问题
OpenAI Astra 证明了什么?
OpenAI 发表了数学和理论计算机科学领域的十项结果,包括球堆积、编码理论、非 sofic 群、Connes 刚性猜想、算术电路、量子平行重复、格困难性、Ehrhart 体积猜想、Ramsey 数和极值图论方面的工作。OpenAI 将它们描述为解决或大幅推进长期未解开放问题的结果。
OpenAI Astra 公开可用吗?
不。OpenAI 将 Astra 描述为其下一个主要模型的内部版本。论文、推理逐步解析和 Lean 证书是公开的,但用于生成论证的 Astra 模型尚未发布。
Claude Fable 5 真的复现了 Astra 的五个证明吗?
Anthropic 研究员 Levent Alpöge 公开表示,Fable 在自主、离线条件下于 24 小时内完成了问题 4-8。在验证过程中,这五次运行的完整手稿、日志、提示词和 Lean 证书未公开找到,因此在该更完整证据发布之前,这一主张应被视为初步性的。
据报道 Fable 完成了哪五个问题?
Alpöge 确认了 Connes 刚性
猜想、算术电路复杂度、量子并行重复、最近向量问题以及埃哈特体积猜想。他表示,埃哈特的结果似乎本质上是使用了与Astra相同的论证,而另外四个结果可能有所不同。
OpenAI的证明是否经过形式化验证?
OpenAI发布了全部十项结果的Lean 4形式化证明,并附有构建说明和独立验证资源。编译通过的Lean证书可以验证形式化定理,但专家仍需确认编码后的陈述是否忠实匹配预期的数学主张。
这十项结果是否只花费了2000美元?
OpenAI表示,按照Sol API的费率,找到成功解决方案所需的令牌大约花费2000美元。该估算不包括模型训练、失败的研究尝试、人工手稿工作、基础设施、形式化验证或外部数学评审。
为什么Lean证书很重要?
Lean证书允许一个小型可信内核机械地验证形式化定理是否从其假设和依赖关系中推导出来。它们降低了隐藏逻辑漏洞的风险,但不能确证新颖性、重要性或非形式化数学转换的忠实性。
AI会取代数学家吗?
当前证据支持的是数学工作方式的改变,而非简单的取代论断。模型可以加速搜索、证明生成、反例发现和形式化,而人类在问题选择、解释、文献背景、评审以及将证明转化为理解方面仍然不可或缺。
相关工具
- Lean:一个交互式定理证明器和编程语言,用于形式化数学和软件验证。
- Mathlib:由社区维护的数学库,被许多Lean形式化项目使用。
- OpenAI Ten Proofs:包含Astra十项已发布结果Lean 4证书的官方代码库。
- Elan:用于安装和管理Lean版本的工具链管理器。
- Lake:Lean的构建系统和包管理器,用于编译OpenAI的形式化证明。
- Claude Fable 5:Anthropic面向长时运行的知识、编码、视觉和科学任务的公开模型。
- Formal Conjectures:包含形式化数学猜想陈述的代码库,支持机器可验证的研究工作流程。
相关链接
- OpenAI:数学与理论计算机科学十项进展:OpenAI的官方公告、定理摘要、归属声明以及支持材料链接。
- 完整249页手稿:数学与理论计算机科学成果的完整汇编。
- 数学发现逐步解读:OpenAI对模型想法如何产生的62页说明。
已开发。
- OpenAI Lean 证书:源代码、构建命令、单个定理模块及独立验证说明。
- Anthropic:Claude Fable 5 与 Claude Mythos 5:Fable 5 的官方能力、可用性、安全措施、API 标识符及定价。
- 莱顿人工智能与数学宣言:一项数学界倡议,涵盖可靠性、归属、透明度、可及性与人类责任。
- 二维以上雅可比猜想的反例:后续论文,描述并推广了近期反例背后的机制。
摘要
OpenAI 发布了一个异常完整的研究包,涵盖十项 Astra 生成的进展:一份 249 页的手稿、详细的发现过程说明,以及十项可由外部研究人员重建的 Lean 形式化证明。
Claude Fable 5 据报道在 24 小时内完成了其中五个问题,这可能代表一种新型的模型辅助复制。这一说法意义重大,但其公开证据目前不及 OpenAI 提供的手稿和形式化证书完整,因此应明确标注为有待验证的结论。
2,000 美元的估算最合适的理解是:在 Sol API 费率下成功搜索解法的代币成本,而非整个研究项目的总成本。训练、失败尝试、人工准备、形式化、基础设施和评审仍然是实际经济成本的一部分。
更大的转变是从“证明稀缺”转向“评审稀缺”。模型可能很快生成数学论断的速度会超过专家验证、阐释并将其置于上下文中的速度。
当证明变得廉价易得时,最有价值的工作或许在于判断哪些证明是正确的、有意义的、新颖的,以及值得去理解。



