For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh-TW/articles/openai-math-release-backlash-ahm-statemen-ac66e132.md.
OpenAI 于 2026 年 10 月 6 日发布的数学成果,引发了迄今最激烈的争论之一:当前沿人工智能开始以人类社群难以消化的速度产出研究成果时,数学研究将发生什么变化。

OpenAI 于 2026 年 10 月 6 日发布的数学成果,引发了迄今最激烈的争论之一:当前沿人工智能开始以人类社群难以消化的速度产出研究成果时,数学研究将发生什么变化。
OpenAI 发布了数百份由其内部前沿模型生成的数学手稿,涵盖数学和理论计算机科学的多个领域。最初的仓库包含 722 份手稿,分为 372 个成果系列。
这一发布立即引发了强烈关注。
一些数学家认为,这代表着发现速度的历史性加快。
另一些人则担心,在人类专家有足够时间理解、验证、建立语境或解释这些成果之前,大量艰深论证就已经被投入公共领域。
最有组织的批评来自 人类数学协会(Association for Human Mathematics,AHM)。该组织于 10 月 7 日发表声明,敦促数学家停止与 OpenAI 合作,并呼吁建立一种以人类理解为核心的科学愿景。
Terence Tao 将这份声明转发为个人数学博客上的客座文章,从而进一步扩大了其传播范围。
这一细节很重要。
Tao 并不是 AHM 声明的作者,公开的 AHM 声明由该组织的 传播工作组(Communications Working Group) 签署。Tao 的博客明确说明,这是一篇从 AHM 自身声明页面转载的客座文章。
因此,将这一事件概括为“Terence Tao 带领数学家向 OpenAI 宣战”并不准确。
更精确的描述是:
AHM 针对 OpenAI 的发布模式发表了一份措辞强烈的声明,而 Tao 通过转载这份声明,进一步扩大了它的影响力。

AHM 的声明篇幅不长,但立场非常直接。
该组织认为,OpenAI 大规模发布 AI 生成数学成果的做法,既违背现有科学规范,也违背独立的 数学与人工智能咨询组(Advisory Group on Mathematics and Artificial Intelligence,AGMAI) 此前提出的建议。
AHM 的核心反对意见并不局限于单个证明是否正确。
这份声明关注的是整个过程。
其立场可以概括为四点:
AHM 的声明最后敦促数学家停止与 OpenAI 合作。
这确实是一项抵制呼吁。
但它不应被误解为整个数学界的共识立场。
AHM 是一个会员组织,围绕人类作者创作的数学,以及与商业 AI 公司合作的边界,拥有明确的公开承诺。其会员资格向数学研究社群中具有研究生及以上水平的成员开放。
在最终核验时,AHM 的公开会员页面列出了 809 名会员,其中包括 532 名 AI-free 核心小组成员。
这是一个具有实际影响力的组织,但它并不是代表所有数学家的正式机构。
Scott Aaronson 后来也明确指出了这一点:AHM 会员代表的是他们自己,而不是整个数学界。
了解 AGMAI 的建议,有助于更清楚地理解这场争议。
AGMAI 是一个设在高等研究院(Institute for Advanced Study)的独立小组。其成员包括 Timothy Gowers、Martin Hairer、Edward Witten、Ravi Vakil 等数学家。
OpenAI 曾联系其中部分成员,希望建立一个外部咨询组,但该小组独立运作,并不接受 OpenAI 的付款。
9 月 29 日,AGMAI 发布了 《负责任发布 AI 生成数学成果指南》(Responsible Release of AI-Generated Mathematics)。
指南的第一段就指出,该小组不认可前沿 AI 实验室在数学研究社群无法访问的专有模型上测试高级数学问题。
指南明确要求这些实验室停止这样做。
这正是 AHM 后来抓住的核心问题。
然而,OpenAI 仍继续使用其内部模型评估开放研究问题。
与此同时,OpenAI 表示,自己曾就如何在成果产生之后负责任地发布这些成果这一问题,向 AGMAI 征求意见。
这是两个不同的问题:
前沿实验室是否应在开放研究问题上测试专有模型?
以及:
如果实验室已经拥有重要的 AI 生成成果,应该如何发布这些成果?
AHM 认为,OpenAI 忽略了第一个问题,却利用围绕第二个问题的咨询,为此次发布赋予了正当性。
OpenAI 的立场是,持续开展内部科学评估对于开发更好的研究工具十分重要,而发布流程仍可以通过社群反馈不断改进。

AGMAI 于 9 月 29 日发布的建议,比简单的“停止”要求更加具体。
对于尚未被人类理解的 AI 生成数学成果,该小组建议实验室:
OpenAI 落实了其中一部分建议。
该公司将材料发布在带有版本管理和引用规范的公共 GitHub 仓库中。
它为许多证明发布了 Lean 形式化版本。
它发布了 10 份压缩版推理摘要。
它披露了大致算力使用量和评估统计数据。
它还承诺资助研讨会、会议及其他项目,帮助人类理解 AI 产出的重要成果。
但由于此次发布的规模前所未有,而且大量工作尚未被数学家充分消化,这一发布仍然引发了争议。
最初的发布内容包括:
| 发布细节 | OpenAI 公开数据 |
|---|---|
| 初始手稿数量 | 722 |
| 成果系列 | 372 |
| 向模型提出的大致问题数量 | 4,000 |
| 每项成果的平均算力 | 约相当于 ChatGPT Pro 思考模式 3 小时 |
| 压缩版推理摘要 | 10 |
| Lean 形式化版本 | 很多,但并非所有手稿都有 |
官方仓库将“系列”(family)描述为一组相关论文,其中可以包括主要成果、替代证明、推论或配套论证。
这一点很重要,因为:
722 份手稿 ≠ 722 个互不相关的已解决问题
这些手稿被归入 372 个成果系列。
OpenAI 也没有声称内部模型解决了它尝试的每一个问题。
仓库称,该内部模型在评估期间被提出了大约 4,000 个问题。
BAAI 来源文章引用了 Scott Aaronson 10 月 7 日“数学末日”文章中的数字:大约尝试了 8,000 个问题,粗略成功率为 5%。
Aaronson 写道,这似乎是他听到的说法。
OpenAI 自身的仓库目前给出了不同的数字:
大约 4,000 个问题
由于该仓库是第一方发布记录,本文将 OpenAI 的数字作为主要参考。
直接用 372 除以 4,000 来计算简单的“成功率”同样并不稳妥。
一个成果系列并不一定与单个尝试过的提示词一一对应,而且仓库说明,目录是根据成果的重要性进行筛选和聚合的。
最初的“722 份手稿”已经不再是当前数量。
OpenAI 的仓库历史显示,一个符号错误使一份手稿及其依赖的两篇论文失效。
三份手稿被撤回。
OpenAI 还对另外 14 份手稿进行了修订,包括修复证明、纠正表述、明确假设、修正依赖关系和更正引用。
截至最新核验,仓库包含:
719 份手稿
372 个成果系列
这为争论双方都提供了重要证据。
对批评者而言,这说明在完全理解之前进行大规模发布,可能造成质量控制问题。
对支持者而言,这表明 OpenAI 正在维护一个公开的修订和撤回流程,而不是假装首发版本不可更改。
仓库保留了旧版本,并附有解释具体缺陷的撤回通知。
理论计算机科学家的反应,最能体现这次发布带来的情绪冲击。
Scott Aaronson 将这一事件称为 “数学末日”(Mathocalypse)。
他的文章列举了复杂性理论、算法、数论、数学物理学及其他领域中的重要主张。
对 Aaronson 而言,最令人震动的成果之一,是声称证明了唯一游戏猜想(Unique Games Conjecture,UGC)。
他的妻子 Dana Moshkovitz 在职业生涯的大部分时间里都从事与 UGC 相关的问题研究。
这份发布的手稿附带了 Lean 证书,但 Aaronson 强调,形式化验证并不等同于人类理解。
Moshkovitz 最初的反应并不是简单地说“这个证明是错的”。
相反,她认为这份手稿极难阅读。
她批评手稿对既有成果的使用不清晰、引用令人困惑、构造方式陌生,而且论述方式使得读者几乎不借助 AI 就无法理解整个论证。
与此同时,她的反应也并非完全负面。
Aaronson 的文章还引用了她对未来的设想:具有创造性视野的数学家可以使用 AI 检查和实现自己的想法,而那些陌生的构造方式也可能带来许多值得学习的内容。
这比原文中“绝望”的表述更加复杂。
问题并不只是 AI 能否解决一个问题。
问题还在于,人类能否真正吸收 AI 找到的内容。
这场争论中最重要的区别之一,是:
形式正确性
与:
人类数学理解
Lean 可以机械检查一个形式化证明是否由给定公理和此前验证过的引理推出。
这是一种强有力的保障形式。
但 Lean 证明不会自动回答以下问题:
传统数学所做的不只是证明真理。
它还围绕真理建立一套可复用的智识结构。
这正是 AHM 和 AGMAI 强调人类理解时所指的核心。
OpenAI 在 10 月 6 日的公告中并没有声称,将仓库上传完成就意味着科学过程结束。
该公司表示,希望这些成果能够推动人类知识发展,并将资助:
OpenAI 还表示,正在探索由社群托管的替代方案,避免材料只能保存在公司控制的仓库中。
该公司承诺改进未来的发布方式。
其中包括更好的数学论述和展示形式。
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
OpenAI 的论点实际上是:
这些成果已经存在。通过发布带有相关材料、修订记录和形式化证明的成果,数学界可以开始理解它们。
AHM 的反驳是:
以远快于数学界理解速度的方式创造和发布成果,会改变研究生态本身,而验证负担的存在并不是中性的。
这并不是简单的“AI 好”与“AI 坏”之争。
双方争论的是,什么才算负责任的科学进步。
BAAI 的标题将这一事件描述为 Tao “领导”了一场集体抵制行动。
但主要来源并不支持这种说法。
Tao 的博客写道:
这是人类数学协会的一篇客座文章,
转载自该协会的声明页面。
声明本身的署名是:
人类数学协会
传播工作组
Tao 的名字并未出现在 AHM 当前公开的会员名单中。
这并不意味着他不同意 AHM 提出的每一项担忧。
Tao 曾多次讨论数学领域因 AI 发展极其迅速而面临的挑战,包括他所称的一种“证明消化不良”风险:成果到来的速度可能超过数学界的吸收能力。
但转载一份声明,并不等同于撰写、签署该声明,或领导发布声明的组织。

原文最具概念性的部分,讨论了一个难题:一个艰难问题被“解决”之后会发生什么。
在传统数学中,一项重要成果往往会带来多年的后续工作:
证明本身只是开始。
一种强大的新技术,可能比它最初证明的定理更有价值。
令人担忧的是,AI 现在可能生成的前沿级论证数量,已经超过数学界能够消化的数量。
这造成了一种不对称:
AI 生成能力
↓
数百份证明
人类专家能力
↓
缓慢阅读、检查、解释和教学
如果产出速度远快于理解速度,研究人员可能会将越来越多的时间用于解释机器生成的数学,而不是自主选择研究方向。
AGMAI 明确提出了这种担忧。
其 10 月 6 日的回应指出,数学研究的未来不能只由人类理解 AI 实验室选择并生成的成果构成。
数学家仍然必须能够选择自己的问题,并追求不由私人公司评估优先级定义的研究方向。
原文有时将这场争议描述为数学家担心“被取代”。
职业焦虑显然是这种反应的一部分。
但主要声明提出了更广泛的论点。
数学不只是一份等待被逐一解决的问题清单。
研究人员还重视:
能够快速生成证明的模型,会改变这一生态系统中的一部分。
但它不会自动取代其他部分。
更深层的争议在于,当一个组织拥有远强于公共研究社群的数学工具时,谁来控制研究议程。
AGMAI 将其描述为形成双层体系的风险:专有实验室可能将整个领域甩在身后。
这里还存在一个更微妙的研究问题。
对一些数学家而言,发现答案的路径与最终定理同样重要。
如果一个解决方案突然出现,即使没有清晰解释,未来的尝试也不再具有心理上的独立性。
研究人员知道:
这些信息会永久改变搜索过程。
原文将其称为“污染”。
一个更中性的术语是信息独立性的丧失。
一旦一个领域知道终点,研究人员就无法再以同样的方式经历原本的不确定性。
这是否构成伤害,取决于人们认为数学研究的目的是什么。
如果唯一目标是积累真实定理,那么快速解决问题显然很有吸引力。
如果目标还包括培养独立的人类发现与洞察,答案就没有那么简单。
Yann LeCun 的回应代表了相反的观点。
他在公开评论中表示,数学正在进入一个新时代,而不是走向消亡。
他的观点是,随着形式化证明越来越自动化,人类注意力可以转向:
这是一种熟悉的类比:
一项技术可能降低某种人类技能的重要性,同时扩大人们能够完成的事情范围。
在这一观点下,自动化证明不会杀死数学。
它会改变人类数学家的相对优势。

Scott Aaronson 也持有类似的混合立场。
当他认为 AI 公司的行为值得批评时,他会强烈批评这些公司;但他同样反对因为人类研究者希望先解决开放数学问题,就要求公司完全不去解决这些问题。
他的结论是,数学需要适应新的环境。
目前还无法知道,10 月 6 日发布的成果中有多少能够以当前形式经受住专家的详细审查。
OpenAI 自身也提醒,部分尚未形式化的成果可能存在问题。
三份手稿立即被撤回,说明谨慎是必要的。
与此同时,将整个发布都斥为“AI 垃圾”同样很难成立。
部分手稿拥有可由机器检查的 Lean 形式化版本。
专家正在积极阅读其中的重要成果。
这批材料包含了一些关于重要问题的主张,而严肃研究人员已经围绕这些问题工作了多年。
因此,正确的标准既不是盲目接受,也不是自动拒绝。
每项成果都需要自己的验证路径:
AI 生成手稿
↓
在可行情况下进行形式化验证
↓
专家阅读
↓
文献与原创性检查
↓
说明性重构
↓
社群接受或拒绝
这一过程需要时间。
| 主张 | 当前状态 |
|---|---|
| OpenAI 发布了 700 多份 AI 生成数学手稿 | 已确认 |
| 初始仓库包含 722 份手稿 | 已确认 |
| 当前仓库包含 719 份手稿 | 已确认,3 份被撤回 |
| 该合集包含 372 个成果系列 | 已确认 |
| 模型接受了约 8,000 个问题的测试 | Scott Aaronson 报告如此,但 OpenAI 仓库称约 4,000 个 |
| 平均算力约相当于每项成果使用 3 小时 ChatGPT Pro 思考模式 | OpenAI 已确认 |
| 许多手稿拥有 Lean 形式化版本 | 已确认 |
| 每份手稿都经过形式化验证 | 错误 |
| 每项成果都已被人类专家完全理解 | 否 |
| AHM 呼吁数学家停止与 OpenAI 合作 | 已确认 |
| Terence Tao 撰写或领导了 AHM 声明 | 主要来源不支持 |
| Tao 在其博客上转载了 AHM 声明 | 已确认 |
| AGMAI 认可了 OpenAI 的完整流程 | 否;AGMAI 明确表示其角色不构成认可 |
| OpenAI 正在资助帮助人类理解成果的项目 | 已确认 |
| 全部 372 个成果系列都已经成为数学界接受的定理 | 否 |
如果前沿模型继续改进,这场争议可能会持续超越当前这个仓库。
数学界需要建立能够与前沿模型同步扩展的工作流程。
目前已经逐渐明确了若干要求。
每项成果都应说明由哪个模型生成、使用了哪些提示词、消耗了多少算力,以及人类进行了哪些编辑。
在可能的情况下,证明应当附带可由机器检查的材料。
如果专家无法理解证明为什么有效,那么仅仅证明正确是不够的。
AI 系统需要更强的工作流程,以识别相关的既有技术并合理分配贡献归属。
科学成果不应完全依赖于生成成果的公司所控制的基础设施。
如果实验室发布数百项高级成果,那么解释这些成果的负担不应完全转嫁给无偿工作的学者。
如果只有少数公司能够使用最强大的数学系统,研究社群就无法保持智识独立。
这些问题比“人类对抗 AI”这一简单标题更接近 AGMAI 实际讨论的内容。
OpenAI 发布了一个大型公共仓库,其中包含由其内部前沿模型生成的数学手稿和证明材料。初始发布包括 722 份手稿,分为 372 个成果系列。
OpenAI 发现一个论证中的符号错误同时影响了两篇依赖该论证的论文,因此撤回了三份手稿。仓库保留了版本历史和撤回通知。
主要来源不支持这种说法。这份声明由人类数学协会传播工作组发布;Tao 以客座文章的形式在个人博客上转载了它。
AHM 是一个致力于在 AI 时代维护数学作为人类智识实践的组织。它向同意相关承诺的研究生及以上级别研究人员开放会员资格,其中包括对与商业 AI 公司开展某些合作,以及发布 AI 生成数学写作的限制。
AGMAI 是设在高等研究院的独立数学与人工智能咨询组。它就如何负责任地与数学研究互动向 AI 实验室提供建议,但对 OpenAI 没有决策权。
AGMAI 表示,其咨询角色不应被理解为认可产生这些成果的流程。该小组欢迎建设性互动,但表示数学界必须自行判断其建议得到了多大程度的遵循。
没有。OpenAI 表示,许多证明拥有 Lean 形式化版本,但并非全部都有。仓库明确提醒,部分尚未形式化的成果可能存在问题。
形式化正确的证明可以确立逻辑有效性,但数学还依赖解释、可复用思想、概念结构、历史语境和新的研究方向。人类理解能够将孤立的定理转化为一门鲜活学科的一部分。
OpenAI 于 10 月 6 日发布的数学成果,既是一次研究里程碑,也是对数学学术规范的一次压力测试。该公司发布了数百份 AI 生成手稿,其中许多附带形式化材料,但人类理解的速度并未跟上产出规模。
AHM 随后敦促数学家停止与 OpenAI 合作,并维护一种以人类理解为核心的科学。Tao 通过转载该声明扩大了其传播范围,但他并未撰写或领导这份声明。AGMAI 则采取了更偏程序性的立场:它反对在开放研究问题上测试专有模型,同时也发布了详细建议,说明当这类成果已经存在时应如何负责任地发布。
仓库本身已经在不断变化。三份手稿已被撤回,其他手稿得到修订,专家社群也开始开展更为缓慢的工作,以理解模型究竟发现了什么。
核心冲突并不只是人类数学家与 AI 之间的对立,而是新定理的产出速度是否能够远远超过人类用于验证、解释、建立语境以及选择数学未来方向的过程。
從一句話開始,幾分鐘內拿到完整網站。