For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/claude-opus-5-vs-gpt-6-astra-200-game-ai-9a33a10d.md.
如果给两个前沿 AI 模型相同的目标,让它们进行数百局国际象棋对弈,允许它们在对局之间保留笔记,同时尽量不直接教它们如何改进,会发生什么?

如果给两个前沿 AI 模型相同的目标,让它们进行数百局国际象棋对弈,允许它们在对局之间保留笔记,同时尽量不直接教它们如何改进,会发生什么?
Peter Gostev 进行了一项这样的实验。
Claude Opus 5.5 和 GPT-6 Astra 各自获得了一个目标:与 Stockfish 进行最多 200 局对弈,并通过经验不断变强。
整个运行过程中没有进行微调。
模型权重没有改变。
中途没有加入人工设计的开局课程。
模型可以自行决定挑战哪一种可用的 Stockfish 难度、在笔记中记录什么,以及如何在之后的对局中使用这些笔记。唯一一项严格限制很直接:
不允许调用国际象棋引擎来选择走法。
两条表现轨迹最终几乎完全相反。
Claude Opus 5.5 在早期大致徘徊于 1400 分中段至 1500 分中段,之后逐步上升至 1700 分高段。GPT-6 Astra 开局更强,在约第 29 局时短暂达到 1810 分,随后持续下滑,并在第 200 局结束时降至 1400 分。

这项实验并不能证明某个模型在所有方面都比另一个模型“更聪明”。
它提出的是一个更聚焦、也可以说更有意思的问题:
一个权重固定的语言模型,能否通过自身上下文中积累的经验得到提升?
这个实验设置立刻让人想起一个较早的 Reddit 思想实验。
场景很简单:一个普通人懂得国际象棋规则,但从未认真下过棋。他被困在一个时间循环中,只有击败前世界冠军加里·卡斯帕罗夫才能逃脱。
每当此人输棋,时间就会重置。
卡斯帕罗夫会忘记上一局。
挑战者则记得所有事情。

问题不在于暴力枚举是否最终可以穷尽国际象棋,而在于保留的经验能否在反复尝试中转化为有用的改进。
一些评论者提出了巧妙策略,包括记住卡斯帕罗夫上一局的走法,并在交换执棋颜色后重新利用这些走法。
Gostev 的基准测试将这个思想实验转化为可以利用现代 AI 智能体进行验证的测试。
Stockfish 不会从上一局中学习。
语言模型同样不会更新自身权重——但它可以保留笔记和文件,并在之后的对局中读取它们。
这使得该测试成为一种持续性的上下文内适应形式。
每个模型都收到相同的高层目标:
与 Stockfish 进行最多 200 局国际象棋对弈。
从对局中学习并变得更强。
自行选择难度,并在有帮助时保留笔记。
不得使用国际象棋引擎来选择走法。
Gostev 有意避免向模型提供人工制作的国际象棋训练课程。
评论者建议教授特定开局或策略,但他拒绝了这种做法,因为这会改变所测试的问题。
他想了解的是:模型能否自行发现自己的改进过程。

实验开放了三种对手设置:
模型可以自行选择与哪种对手对弈。
Gostev 表示,模型平均大约赢下三分之一的对局,这是可能的,因为它们并非每一局都被要求挑战满强度 Stockfish。
不同模型家族的实现方式有所不同:
两套系统都可以在多局对弈之间使用持久化文件或笔记。
模型可以分析此前对局、写下提醒、调整练习策略,并决定面对何种对手强度。
但它不能将走法选择外包给国际象棋引擎。
Gostev 表示,如果模型使用引擎代其下棋,该次运行将被判定无效;在评论者提出这一可能性后,他还手动检查了 Opus 5.5。

这一限制至关重要。
没有这项限制,测试主要衡量的就会是智能体是否能发现如何调用 Stockfish,而不是它能否通过经验改进自身的国际象棋推理能力。
展示的 Elo 需要谨慎解读。
根据来源页面,基准测试根据模型近期与 Skill 0 和约 1800 分 Stockfish 配置进行的 50 局对弈来估算 Elo。
与满强度 Stockfish 的对局不计入 Elo 计算。
这意味着:
实验 Elo ≠ 正式人类国际象棋等级分
展示的 1760 分并不能证明 Claude Opus 5.5 的表现等同于一名等级分为 1760 的人类锦标赛棋手。
该数值主要作为内部趋势指标才有意义:
这次运行是否会随时间进步?
它是否保持平稳?
它是否在变差?
这已经足以让 Opus 和 Astra 之间的分化变得值得关注。
Claude Opus 5.5 的开局并没有出现戏剧性的上升曲线。
大约前 75 局中,它估算的 Elo 大多在约 1450 至 1550 之间波动。约第 46 局时,分数下降至约 1450。
随后趋势改变了。
来源报告了以下关键节点:
| 运行阶段 | 约 Elo |
|---|---|
| 早期阶段 | 1450–1550 |
| 第 46 局 | 1450 |
| 第 100 局 | 1620 |
| 第 150 局 | 1790 |
| 峰值 | 1840 |
| 约第 194 局 / 最终快照 | 1760 |

这条曲线并不是直线。
Opus 有所进步、出现回落、再次恢复、达到更高峰值,之后又稳定在低于峰值的位置。
这恰恰说明,只看一个最终数字不如观察整条轨迹更有信息量。
实验将与约 1800 分对手进行的对局分为若干阶段。
对于 Opus 5.5,报告的得分率大致如下变化:
30% → 40% → 50% → 34%
最后一段较峰值有所下降,但仍高于起始阶段。
针对 Skill 0,来源称 Opus 从运行早期略高于 50% 的得分率,上升到后期约 90%。

Gostev 自己的解读也随着时间变得更有信心。
最初,他将 Opus 描述为只有小幅正向提升,可能仍属于随机波动。
之后,当模型从约 1500 分提升至约 1750 分时,他称这一结果非常强劲。
提升并不代表规则处理已经完美。
该基准测试还追踪了尝试非法走子的情况。
来源报告称,Opus 共进行了 52 次这类尝试,其中包括 37 次试图让棋子穿过路径上被其他棋子阻挡的位置。
这对 Elo 曲线构成了重要的平衡性信息。
模型可以在总体上变得更有效,同时仍会出现令人惊讶的基础性局部错误。
这是语言模型智能体中反复出现的一种模式:即使单次推理失败仍然可见,整体任务表现仍可能提升。
最重要的缺失信息是内部学习策略。
Gostev 没有公开完整的笔记历史,也没有详细分析 Opus 如何在每局之间改变其练习行为。
因此,实验展示了一个结果:
固定权重
+ 持久化笔记
+ 重复对局
→ 测得的表现提升
但它尚未完整解释其机制。
Opus 是否在学习开局?
是否在记录反复出现的战术错误?
是否在改变对手选择?
是否在改进棋盘表征或走子检查?
在没有完整笔记和受控消融实验的情况下,这些问题仍未得到解答。
Astra 的轨迹几乎完全相反。
它开局表现不错。
约第 29 局时,实验记录到其估算 Elo 为 1810。
随后曲线开始向下移动。
来源报告:
| 运行阶段 | 约 Elo |
|---|---|
| 第 29 局 | 1810 |
| 第 100 局 | 1680 |
| 第 150 局 | 1540 |
| 第 200 局 | 1400 |
面对约 1800 分 Stockfish 时,报告的得分率在四个阶段中下降:
44% → 19% → 17% → 12%
即便对阵 Skill 0,来源也称 Astra 的胜率从运行前半段超过 90%,下降到了后半段约 60%。
该模型与 Opus 一样都可以访问持久化记录。
但积累更多经验并没有带来更好的结果。

实验仪表板显示,Astra 在完成 200 局后,估算 Elo 为 1400。
来源还称,Astra 与满强度 Stockfish 对弈了 68 局,一局未胜。
鉴于现代 Stockfish 的强大实力,这并不令人意外;但这也进一步说明,该基准测试的有效信号主要来自受限强度设置,而非尝试击败最高强度的 Stockfish。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
Gostev 提出了一种可能的解释:上下文管理。
随着笔记和文件在运行过程中不断积累,智能体需要处理更多历史材料。
他认为,Astra 运行所使用的 Codex 配置提供了约 272K 的上下文预算;当累积笔记变得更大、更嘈杂时,性能可能会下降。

这一假设符合一种常见的用户体验:
更多上下文
≠ 自动得到更好的上下文
长历史记录可能包含:
换言之,记忆可能会变成干扰。
来源在这一点上非常谨慎,最终解读也应当如此。
仅凭这一实验,不能将 Astra 的下滑归因于上下文长度。
要建立因果关系,我们需要进行如下受控对比:
相同模型
相同对局
相同工具
相同提示
运行 A:小型 / 强力总结的记忆
运行 B:大型原始记忆
或者:
相同模型
相同学习策略
相同对手安排
运行 A:258K 上下文配置
运行 B:1M 上下文配置
只有这样,才能将上下文大小与其他因素区分开来,例如:
还有一个重要的产品层面澄清。
OpenAI 目前的 API 文档列出 GPT-6 Astra 拥有 1,050,000 token 的上下文窗口。
基准测试截图显示 Astra 运行配置约为 258K,而 Gostev 在 Codex 中提到的数值约为 272K。
因此,这项实验并不是在 Astra 的最大 API 上下文规模下测试它。
这很重要,因为标题层面的正确解读应是:
Astra 在这一特定的持久记忆智能体配置中出现了下滑。
而不是:
Astra 的架构无法处理长上下文。
这是两种截然不同的主张。
Gostev 针对上下文问题新增了另一条测试轨道。
来源称,他宣布进行 GPT-6.1 Sol 的更大上下文配置运行;不久后,基准页面显示了一条约 828K 的专用长上下文测试通道。
在来源文章撰写时,GPT-6.1 Sol 和 Claude Fable 5.1 都只完成了 200 局中的一小部分。
仪表板快照包括:
| 模型 | 来源快照中的对局数 | 约 Elo | 状态 |
|---|---|---|---|
| Claude Opus 5.5 | 200 | 1760 | 已完成 |
| GPT-6 Astra | 200 | 1400 | 已完成 |
| GPT-6.1 Sol | ~50 | ~1490 | 运行中 |
| GPT-6.1 Sol 长上下文 | ~21 | ~1490 | 运行中 |
| Claude Fable 5.1 | 15 | ~1590 | 已暂停 |
这些未完成运行的时间还太短,无法像已完成的 Opus 和 Astra 运行一样支持轨迹分析。
OpenAI 目前正式记录 GPT-6.1 Sol 拥有 1.05M token 的上下文窗口,因此这条长上下文通道是一个值得关注的后续测试——但它仍需要足够多的对局和受控分析,才能回答因果问题。
这是国际象棋实验背后更大的问题。
传统模型训练在部署前结束。
一旦权重固定,模型通常不会在每次对话后永久重写自身。
但还存在另一种适应方式:
上下文内学习。
模型可以读取新信息,将其保留在工作上下文或持久化文件中,并在之后采取不同的行为,而无需修改其参数。
国际象棋基准测试将这一思想推进到大量重复试验之中。
模型可以经历一次失败,写下一些记录,并将这份经验带到之后的对局中。
过程如下:
第 1 局
→ 失败
→ 记录观察结果
第 2 局
→ 阅读先前笔记
→ 尝试不同做法
→ 更新笔记
第 3 局
→ 复用累积经验
→ 继续进行
如果表现会随时间提升,系统就在展现一种实用形式的学习,尽管其神经网络权重保持固定。
Oriol Vinyals 也对该实验发表了评论,并将其描述为一个很有前景的上下文内学习基准。

这种表述很有帮助,因为它避免夸大结果。
该基准测试并没有展示自主的权重更新。
它测试的是模型能否围绕固定权重构建自己的支架:
笔记
+ 文件
+ 重复尝试
+ 自我反思
+ 环境反馈
并利用这个支架进行提升。
Gostev 的原始帖子也做出了相同区分。
他指出,我们仍然没有最严格意义上的真正持续学习,但模型或许能够通过构建外部记忆并从中学习,近似实现其中一部分行为。
来源以乐观的观点收尾:模型或许能够在无需人类重新训练的情况下,通过重复经验变得更强。
这项实验为这种可能性提供了一些证据。
但它没有解决这个问题。
仍存在多项限制。
国际象棋具有结构化、确定性强、反馈清晰的特点。
从重复国际象棋对局中学习,与在模糊的现实世界研究、编程、医疗或商业任务中进步并不相同。
这是实验的一部分,但也让比较变得更困难。
如果 Opus 和 Astra 在不同时间选择了不同对手强度,它们经历的训练序列就并不相同。
展示的 Elo 有助于追踪运行过程,但并不是标准化的人类等级分。
要判断笔记是否导致提升,我们希望看到以下对比:
Opus 在显著提升的同时仍尝试非法走子。
这意味着“变得更好”并不等于对每一项子能力都实现稳定掌握。
持久化笔记本并不会自动带来价值。
Astra 的运行提醒我们,自生成记忆既可能累积有用经验,也可能累积错误。
未来的持续学习智能体可能不仅需要学习该记住什么,还需要学习:
这可能会使记忆管理成为长期运行 AI 智能体最核心的问题之一。
如果两个模型都稳定提升,结论会很简单:持久化笔记有帮助。
如果两个模型都稳定下降,结论同样简单:不受控制的记忆积累有害。
然而,该基准测试产生了两条相反的曲线。

这在科学上更有意思。
它说明,从经验中获益的能力可能不仅仅取决于可用的上下文长度。
模型必须在那个上下文中构建一套有用的学习过程。
一个强大的持久化智能体可能需要擅长以下所有事项:
观察失败
→ 识别正确的教训
→ 紧凑地存储它
→ 在之后检索它
→ 避免对单一事件过拟合
→ 修正错误记忆
→ 在新情境中应用这一教训
这已经比静态聊天机器人更接近一个学习系统——即使模型权重从未改变。
Peter Gostev 让前沿 AI 智能体在不同 Stockfish 难度设置下进行最多 200 局国际象棋对弈,同时在每局之间保留笔记。模型在运行过程中没有进行微调,也不允许使用国际象棋引擎来选择走法。
在该基准测试自身的估算 Elo 指标中,是的:来源报告 Opus 从约 1500 分升至约 1760 分,峰值约为 1840 分。这一数字是基于近期与受限强度 Stockfish 的对局得出的内部实验等级分,不应被视为正式的人类 FIDE 等级分。
该实验没有确定已证实的原因。Gostev 提出,在 Codex 上下文中不断累积笔记可能是影响因素之一,但笔记质量、对手选择、提示漂移、随机方差或其他因素也可能发挥作用。
不是。OpenAI 目前记录 GPT-6 Astra 拥有 1.05M token 的上下文窗口。实验中讨论的约 258K/272K 数值,指的是该次运行所采用的 Codex 或基准测试配置,而不是 Astra 最大的 API 上下文窗口。
是。Anthropic 于 2026 年 9 月 22 日正式推出 Claude Opus 5.5。该公司将其定位为相较于 Opus 5 的重大升级,并将其用于编程和智能体工作负载。
上下文内学习是指模型利用上下文或持久化文件中可获得的信息改变行为,而不更新神经网络权重。在这里,国际象棋对局和笔记构成了累积经验,能够影响之后的对局。
该基准测试使用较弱的 Stockfish 配置,为语言模型提供可测量的表现区间。满强度 Stockfish 远强于当前语言模型的国际象棋水平,因此将这些对局直接纳入实验 Elo 估算,对于追踪提升的参考价值较低。
不能。它表明,至少有一次模型运行在一个结构化任务中,通过持久化上下文和重复经验实现了显著提升。要证明稳健的持续学习,仍需在更多任务、记忆策略、模型配置和重复试验中开展受控实验。
Peter Gostev 的国际象棋实验让 Claude Opus 5.5 和 GPT-6 Astra 在不改变模型权重的前提下,获得反复从自身对局中学习的机会。Opus 的实验 Elo 从约 1500 分升至 1760 分,而 Astra 则早期达到峰值,并在第 200 局时下滑至 1400 分。
这一结果之所以有趣,并不是因为它解决了哪一个模型“更擅长下棋”的问题,而是因为它揭示了关于持久化智能体的更深层问题:模型能否借助笔记、文件和重复反馈构建有用经验;又能否避免让这些记忆变得嘈杂甚至产生主动伤害?
Astra 的下滑原因仍未得到解释。上下文累积是一种合理假设,但在提出因果主张之前,仍需要进行受控的记忆与上下文窗口实验。
这项基准测试最重要的启示是:固定模型权重并不意味着固定行为。智能体记住什么、如何组织记忆、如何从失败中学习,都可能让性能随时间显著上升,或显著下降。
从一句话开始,几分钟内拿到完整网站。