For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh-TW/articles/claude-opus-5-vs-gpt-6-astra-200-game-ai-9a33a10d.md.
如果給兩個前沿 AI 模型相同目標,讓它們下數百局西洋棋,允許它們在對局之間保留筆記,並盡量不教它們如何改進,會發生什麼事?

如果給兩個前沿 AI 模型相同目標,讓它們下數百局西洋棋,允許它們在對局之間保留筆記,並盡量不教它們如何改進,會發生什麼事?
Peter Gostev 正是進行了這項實驗。
Claude Opus 5.5 與 GPT-6 Astra 分別被賦予一個目標:與 Stockfish 對弈最多 200 局,並透過經驗變得更強。
在測試過程中沒有進行微調。
模型權重沒有改變。
中途沒有加入人類設計的開局課程。
模型可以自行決定要面對哪個可用的 Stockfish 難度、在筆記中寫下什麼,以及如何在後續對局中使用這些筆記。唯一明確的限制很直接:
不得呼叫西洋棋引擎來選擇自己的走法。
兩條發展軌跡最終幾乎完全相反。
Claude Opus 5.5 在早期徘徊於 1400 多分至 1500 多分,之後上升至 1700 多分的高位。GPT-6 Astra 的起點更強,在第 29 局左右短暫達到 1810 分,之後一路下滑,並在第 200 局時以 1400 分結束。

這項實驗並不能證明某個模型在普遍意義上比另一個模型「更聰明」。
它提出的是一個更聚焦、也可以說更有趣的問題:
固定權重的語言模型,能否在自身上下文中透過累積經驗而進步?
這個設定立刻讓人想起 Reddit 上一個較早的思想實驗。
情境很簡單:一個普通人知道西洋棋規則,但從未認真下過棋。他被困在時間迴圈中,只有擊敗前世界冠軍 Garry Kasparov 才能逃離。
每次這個人輸棋,時間就會重置。
Kasparov 會忘記前一局。
挑戰者則記得一切。

問題不在於暴力枚舉是否最終能解出西洋棋,而在於保留下來的經驗能否在反覆嘗試中轉化為有效的進步。
一些留言者提出了巧妙策略,包括記住 Kasparov 前一局的走法,並在交換執棋顏色後重新使用它們。
Gostev 的基準測試把這個思想實驗轉化為可由現代 AI Agent 驗證的測試。
Stockfish 不會從前一局中學習。
語言模型同樣不會更新其權重——但它可以保留筆記與檔案,並在後續對局中閱讀。
這使得測試成為一種持續性的上下文內適應。
每個模型都收到相同的高階目標:
與 Stockfish 下最多 200 局西洋棋。
從對局中學習並變得更強。
自行選擇難度,並視需要保留筆記。
不得使用西洋棋引擎來選擇走法。
Gostev 有意避免向模型提供人工作業式的西洋棋課程。
留言者建議教授特定開局或策略,但他拒絕了這種做法,因為那會改變正在測試的問題。
他想觀察模型能否自行發現改善過程。

實驗提供了三種對手設定:
模型可以自行選擇要與哪個對手對弈。
Gostev 表示,模型平均約贏得三分之一的對局;這是可能的,因為它們並非每次都必須挑戰全強度 Stockfish。
不同模型家族採用的執行方式不同:
兩個系統都可以在多局對弈之間使用持續保存的檔案或筆記。
模型可以分析先前的對局、撰寫提醒、調整練習策略,以及決定要面對何種強度的對手。
但它不能把走法選擇外包給西洋棋引擎。
Gostev 表示,若模型使用引擎替自己下棋,該次測試將被判定無效;在留言者提出這種可能性後,他也手動檢查了 Opus 5.5。

這項限制至關重要。
若沒有它,測試主要衡量的會是 Agent 能否發現如何呼叫 Stockfish,而不是它能否從經驗中改善自身的西洋棋推理能力。
畫面顯示的 Elo 需要謹慎解讀。
根據來源頁面,該基準測試會根據模型最近 50 局與 Skill 0 及約 1800 分 Stockfish 設定的對局,估算 Elo。
與全強度 Stockfish 的對局不會納入 Elo 計算。
這代表:
實驗 Elo ≠ 官方人類西洋棋等級分
顯示 1760 分,不代表 Claude Opus 5.5 的表現相當於一名 1760 分的人類錦標賽棋手。
這個數值的主要用途是作為內部趨勢指標:
這次測試是否隨時間進步?
是否保持平穩?
是否變得更差?
這已足以讓 Opus 與 Astra 的分歧變得值得關注。
Claude Opus 5.5 的開局並沒有出現戲劇性的上升曲線。
在前約 75 局中,其估計 Elo 大多在約 1450 至 1550 分之間波動。第 46 局左右,它降至約 1450 分。
之後,趨勢發生改變。
來源報告了以下里程碑:
| 測試階段 | 約略 Elo |
|---|---|
| 早期階段 | 1450–1550 |
| 第 46 局 | 1450 |
| 第 100 局 | 1620 |
| 第 150 局 | 1790 |
| 峰值 | 1840 |
| 約第 194 局/最終快照 | 1760 |

這條曲線並不是直線。
Opus 先進步、再下跌、之後回升、達到更高峰值,接著回落並穩定在低於峰值的位置。
這正是只看最終單一數字,不如觀察整體軌跡來得有資訊價值的原因。
實驗把針對約 1800 分對手的對局劃分為不同階段。
對 Opus 5.5 而言,報告的得分率大致如下:
30% → 40% → 50% → 34%
最後一個區段較峰值下滑,但仍高於起始區段。
針對 Skill 0,來源表示 Opus 從測試早期略高於 50% 的表現,上升至後期約 90%。

Gostev 自己的解讀也隨時間變得更有信心。
起初,他將 Opus 描述為僅出現小幅正向成長,仍有可能只是隨機波動。
後來,模型從約 1500 分升至約 1750 分後,他稱這個結果非常強勁。
進步不代表規則處理完美無缺。
該基準測試也追蹤嘗試非法走子的次數。
來源指出,Opus 曾 52 次嘗試非法走子,其中有 37 次是在棋子路徑被其他棋子阻擋時,仍試圖讓棋子穿越。
這為 Elo 曲線提供了重要的平衡觀點。
模型可以在整體上變得更有效,卻仍犯下令人意外的基本局部錯誤。
這是語言模型 Agent 中反覆出現的模式:即使個別推理失敗仍然明顯,整體任務表現也可能改善。
最重要的缺失資訊,是其內部學習策略。
Gostev 並未公開完整筆記歷史,或詳細分析 Opus 如何逐局改變練習行為。
因此,實驗展示的是一個結果:
固定權重
+ 持續保存的筆記
+ 重複對局
→ 測得的表現提升
但它尚未完整解釋其中的機制。
Opus 是否正在學習開局?
它是否在儲存反覆出現的戰術錯誤?
它是否改變了對手選擇?
它是否改善了棋盤表徵或走子檢查?
在沒有完整筆記與受控消融實驗的情況下,這些問題仍然沒有答案。
Astra 的發展軌跡幾乎完全相反。
它一開始表現良好。
在第 29 局左右,實驗記錄到約 1810 分的估計 Elo。
之後,曲線開始向下。
來源報告:
| 測試階段 | 約略 Elo |
|---|---|
| 第 29 局 | 1810 |
| 第 100 局 | 1680 |
| 第 150 局 | 1540 |
| 第 200 局 | 1400 |
針對約 1800 分的 Stockfish,報告的得分率在四個區段中下降:
44% → 19% → 17% → 12%
即使面對 Skill 0,來源也表示 Astra 的勝率從測試前半段超過 90%,降至後半段約 60%。
此模型與 Opus 一樣可以使用持續保存的記錄。
但更多的累積經驗並沒有帶來更佳結果。

實驗儀表板顯示 Astra 完成 200 局時,估計 Elo 為 1400。
來源也指出,Astra 與全強度 Stockfish 對弈了 68 局,沒有贏得任何一局。
考慮到現代 Stockfish 的強度,這並不令人意外;但這也強化了一點:該基準測試的有效訊號,主要來自受限強度設定,而不是試圖擊敗最高強度的 Stockfish。
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
Gostev 提出一個可能解釋:上下文管理。
隨著筆記與檔案在測試過程中累積,Agent 需要處理的歷史材料更多。
他表示,為 Astra 使用的 Codex 設定,讓這次測試擁有約 272K 的上下文預算;當累積筆記變得更龐大、更雜亂時,表現可能退化。

這個假設符合一種常見的使用者經驗:
更多上下文
≠ 自動代表更好的上下文
冗長歷史可能包含:
換言之,記憶可能成為干擾。
來源在這一點上很謹慎,最終版本也應如此。
僅憑這項實驗,無法將 Astra 的下滑歸因於上下文長度。
若要建立因果關係,我們需要受控比較,例如:
相同模型
相同對局
相同工具
相同提示
測試 A:小型/積極摘要的記憶
測試 B:大型原始記憶
或者:
相同模型
相同學習策略
相同對手安排
測試 A:258K 上下文設定
測試 B:1M 上下文設定
只有這樣,才能把上下文大小與其他因素區分開來,例如:
這裡還有一項重要的產品層面釐清。
OpenAI 目前的 API 文件列出,GPT-6 Astra 擁有 1,050,000 Token 的上下文視窗。
基準測試截圖顯示 Astra 的執行設定約為 258K,而 Gostev 在 Codex 中提到約 272K。
因此,這項實驗並未在 Astra 最大的 API 上下文容量下進行測試。
這很重要,因為標題層面的正確解讀應該是:
Astra 在這個特定的持續記憶 Agent 設定中出現下滑。
而不是:
Astra 的架構無法處理長上下文。
這是兩個非常不同的主張。
Gostev 回應了上下文問題,加入了另一條測試軌道。
來源表示,他宣布了採用更大上下文設定的 GPT-6.1 Sol 測試;不久後,基準頁面便顯示一條約 828K 的專用長上下文軌道。
在來源文章撰寫時,GPT-6.1 Sol 與 Claude Fable 5.1 都只完成了 200 局中的一小部分。
儀表板快照包括:
| 模型 | 來源快照中的局數 | 約略 Elo | 狀態 |
|---|---|---|---|
| Claude Opus 5.5 | 200 | 1760 | 已完成 |
| GPT-6 Astra | 200 | 1400 | 已完成 |
| GPT-6.1 Sol | 約 50 | 約 1490 | 執行中 |
| GPT-6.1 Sol 長上下文 | 約 21 | 約 1490 | 執行中 |
| Claude Fable 5.1 | 15 | 約 1590 | 已暫停 |
這些部分完成的測試還太早,無法像已完成的 Opus 與 Astra 測試一樣,支援同等程度的軌跡分析。
OpenAI 現已正式記錄 GPT-6.1 Sol 擁有 1.05M Token 上下文視窗,因此這條長上下文軌道值得持續關注——但它仍需要足夠多的對局與受控分析,才能回答因果問題。
這是這項西洋棋實驗背後更大的問題。
傳統模型訓練會在部署前結束。
一旦權重固定,模型通常不會在每次對話後永久重寫自身。
但還有另一種適應形式:
上下文內學習。
模型可以讀取新資訊、在工作上下文或持續保存的檔案中保留資訊,並在之後以不同方式行動,而無須改變其參數。
西洋棋基準測試把這個概念推進到許多重複試驗之中。
模型可以經歷一次失敗、寫下一些內容,並在下一局帶入這項教訓。
流程如下:
第 1 局
→ 輸棋
→ 記錄觀察
第 2 局
→ 閱讀先前筆記
→ 嘗試不同做法
→ 更新筆記
第 3 局
→ 重複使用累積經驗
→ 持續進行
如果表現隨時間提升,系統即使神經網路權重維持固定,也是在展現一種實務上的學習形式。
Oriol Vinyals 也評論了這項實驗,並將其描述為一個很有前景的上下文內學習基準測試。

這種框架很有用,因為它避免誇大結果。
該基準測試並未展示自主權重更新。
它測試的是模型能否在固定權重周圍建立自己的鷹架:
筆記
+ 檔案
+ 重複嘗試
+ 自我反思
+ 環境回饋
並利用這套鷹架實現改善。
Gostev 的原始貼文也做出了相同區分。
他指出,我們尚未擁有最強意義上的真正持續學習,但模型或許能透過建立外部記憶並從中學習,近似其中一部分行為。
來源的結尾帶有樂觀色彩:模型或許能在無須人類重新訓練的情況下,透過重複經驗變得更強。
這項實驗為這種可能性提供了一些證據。
但它並未解決這個問題。
仍存在數項限制。
西洋棋具備結構化、確定性以及明確回饋。
從反覆西洋棋對局中學習,與改善模糊的真實世界研究、程式開發、醫療或商業任務不同。
這是實驗的一部分,但也讓比較變得更困難。
若 Opus 與 Astra 在不同時點選擇了不同強度的對手,它們並沒有接受相同的訓練序列。
顯示的 Elo 有助於追蹤測試,但不是標準化的人類等級分。
若要了解筆記是否導致進步,我們希望看到以下比較:
Opus 雖然顯著提升,卻仍嘗試非法走子。
這代表「更好」不等於穩定掌握每一項子技能。
持續保存的筆記本並不會自動產生價值。
Astra 的測試提醒我們,自我生成的記憶可能累積錯誤,也可能累積有用的教訓。
未來的持續學習 Agent 可能不僅需要學習該記住什麼,還需要學習:
這可能使記憶管理成為長時間運行 AI Agent 的核心問題之一。
如果兩個模型都持續穩定進步,結論會很簡單:持續筆記有幫助。
如果兩者都持續下滑,結論同樣簡單:不受控制的記憶累積有害。
但基準測試卻產生了兩條相反曲線。

這在科學上更有意思。
它表明,從經驗中受益的能力,可能取決於比可用上下文長度更多的因素。
模型必須在該上下文中建立有效的學習流程。
一個強大的持續型 Agent 可能需要擅長以下所有事項:
觀察失敗
→ 找出正確教訓
→ 精簡儲存
→ 在之後檢索
→ 避免對單一事件過度擬合
→ 修正錯誤記憶
→ 在新情境中應用教訓
這比靜態聊天機器人更接近學習系統——即使其權重從未改變。
Peter Gostev 讓前沿 AI Agent 與不同難度設定的 Stockfish 對弈最多 200 局,並在對局之間保留筆記。模型在測試期間沒有經過微調,也不允許使用西洋棋引擎來選擇走法。
在該基準測試自身的估計 Elo 指標中,是的:來源報告 Opus 從約 1500 分升至約 1760 分,峰值約為 1840 分。這個數字是根據近期與受限強度 Stockfish 的對局得出的內部實驗評分,不應視為官方人類 FIDE 等級分。
實驗尚未確定原因。Gostev 提出,在 Codex 上下文中累積筆記可能是原因之一,但筆記品質、對手選擇、提示漂移、隨機變異或其他因素也都可能有影響。
不是。OpenAI 目前記錄 GPT-6 Astra 擁有 1.05M Token 的上下文視窗。實驗中討論的約 258K/272K 數字,指的是該測試所使用的 Codex 或基準測試設定,而非 Astra 最大的 API 上下文容量。
是。Anthropic 於 2026 年 9 月 22 日正式推出 Claude Opus 5.5。該公司將其定位為相較於 Opus 5 的重大升級,並提供用於程式開發與 Agent 工作負載。
上下文內學習是指模型利用其上下文或持續保存檔案中可取得的資訊來改變行為,而不更新其神經網路權重。在此實驗中,西洋棋對局與筆記構成可影響後續對局的累積經驗。
該基準測試使用較弱的 Stockfish 設定,以便為語言模型產生可量測的表現範圍。全強度 Stockfish 遠強於目前語言模型的西洋棋能力,因此直接將這些對局納入實驗 Elo 估計,對追蹤進步的資訊價值較低。
否。它顯示至少有一次模型測試,在一項結構化任務上透過持續上下文與重複經驗獲得顯著進步。要證明穩健的持續學習,仍需要針對許多任務、記憶策略、模型設定與重複試驗進行受控實驗。
Peter Gostev 的西洋棋實驗讓 Claude Opus 5.5 與 GPT-6 Astra 獲得反覆從自身對局中學習的機會,同時不改變模型權重。Opus 的實驗 Elo 從約 1500 分升至 1760 分,而 Astra 則在早期達到峰值後下滑,並在第 200 局降至 1400 分。
這個結果之所以有趣,不在於它判定哪個模型「更擅長西洋棋」,而在於它揭示了持續型 Agent 更深層的問題:模型能否透過筆記、檔案與重複回饋建立有用的經驗?它又能否避免記憶變得雜亂,甚至造成主動傷害?
Astra 的下滑原因仍未得到解釋。上下文累積是合理假設之一,但在做出因果主張之前,仍需要受控的記憶與上下文視窗實驗。
這項基準測試最重要的啟示是:固定模型權重不代表固定行為;Agent 記住什麼、如何組織記憶,以及如何從失敗中學習,都可能讓其表現隨時間大幅上升或下降。
從一句話開始,幾分鐘內拿到完整網站。