For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh-TW/articles/claude-sonnet-5-closes-in-on-opus-5-70-6-b02eab8e.md.
Claude Sonnet 5.5 在 Terminal-Bench 4.0 上达到 70.6%,在 GDPval-AA 和 OSWorld 上几乎追平 Opus 5.5,同时维持 Sonnet 每百万输入代币 2 美元、每百万输出代币 10 美元的定价。Anthropic 表示...

Anthropic 表示,Claude Sonnet 5.5 和 Haiku 5.5 将在 Opus 5.5 之后“未来几周内”推出。
Sonnet 5.5 仅六天后便正式发布。
这款全新的中端 Claude 模型并不只是 Opus 5.5 的缩小版。在一些编码基准测试中,它的得分实际上更高。
最引人注目的例子是 Terminal-Bench 4.0:
Claude Sonnet 5.5:70.6%
Claude Opus 5.5: 66.4%
Claude Sonnet 5: 10.3%
不过,在更广泛的专业工作中,Opus 5.5 仍保持着微弱领先。
Anthropic 公布的数据如下:
GDPval-AA v2.1
Opus 5.5: 1846 Elo
Sonnet 5.5:1844 Elo
OSWorld 2.1
Opus 5.5: 81.8%
Sonnet 5.5:80.1%

这意味着,在多个可量化任务上,Sonnet 5.5 与 Anthropic 的旗舰模型之间的差距已经异常接近,同时仍保持更低的 Sonnet 价格档位。
但两款模型之间的区别仍然很重要。
Anthropic 表示,对于需要长时间持续判断的复杂、开放式工作,Opus 5.5 仍然明显更强。Sonnet 5.5 则更直接地面向范围明确的日常工作,例如:
因此,真正有用的结论并不是 Sonnet 5.5 已经“取代”了 Opus。
更准确的说法是,对于许多日常工作和以编码为主的工作负载,两者之间的性能差距已经大幅缩小。

原文将 Sonnet 5.5 描述为追赶“大杯”的“中杯”。
这个比喻与基准测试表呈现出的结果 surprisingly 相符。
| 评测项目 | Sonnet 5.5 | Opus 5.5 | Sonnet 5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% | 10.3% | — |
| FrontierCode 1.1 Main | Xhigh 下 52.1% | 54.4% | 42.4% | 最高 52.1% |
| CursorBench 4.0 | 55.5% | 57.8% | 34.1% | — |
| GDPval-AA v2.1 | 1844 | 1846 | 1449 | 1487 |
| Humanity's Last Exam | 64.5% | 67.7% | 54.9% | — |
| OSWorld 2.1 | 80.1% | 81.8% | 57.0% | — |
| Chartography | 61.6% | 64.4% | 15.6% | 53.6% |
这张表展示了真正的趋势。
Sonnet 5.5 在一项重要的编码基准测试中直接胜出,在其他几项测试中也非常接近,但并没有全面击败 Opus 5.5。
Anthropic 自己也做出了相同区分:基准测试得分只是衡量模型质量的一个角度。当任务模糊、开放,或需要更长时间的持续判断时,Opus 仍然更强。
这次升级并不只是原始得分的提升。
早期测试人员还注意到,Sonnet 5.5 改变了自己的工作方式。
与 Sonnet 5 相比,当任务可以并行运行时,该模型更愿意批量发起工具调用,而不是将所有操作拆成一个接一个的步骤。
Anthropic 分享的客户反馈中,有一项编码评测显示,Sonnet 5.5 完成同类任务时使用了:
约少 1/3 的工具调用
约少一半的 Shell 运行次数
这对智能体系统非常重要,因为每一次额外的工具调用都可能带来:
即使模型的公开代币价格没有变化,如果一个模型能够通过更少的工具交互得出相同答案,其实际成本也可能明显更低。
Base44 在 118 项真实应用构建任务上测试了 Sonnet 5.5。
其结果尤其具有实际参考价值。
Base44 报告称,Sonnet 5.5 生成的应用得分与 Opus 5 相当,但平均每次构建所需的迭代次数为:
Sonnet 5.5:
平均每次构建 3.6 次迭代
Opus 5:
平均每次构建 7.7 次迭代
Base44 还表示,在对比的所有模型中,Sonnet 5.5 的工具调用失败次数最少。

这提醒我们,“模型成本”并不只是:
输入代币价格
+
输出代币价格
对于真实的智能体工作流,总成本还取决于:
迭代次数
工具调用次数
失败操作
重试次数
人工中断次数
达到可接受结果所需的时间
如果一个模型只需一半的迭代次数就能完成任务,那么实际成本差异可能远大于 API 价格表所显示的差异。
Epic Games 在规模大得多的软件系统上测试了 Sonnet 5.5。
根据 Anthropic 发布的客户反馈,该模型在处理数万行游戏系统代码时,能够完成以下类型的任务:
Epic Games 表示,该模型达到了通常由更高档模型才能达到的质量标准,同时所需的提示词约束更少。
这正是较小模型能够体现价值的工作负载。
开发者可能仍希望使用 Opus 5.5 来确定架构或解决最困难的模糊问题,但 Sonnet 5.5 可以以更低成本承担更多实现和审查工作。
Unity 采用了更严格的完成标准。
它没有因为模型声称代码补丁已经完成就直接接受结果,而是重新打开项目,并检查最终结果是否能够在运行时正常工作。
在这项评测中,Sonnet 5.5 在 Unity 的多步骤编辑器与编码基准测试中完成了:
90%
的任务。

这类测试比单纯的代码生成质量更有参考价值。
一个补丁看起来正确,但仍可能因为以下原因失败:
Unity 的基准测试试图衡量实际的端到端任务,而不仅仅是文本答案。
Anthropic 还继续开展了其长期运行的演示之一。
Sonnet 5.5 成为 Claude 家族中首个仅凭截图操作并击败 **《宝可梦 红》**的 Sonnet 模型。
这项测试并不是直接意义上的编码基准测试。
它的价值在于其他方面。
这款游戏要求模型能够:
这些特性同样适用于计算机使用智能体和长期运行的软件工作流。
原文指出,Sonnet 5.5 的能力提升并不局限于代码。
Anthropic 也在将其定位为适用于高质量文档、幻灯片、电子表格和视觉工作的模型。
该模型能够遵循既有的视觉规范,而不是每次都从零开始创建所有产物。
例如,在提供现有幻灯片模板的情况下,它可以继续沿用相同的:
Anthropic 表示,这能够减少生成后所需的人工清理工作。
这使 Sonnet 5.5 尤其适合这样的企业工作流:任务范围明确,但仍然需要保持视觉一致性。
尽管性能大幅提升,Sonnet 5.5 仍然沿用与 Sonnet 5 相同的核心 API 定价。
Anthropic 当前列出的价格如下:
| 代币类型 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 输入 | 每 1M 个代币 2 美元 | 每 1M 个代币 4 美元 |
| 输出 | 每 1M 个代币 10 美元 | 每 1M 个代币 20 美元 |
| 缓存读取 | 每 1M 个代币 0.20 美元 | 每 1M 个代币 0.20 美元 |
| 缓存写入 | 每 1M 个代币 2.50 美元 | 每 1M 个代币 5 美元 |

从标价来看,Sonnet 5.5 的标准输入和输出代币价格正好是 Opus 5.5 的一半。
但 Anthropic 现在更加重视另一个指标:
每项已完成任务的成本。
Anthropic 表示,Sonnet 5.5 的输出生成速度比 Sonnet 5 快 30% 以上。
Anthropic 还表示,与完成相同工作相比,该模型通常需要更少的代币和更少的步骤。
因此,Anthropic 报告称,对于大多数工作负载,Sonnet 5.5 的成本可以比 Sonnet 5:
每项任务最高低 30%
这就是为什么只关注每百万输入代币 2 美元、每百万输出代币 10 美元的价格,会忽略此次升级的一部分价值。
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
名义价格保持不变。
但完成一项任务所需的模型工作量下降了。
Anthropic 现在提供多个推理强度级别。
更高的推理强度允许模型花费更长时间进行推理,并检查更多工作。
较低的推理强度则会让模型更快、更便宜。
在 Claude Code 和 Anthropic 的消费者应用中,默认推理强度为中等。在 Claude Platform 上,默认值为高。
在 Terminal-Bench 4.0 中,Anthropic 的成本性能图显示,Sonnet 5.5 在中等推理强度下,已经超过 Sonnet 5 的最佳结果,而每次尝试的成本约为后者的十分之一。

重要的结论并不是中等推理强度永远是正确设置。
而是开发者现在可以更加直接地调节质量与成本。
对于常规编码任务,较低的推理强度可能已经足够。
对于困难任务,提高推理强度可以让 Sonnet 获得更多推理时间。
CursorBench 4.0 根据真实的 Cursor 会话评估编码工作。
Sonnet 5.5 达到:
55.5%
而 Opus 5.5 为:
57.8%
Anthropic 的成本图表显示,即使在相对较低的推理强度下,Sonnet 5.5 也能以每项任务约十分之一的成本,超过 Sonnet 5 的最高得分。

这正是新款 Sonnet 特别具有吸引力的地方。
与 Opus 的绝对基准差距可能足够小,以至于对于高频编码任务,成本更低的模型往往是更好的生产选择。
原文特别关注 FrontierCode 1.1,因为这项对比包含 GPT-6 Sol。
Anthropic 发布的图表显示,Sonnet 5.5 在 Xhigh 推理强度下取得 FrontierCode 的最佳成绩,而 GPT-6 Sol 在不同推理强度设置下的得分处于相近范围。

在高推理强度下,Sonnet 5.5 已经处于 GPT-6 Sol 较强测试设置的得分范围附近,而 Anthropic 估计其每项任务的成本明显更低。
原文将差距概括为:在 Anthropic 图表所突出显示的可比点上,
Sonnet 5.5 的任务成本:
约为 GPT-6 Sol 的 1/5
这个数字应被理解为特定基准测试中的每项任务成本对比,而不是普遍适用的 API 定价比例。
这些模型:
因此,更稳妥的说法是:在该测试设置中,Anthropic 的基准测试图表显示,Sonnet 5.5 以明显更低的测量任务成本,达到了相近的 FrontierCode 质量。
这并不意味着 Sonnet 的每项工作负载都一定比 GPT-6 Sol 便宜 80%。
基准测试的头条结果很容易让人得出这样的结论:更便宜的 Sonnet 模型已经让 Opus 变得没有必要。
Anthropic 明确否定了这种解读。
Anthropic 自己的测试和客户反馈仍然显示,在以下工作中,Opus 5.5 明显更强:
因此,实际的模型路由策略更接近于:
Opus 5.5
→ 架构设计
→ 困难规划
→ 模糊研究
→ 最高复杂度任务
Sonnet 5.5
→ 实现
→ 修复漏洞
→ 审查
→ 常规智能体任务
→ 文档和办公工作
→ 高频编码
Anthropic 的一位客户以类似方式描述了两者的关系:让 Opus 定义架构,再让 Sonnet 负责实现。
这可能是理解 5.5 家族最有用的方式。
原文主要关注性能和成本,但有一项官方信息值得注意。
Anthropic 表示,Sonnet 5.5 的网络安全能力提升幅度足够大,因此它成为 首个在发布时采用类似 Anthropic 最强模型安全防护和回退机制的 Sonnet 模型。
Anthropic 还表示,这些安全防护针对的是一小部分高风险请求,并不以干扰常规软件开发为目的。
这一点很重要,因为更强的编码和工具使用性能,也可能提升双重用途的网络安全能力。
Anthropic 表示,Sonnet 5.5 可通过以下平台使用:
API 模型 ID 为:
claude-sonnet-5-5
Anthropic 还支持在符合条件的 API 配置中为 Sonnet 5.5 提供零数据保留。
对于从 Sonnet 5 迁移的团队,Anthropic 建议重新审视新的推理强度控制,并重新考虑配置,而不是假设旧的运行时设置都应原样复制。
原文最后展望了 Claude 5.5 家族的下一位成员。
Anthropic 表示,Haiku 5.5 将在未来几周内推出。
它的定位已经很明确:
高吞吐量
+
对成本敏感的工作负载
如果说 Sonnet 5.5 是快速的通用型工作主力,Opus 5.5 是处理困难开放式判断的模型,那么 Haiku 5.5 预计将进一步推动高频部署的经济性。
Claude 5.5 家族的发展方向正在变得清晰。
Anthropic 不仅是在原始基准测试得分上展开竞争。
它越来越多地围绕以下维度来呈现模型:
质量
+
速度
+
每项已完成任务的成本
对于开发者而言,这可能是比单独查看基准测试得分更有用的部署指标。
Claude Sonnet 5.5 是 Anthropic 最新的 Sonnet 模型,也是 Claude 5.5 家族的第二款产品。它被设计为 Opus 5.5 的更快速、更低成本补充,适用于编码、智能体、知识工作、文档、幻灯片以及其他范围明确的任务。
在部分基准测试中是的。Sonnet 5.5 在 Terminal-Bench 4.0 上的得分为 70.6%,而 Opus 5.5 为 66.4%;但 Opus 在大多数更广泛的评测中仍然领先,并且在需要持续判断的复杂开放式工作中更强。
Anthropic 列出的标准 API 价格为每百万输入代币 2 美元、每百万输出代币 10 美元。缓存读取费用为每百万代币 0.20 美元,缓存写入费用为每百万代币 2.50 美元。
两者的代币价格相同,但 Anthropic 表示,Sonnet 5.5 通常使用更少的代币,并且能够更高效地完成工作。根据其测试,在许多工作负载中,每项任务的成本最多可降低 30%。
Anthropic 表示,其输出生成速度比 Sonnet 5 快 30% 以上。外部测试人员还报告称,在许多编码任务中,它需要更少的工具调用、更少的 Shell 运行次数和更少的迭代次数。
Anthropic 的 FrontierCode 成本性能图表显示,在该基准测试中,Sonnet 5.5 以明显更低的测量任务成本,达到了与经过测试的 GPT-6 Sol 设置相近的质量范围。这并不是普遍适用的成本比例,也不应被解读为 Sonnet 在所有编码或推理工作负载中都更强。
官方 Claude API 模型 ID 为:
claude-sonnet-5-5
Anthropic 表示,该模型也可通过 AWS、Google Cloud 和 Microsoft Foundry 使用。
Anthropic 表示,Haiku 5.5 将在未来几周内推出。它的定位是面向高吞吐量和对成本敏感的应用。
claude-sonnet-5-5 集成到应用中的官方 API 文档。Claude Sonnet 5.5 缩小了 Anthropic 中端模型与旗舰模型之间的差距,其幅度比名称所暗示的更加明显。它在 Terminal-Bench 4.0 上击败 Opus 5.5,在 GDPval-AA 上仅相差 2 个 Elo 分,在 OSWorld 和 CursorBench 上也几乎追平 Opus。
更大的部署价值在于效率。Sonnet 5.5 保持与 Sonnet 5 相同的每百万代币 2 美元输入、10 美元输出定价,但 Anthropic 表示,其运行速度快 30% 以上,并且每项已完成任务的成本最高可降低 30%。外部测试人员还报告称,它需要更少的工具调用、更少的 Shell 运行次数和明显更少的迭代次数。
对于需要持续判断的困难开放式工作,Opus 5.5 仍然是更强的选择。更准确地说,Sonnet 5.5 是一款面向高频使用的工作主力,如今在越来越多范围明确的任务中达到了旗舰级质量。
Sonnet 5.5 最重要的升级并不是赢下一项基准测试,而是在保持 Sonnet 级别价格并显著降低每项已完成任务成本的同时,越来越接近旗舰模型的质量。
從一句話開始,幾分鐘內拿到完整網站。