For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/claude-sonnet-5-closes-in-on-opus-5-70-6-b02eab8e.md.
Claude Sonnet 5.5 在 Terminal-Bench 4.0 上达到 70.6%,在 GDPval-AA 和 OSWorld 上也几乎追平 Opus 5.5,同时维持每百万输入令牌 2 美元、每百万输出令牌 10 美元的 Sonnet 定价。Anthropic 表...

Anthropic 表示,Claude Sonnet 5.5 和 Haiku 5.5 将在 Opus 5.5 发布后的“未来几周内”推出。
Sonnet 5.5 仅在六天后就正式发布了。
这款全新的中端 Claude 模型并不只是 Opus 5.5 的缩小版。在一些编码基准测试中,它的得分实际上更高。
最引人注目的例子是 Terminal-Bench 4.0:
Claude Sonnet 5.5:70.6%
Claude Opus 5.5: 66.4%
Claude Sonnet 5: 10.3%
不过,在更广泛的专业工作中,Opus 5.5 仍保持着微弱领先。
Anthropic 公布的数据如下:
GDPval-AA v2.1
Opus 5.5: 1846 Elo
Sonnet 5.5:1844 Elo
OSWorld 2.1
Opus 5.5: 81.8%
Sonnet 5.5:80.1%

这意味着,在多项可量化任务上,Sonnet 5.5 与 Anthropic 的旗舰模型之间的差距异常接近,同时仍保持较低的 Sonnet 价格档位。
但两款模型之间的区别仍然重要。
Anthropic 表示,对于需要在较长时间内持续进行判断的复杂、开放式工作,Opus 5.5 仍然明显更强。Sonnet 5.5 则更直接地面向范围明确的日常工作,例如:
因此,有用的结论并不是 Sonnet 5.5 已经“取代”了 Opus。
更准确的说法是,对于许多常规工作负载和编码密集型工作负载,两者之间的性能差距已经大幅缩小。

原文将 Sonnet 5.5 描述为追赶“大杯”的“中杯”。
这个比喻与基准测试表格呈现的结果出人意料地吻合。
| 评测项目 | Sonnet 5.5 | Opus 5.5 | Sonnet 5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% | 10.3% | — |
| FrontierCode 1.1 Main | Xhigh 下 52.1% | 54.4% | 42.4% | 最高 52.1% |
| CursorBench 4.0 | 55.5% | 57.8% | 34.1% | — |
| GDPval-AA v2.1 | 1844 | 1846 | 1449 | 1487 |
| Humanity's Last Exam | 64.5% | 67.7% | 54.9% | — |
| OSWorld 2.1 | 80.1% | 81.8% | 57.0% | — |
| Chartography | 61.6% | 64.4% | 15.6% | 53.6% |
这张表展示了真正的趋势。
Sonnet 5.5 在一项重要的编码基准测试中直接胜出,在其他几项测试中也非常接近,但并没有全面击败 Opus 5.5。
Anthropic 自己也强调了同样的区别:基准测试得分只是衡量模型质量的一个角度。当任务模糊、开放式,或需要更长时间持续判断时,Opus 仍然更强。
这次升级并不只是原始得分的提升。
早期测试者还注意到,Sonnet 5.5 的工作方式发生了变化。
与 Sonnet 5 相比,当任务可以并行运行时,该模型更愿意批量处理工具调用,而不是逐个动作地处理所有操作。
Anthropic 引用的客户反馈中,有一项编码评测显示,Sonnet 5.5 使用了:
约少 1/3 的工具调用
约少一半的 Shell 运行次数
就完成了同类型的任务。
这对智能体系统很重要,因为每一次额外的工具调用都可能增加:
即使模型的标称令牌价格没有变化,一个通过更少工具交互就能得到相同答案的模型,也可能明显更便宜。
Base44 在 118 个真实应用构建任务上测试了 Sonnet 5.5。
其测试结果尤其具有实践意义。
Base44 报告称,Sonnet 5.5 生成的应用得分与 Opus 5 相同,但平均每次构建所需的迭代次数更少:
Sonnet 5.5:
每次构建平均 3.6 次迭代
Opus 5:
每次构建平均 7.7 次迭代
Base44 还表示,在对比中的所有模型里,Sonnet 5.5 的工具调用失败次数最少。

这提醒我们,“模型成本”并不只是:
输入令牌价格
+
输出令牌价格
对于真实的智能体工作流,总成本还取决于:
迭代次数
工具调用次数
失败操作次数
重试次数
人工中断次数
达到可接受结果所需的时间
如果一个模型只需要一半的迭代次数就能完成任务,那么实际成本差异可能远大于 API 价格表显示的差异。
Epic Games 在规模更大的软件系统上测试了 Sonnet 5.5。
根据 Anthropic 发布的客户反馈,该模型在处理数万行游戏系统代码时表现良好,涉及的任务包括:
Epic Games 表示,该模型达到了通常由更高档模型才能达到的质量标准,同时所需的提示词约束更少。
这正是较小模型能够发挥价值的工作类型。
开发者可能仍然希望使用 Opus 5.5 来定义架构或解决最困难的模糊问题,但 Sonnet 5.5 可以以更低成本承担更多实现和审查工作。
Unity 采用了更严格的完成标准。
Unity 不会因为模型声称任务已完成就直接接受代码补丁,而是会重新打开项目,并检查最终结果是否能够在运行时正常工作。
在这项评测中,Sonnet 5.5 在 Unity 的多步骤编辑器和编码基准测试中完成了:
90%
的任务。

这类测试比单纯评估代码生成质量更有参考价值。
一个代码补丁看起来可能是正确的,但仍可能因为以下原因失败:
Unity 的基准测试试图衡量真正的端到端任务,而不只是文本答案。
Anthropic 还延续了其一项常见的长时程演示。
Sonnet 5.5 成为 Claude 家族中首个仅凭截图操作并击败 **《宝可梦 红》**的 Sonnet 模型。
这项测试并不是直接用于衡量编码能力的基准测试。
它的价值在于其他方面。
游戏要求模型能够:
这些特性同样适用于计算机使用智能体和长期运行的软件工作流。
原文指出,Sonnet 5.5 的能力提升并不只体现在代码方面。
Anthropic 也在将它定位为适用于高质量文档、幻灯片、电子表格和视觉工作的模型。
该模型的设计目标是遵循已有的视觉规范,而不是每次都从头创建所有内容。
例如,在给定一个已有的幻灯片模板后,它可以继续沿用相同的:
Anthropic 表示,这可以减少生成后所需的人工清理工作量。
这使 Sonnet 5.5 特别适合这样的商业工作流:任务范围明确,但仍然需要保持视觉一致性。
尽管性能大幅提升,Sonnet 5.5 仍维持与 Sonnet 5 相同的核心 API 定价。
Anthropic 当前列出的价格如下:
| 令牌类型 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 输入 | 2 美元 / 100 万 | 4 美元 / 100 万 |
| 输出 | 10 美元 / 100 万 | 20 美元 / 100 万 |
| 缓存读取 | 0.20 美元 / 100 万 | 0.20 美元 / 100 万 |
| 缓存写入 | 2.50 美元 / 100 万 | 5 美元 / 100 万 |

按照标价计算,Sonnet 5.5 的标准输入和输出令牌价格恰好是 Opus 5.5 的一半。
但 Anthropic 现在更加强调另一个指标:
每项已完成任务的成本。
Anthropic 表示,Sonnet 5.5 的输出生成速度比 Sonnet 5 快 30% 以上。
Anthropic 还表示,该模型通常需要更少的令牌和更少的步骤来完成同一项工作。
因此,Anthropic 报告称,对于大多数工作负载,Sonnet 5.5 的成本可能比 Sonnet 5:
每项任务最高低 30%
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
这也是为什么只关注 2 美元 / 10 美元的令牌价格,会忽略这次升级的一部分价值。
名义价格保持不变。
但完成一项任务所需的模型工作量减少了。
Anthropic 现在提供多个努力程度等级。
更高的努力程度允许模型进行更长时间的推理,并检查更多工作。
较低的努力程度则能让模型运行得更快、成本更低。
在 Claude Code 和 Anthropic 的消费者应用中,默认努力程度为中等。在 Claude Platform 上,默认值为高。
在 Terminal-Bench 4.0 上,Anthropic 的成本与性能图表显示,Sonnet 5.5 在中等努力程度下,已经超过 Sonnet 5 的最佳结果,而每次尝试的成本大约只有后者的十分之一。

重要结论并不是中等努力程度始终是正确设置。
而是开发者现在可以更直接地调节质量与成本。
对于常规编码,较低的努力程度可能已经足够。
对于困难任务,提高努力程度可以给 Sonnet 更多推理时间。
CursorBench 4.0 根据真实的 Cursor 会话评估编码工作。
Sonnet 5.5 达到:
55.5%
而 Opus 5.5 为:
57.8%
Anthropic 的成本图表显示,即使在相对较低的努力程度下,Sonnet 5.5 也能以每项任务约十分之一的成本,超过 Sonnet 5 的最高得分。

这正是新 Sonnet 特别具有吸引力的地方。
它与 Opus 之间的绝对基准测试差距可能足够小,因此对于高频编码来说,成本更低的模型往往是更好的生产选择。
原文特别关注 FrontierCode 1.1,因为这项对比包含 GPT-6 Sol。
Anthropic 发布的图表显示,Sonnet 5.5 在 Xhigh 努力程度下取得了最佳 FrontierCode 得分,而 GPT-6 Sol 在不同努力程度设置下的得分处于相近范围。

在高努力程度下,Sonnet 5.5 的得分已经接近 GPT-6 Sol 经过测试的较高设置,同时 Anthropic 估计其每项任务的成本明显更低。
原文将差距概括为:在 Anthropic 图表强调的可比节点上:
Sonnet 5.5 的任务成本:
约为 GPT-6 Sol 的 1/5
这个数字应当理解为特定基准测试中的每项任务成本对比,而不是普遍适用的 API 定价比例。
这些模型:
因此,更稳妥的说法是:在这一设置下,Anthropic 的基准测试图表显示,Sonnet 5.5 能够以明显更低的测量任务成本达到相近的 FrontierCode 质量。
这并不意味着所有 Sonnet 工作负载的成本都一定比 GPT-6 Sol 低 80%。
这些基准测试的头条结果很容易让人得出这样的结论:更便宜的 Sonnet 模型已经让 Opus 变得没有必要。
Anthropic 明确否定了这种解读。
Anthropic 自己的测试和客户反馈仍然显示,在需要以下能力的工作中,Opus 5.5 明显更强:
因此,实际的模型路由策略更接近于:
Opus 5.5
→ 架构设计
→ 困难规划
→ 模糊研究
→ 复杂度最高的任务
Sonnet 5.5
→ 实现
→ 修复错误
→ 审查
→ 常规智能体任务
→ 文档和办公工作
→ 高频编码
Anthropic 的一位客户以类似方式描述了两者的关系:让 Opus 定义架构,再让 Sonnet 负责实现。
这可能是理解 5.5 家族最有用的方式。
原文主要关注性能和成本,但有一项官方信息值得注意。
Anthropic 表示,Sonnet 5.5 的网络安全能力提升明显,因此它是首个在发布时配备与 Anthropic 最强模型类似的网络安全防护和回退机制的 Sonnet 模型。
Anthropic 还表示,这些防护针对的是一小部分高风险请求,并不打算干扰常规软件开发。
这一点很重要,因为更强的编码和工具使用能力也可能提升双重用途的安全能力。
Anthropic 表示,Sonnet 5.5 可通过以下平台使用:
API 模型 ID 为:
claude-sonnet-5-5
Anthropic 还在符合条件的 API 配置中支持 Sonnet 5.5 的零数据保留。
对于从 Sonnet 5 迁移的团队,Anthropic 建议重新检查新的努力程度控制,并重新考虑配置,而不是假设所有旧的运行时设置都应原样复制。
原文最后展望了 Claude 5.5 家族的下一位成员。
Anthropic 表示,Haiku 5.5 将在未来几周内推出。
它的定位已经比较明确:
高吞吐量
+
对成本敏感的工作负载
如果说 Sonnet 5.5 是快速的通用工作主力,Opus 5.5 是处理困难开放式判断的模型,那么 Haiku 5.5 预计将进一步聚焦于大规模部署的经济性。
Claude 5.5 家族的发展方向正在变得清晰。
Anthropic 关注的并不只是原始基准测试得分。
它越来越倾向于围绕以下维度来呈现模型:
质量
+
速度
+
每项已完成任务的成本
对于开发者而言,这可能是比单独的基准测试得分更有用的部署指标。
Claude Sonnet 5.5 是 Anthropic 最新的 Sonnet 模型,也是 Claude 5.5 家族的第二款产品。它被设计为 Opus 5.5 的更快速、成本更低的补充模型,适用于编码、智能体、知识工作、文档、幻灯片和其他范围明确的任务。
在一些基准测试中是的。Sonnet 5.5 在 Terminal-Bench 4.0 上的得分为 70.6%,而 Opus 5.5 为 66.4%;但 Opus 在大多数更广泛的评测中仍然领先,并且在需要持续判断的复杂开放式工作中依旧更强。
Anthropic 公布的标准 API 价格为每百万输入令牌 2 美元、每百万输出令牌 10 美元。缓存读取费用为每百万令牌 0.20 美元,缓存写入费用为每百万令牌 2.50 美元。
两者的令牌价格相同,但 Anthropic 表示,Sonnet 5.5 通常使用更少的令牌,并且能够更高效地完成工作。根据其测试,在许多工作负载中,这可以使每项任务的成本最高降低 30%。
Anthropic 表示,Sonnet 5.5 的输出生成速度比 Sonnet 5 快 30% 以上。外部测试者还报告称,在许多编码任务中,它需要更少的工具调用、更少的 Shell 运行次数和更少的迭代次数。
Anthropic 的 FrontierCode 成本与性能图表显示,在该基准测试中,Sonnet 5.5 以明显更低的测量任务成本,达到了与经过测试的 GPT-6 Sol 设置相近的质量范围。这并不是普遍适用的成本比例,也不应被解读为 Sonnet 在所有编码或推理工作负载中都能胜出。
官方 Claude API 模型 ID 为:
claude-sonnet-5-5
Anthropic 表示,该模型也可通过 AWS、Google Cloud 和 Microsoft Foundry 使用。
Anthropic 表示,Haiku 5.5 将在未来几周内推出。它的定位是面向高吞吐量和成本敏感型应用。
claude-sonnet-5-5 集成到应用中的官方 API 文档。Claude Sonnet 5.5 缩小 Anthropic 中端模型与旗舰模型之间差距的幅度,比其名称所暗示的更大。它在 Terminal-Bench 4.0 上击败了 Opus 5.5,在 GDPval-AA 上仅相差 2 个 Elo,并且在 OSWorld 和 CursorBench 上几乎追平 Opus。
更重要的部署层面变化在于效率。Sonnet 5.5 维持与 Sonnet 5 相同的 2 美元 / 10 美元令牌价格,但 Anthropic 表示,其运行速度快 30% 以上,并且可以将每项已完成任务的成本最高降低 30%。外部测试者还报告称,它需要更少的工具调用、更少的 Shell 运行次数以及明显更少的迭代次数。
对于需要持续判断的困难开放式工作,Opus 5.5 仍然是更强的选择。更准确地说,Sonnet 5.5 是一款面向高频使用的工作主力,如今在越来越多范围明确的任务上达到了旗舰级质量。
Sonnet 5.5 最重要的升级并不是赢得某一项基准测试,而是在保持 Sonnet 级别价格的同时,以更低的每项任务成本,尽可能接近旗舰模型的质量。
从一句话开始,几分钟内拿到完整网站。