For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/how-to-cut-claude-code-token.md.
Anthropic发布了一份实用指南,面向希望从每次Claude Code会话中获取更多价值的开发者。核心信息很简单:同样的编码任务,其成本可能因会话管理方式不同而存在显著差异。

Anthropic 发布了一份实用指南,帮助开发者从每一次 Claude Code 会话中获得更大价值。
核心信息很简单:同样的编程任务,根据你管理会话的方式不同,成本可能会有很大差异。
Claude Code 不像传统编辑器那样每个任务费用固定。每个模型请求都有推理成本,而长对话会反复携带文件、工具结果、命令输出、系统指令和早期消息。如果这些上下文管理不当,一个简单的 bug 修复最终可能消耗远超必要的 Token。

源文章将建议提炼为六个实用习惯:
/clear。@ 直接引用文件,而不是让 Claude 自行搜索。/compact,趁现有提示缓存仍然有效时进行压缩。Anthropic 自己的 TL;DR 还建议在新会话中运行 /context 查看已加载的内容,包括 CLAUDE.md 和 MCP 工具定义。
一旦你理解了 Token 在 Claude Code 会话中的流转过程,这些建议就更有意义了。
Claude Code 可以通过付费 Claude 套餐或按量计费的 API 使用。对于个人用户,Claude Pro 目前按月付费为每月 20 美元,而 Claude Max 起价为每月 100 美元,还提供更高使用量档位。API 使用量则根据模型和 Token 数量单独计费。
Anthropic 的 Claude Code 成本文档指出,在企业部署中,平均使用量约为每个开发者每个活跃日 13 美元,大约为每个开发者每月 150-250 美元,不过实际成本会因模型、代码库、工作流程和自动化程度而有很大差异。
如果 Claude 必须搜索不必要的文件、运行冗长的命令,或反复携带无关的上下文,同样的任务成本可能会高出数倍。

要理解原因,可以将
每个请求拆分为两个阶段。
在预填充阶段,模型一次性读取请求及其上下文。
该输入可以包括:
CLAUDE.md所有这些都计入输入令牌。
在解码阶段,模型逐个令牌地生成其响应。
这包括推理令牌、工具调用以及你最终看到的文本。与预填充不同,解码是串行的:一个200令牌的响应需要模型一个接一个地生成200个令牌。

这就是为什么输出令牌通常比输入令牌贵得多。对于本文讨论的当前Claude模型,输出定价是基础输入价格的五倍。
当前标准API价格如下:
| 模型 | 输入 | 输出 |
|---|---|---|
| Claude Opus 5 | $5 / MTok | $25 / MTok |
| Claude Sonnet 5 | $2 / MTok | $10 / MTok |
| Claude Haiku 4.5 | $1 / MTok | $5 / MTok |
MTok表示一百万令牌。
另一个主要变量是努力级别。在代理式编码会话中生成的大部分输出可能是推理。更高的努力级别允许模型花费更多令牌来思考难题,而较低的努力级别可能更适合常规工作。

实用规则很简单:使用更强的模型和更高的
当问题真正困难或模糊时付出努力,而不是对每个小任务自动这样做。
提示缓存是Claude Code成本模型中最关键的部分之一。
每个Claude Code请求都以大量重复内容开始:工具定义、系统提示、CLAUDE.md以及迄今为止积累的对话历史。
如果新请求的开头与最近的请求完全匹配,服务器可以重用先前计算的状态,而无需再次处理整个共享前缀。
读取缓存仅需正常输入令牌价格的0.1倍。
写入缓存比正常输入更昂贵,因为服务器必须存储计算后的状态。标准的五分钟缓存写入成本为基础输入价格的1.25倍,而一小时缓存写入成本为2倍。关键点在于写入只发生一次,而后续的缓存命中可以反复以正常输入成本的十分之一重用前缀。
假设一个对话已经包含50,000个令牌的历史。如果没有缓存命中,模型在下一个请求时必须按正常输入速率预填充整个历史。如果缓存有效,共享前缀会以基础速率的0.1倍读取,只有新追加的内容需要按全价输入价格处理。
在长时间运行的代理循环中,这种差异可能变得相当可观。
缓存必须从请求的开始处连续匹配。如果前缀前部附近的某些内容发生变化——或改变了部分缓存键——剩余的历史就无法再以同样的方式重用。
源文章强调了六种常见情况。
/model切换模型/effort更改推理努力程度/compact这并不意味着你永远不应更改模型、努力程度或压缩对话。这意味着存在更便宜的时机:在会话开始时或刚执行/clear之后,而非在长时间、昂贵的上下文进行到一半时。
还有一个不太明显的情况在
opusplan 模式。Anthropic 指出,进入或退出计划模式可能会切换模型,因此每次切换都可能使相关模型的缓存失效。
/compact 更划算/compact 会将当前对话压缩为更简短的版本。
由于生成摘要需要读取现有上下文,因此在对话仍可通过提示缓存获取时执行压缩会更便宜。如果你等到长时间休息后缓存已过期,Claude 可能需要在总结之前以正常的输入成本读取完整对话。
这就是为什么 Anthropic 建议在离开键盘较长时间之前先执行压缩。
提示缓存使重复上下文更便宜,但它并不能阻止上下文本身不断增长。
每次 Claude 读取文件,文件内容都会添加到对话中。每次它运行命令,输出也可能被添加进来。从那时起,后续轮次会持续携带这些内容。
第 40 轮不仅仅是最新的请求,它同时携带了第 1 到第 39 轮中发生的大部分内容。
这就是为什么长时间会话累积的成本可能远超开发者的预期。即使旧历史被缓存,反复携带不相关的上下文也并非免费,而且还会消耗上下文窗口中的空间。
Claude Code 确实对超大 Bash 输出设有防护机制。Anthropic 当前的文档指出,当命令输出超过 30,000 个字符时,Claude Code 会将输出写入文件,只在对话中保留简短预览和路径。
棘手的情况是输出杂乱但仍低于该阈值的场景。
一个打印数百行成功测试行的测试套件可能仍低于 30,000 个字符。如果是这样,这些内容会留在对话中,并在后续轮次中继续被发送。
因此,Anthropic 建议主动保持工作上下文的精简。
@ 引用文件如果你知道 Claude 需要哪个文件,直接引用它。
不要让 Claude 按名称查找文件,而是使用 @ 提及,使文件从一开始就附加到消息中。

从概念上比较这些提示:
测试失败了。
Claude 可能需要在仓库中搜索、检查多个文件,并收集多个工具结果才能
触及了实际问题。
更具体的请求可以减少部分探索:
修复 utils.test.ts 中失败的测试。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
而一个 @ 引用可以避免单独的 Read 调用:
修复 @utils.test.ts 中失败的测试。
无论哪种方式,文件仍会占用上下文。节省来自避免不必要的搜索和 Read 轮次。
另外,避免在同一对话中重复附加同一文件。一旦文件进入上下文,再次提及可能会添加另一份副本。
重复的命令输出可能会悄悄主导整个会话。
对于你经常运行的命令,在 CLAUDE.md 中放入一个简洁版本,让 Claude 从一开始就知道低噪音的调用方式。
例如:
使用 npx vitest run --reporter=dot 运行单个测试文件
点状报告器可能只返回一个紧凑的结果,而不是数百行的详细输出。
这是一个小的配置更改,但在多次轮次中,它可以节省大量重复上下文。
子代理拥有自己的上下文窗口。
它有自己的系统提示、工具和 CLAUDE.md,但它不会继承整个主对话。它可以检查日志、运行命令、搜索历史或读取大文件,然后只将答案返回给父会话。

这对于以下任务非常有用:
当子代理完成时,中间的文件读取和命令输出会消失。只有它返回的答案进入主会话。
这里有一个权衡:因为子代理不会继承父对话,它可能需要重新阅读主会话已知的材料。对于小型任务,这种开销可能使子代理效率较低。当隔离的任务噪音足够大,你不想让它的过程保留在主上下文中时,它就值得了。
/clear这是最简单也最有价值的习惯之一。
一旦你完成了一个错误修复并开始不同的任务,运行:
/clear
先前任务的文件读取、命令输出、失败的方法和临时上下文不再需要跟随后续的每一轮。
Anthropic 自己的对比显示,在一个连续会话中保留三个独立任务,比在任务之间清除发送更多的 token。

如果你需要保留旧会话以备后用,Anthropic 建议在 /clear 之前使用 /rename。
如果你仍在处理同一任务,只需要压缩对话中较旧的部分,/compact 是更好的工具。
/rewind最后几轮对话出了问题
还有一个很容易被忽略的有用选项:
/rewind
如果会话只是在最后几轮偏离了方向,倒回可以移除这些轮次,而无需重写之前更早的对话。
这对缓存很重要。Anthropic 表示,倒回点之前的部分可以保持缓存状态,而 /compact 会重写对话,因此会产生自己的成本。
所以这三个命令用途不同:
| 命令 | 最佳用途 |
|---|---|
/clear | 你要开始一个全新的任务 |
/compact | 你在继续同一个任务,但需要更短的上下文 |
/rewind | 只有最近的几轮是错误的或不再有用 |
一旦这些机制清晰了,一个更大的模式就浮现出来。
高效的 AI 辅助编程现在需要一种新的操作判断力。开发者不仅需要知道如何编写和调试代码,还需要知道:
一年前,这些决策在日常软件开发中几乎不存在。现在它们可以决定两位开发者完成基本相同的工作是否要支付截然不同的费用。
Anthropic 自己就说明了这在规模化时有多重要。
该公司在 2026 年报告称,合并到 Anthropic 代码库中的代码有 80% 以上是由 Claude 编写的,而且普通工程师
每天合并的代码量约为 2024 年的 8 倍。在另一个内部优化基准测试中,一个基于 Claude 的系统从 2025 年约 3 倍的加速提升到 2026 年 4 月约 52 倍。
在如此级别的 AI 使用下,推理效率不是一个小账目细节。
因此,Anthropic 指南中更深刻的教训不仅仅是“少花 token”。而是要理解 token 都花在了哪里,并确保它们被花在有用的推理、代码更改和工具工作上,而不是过时的历史和可避免的输出上。
每一轮新对话都会携带相关的对话历史,包括消息、文件、工具调用和命令输出。提示缓存使重复的前缀便宜得多,但不断增长的上下文仍然会消耗 token 和上下文窗口容量。
提示缓存命中按正常基础输入 token 价格的 0.1 倍计费,这意味着缓存输入部分降低了 90%。缓存写入比正常输入更贵,但重复的缓存读取可以很快抵消初始写入成本。
/clear 还是 /compact?当你切换到不同任务且不再需要当前上下文时,使用 /clear。当你仍在同一个任务上但希望 Claude 将较早的对话历史总结为更小的工作上下文时,使用 /compact。
/rewind 有什么作用?/rewind 可以让你跳回
返回到之前的一条消息,并从活动上下文中删除其后的对话轮次。当只有对话的最新部分走错了方向,且你不需要压缩或清除整个会话时,这非常有用。
可能会。每个模型使用独立的提示缓存,因此在长对话中途切换模型可能会迫使现有历史记录以新模型的完整输入价格重新处理。
@?@ 文件引用会将文件直接附加到消息中,这可以避免 Claude 搜索文件或额外发起一次 Read 调用。文件内容仍然会消耗上下文,因此好处是避免不必要的查找步骤,而不是让文件本身免费。
对于会产生大量你不需要在主对话中看到的中间输出的工作(例如检查日志或执行广泛搜索),请使用子代理。子代理在独立的上下文中工作,只将最终答案发送回主会话。
在新的 Claude Code 会话中运行 /context。Anthropic 建议使用它来检查启动上下文,如 CLAUDE.md 和 MCP 工具定义,以便删除你不需要的指令或集成。
--reporter=dot 减少嘈杂的测试输出。难度。
Claude Code 的成本受多种因素影响,而不仅仅是模型价格。上下文长度、推理强度、命令输出、会话时长、缓存命中率、文件发现和子代理的使用,都会改变一项任务消耗的 token 数量。
最有价值的习惯很简单:任务变化时清除上下文,避免在会话中途进行不必要的模型或推理强度切换,保持嘈杂输出简短,直接引用已知文件,长时间中断前先压缩上下文,以及在更适合使用子代理时隔离高输出量工作。
这些做法并非不惜一切代价追求 token 使用量最小化,而是为了确保你所支付的 token 都在为任务做出贡献,而不是反复承载无关的历史信息。
高效使用 Claude Code 越来越成为一种上下文工程:保持上下文相关,在有益时保留缓存,并将推理用在真正能改善结果的地方。
从一句话开始,几分钟内拿到完整网站。