OpenAI 下调 GPT-5.6 Luna 和 Terra 的价格,并为 Sol 增加 Fast mode。本文解释具体变化及其对高并发、日常推理和低延迟生产工作流的模型选择影响。

OpenAI 在 GPT-5.6 系列正式发布不到一个月后,便调整了其定价体系。
自 2026 年 7 月 30 日起:
此次更新并非仅限于临时折扣。OpenAI 表示,降价反映了模型本身、推理架构、路由系统、上下文管理以及连接模型与工具的智能体软件等多方面的改进。
实际结果是,生产环境中的选择范围更广了。
Luna 现在的定价适合高并发、成本敏感的智能体工作流。Terra 仍然是日常工作中需要更高智能时的均衡之选。Sol 继续服务于要求最高的任务,而 Fast mode 则在对延迟敏感、等待时间比 token 溢价更重要时提供更低延迟的选择。
GPT-5.6 于 7 月 9 日发布时,OpenAI 公布的 Standard 短上下文 API 价格如下:
| 模型 | 原输入价格 | 原输出价格 |
|---|---|---|
| GPT-5.6 Sol | $5.00 / 百万 token | $30.00 / 百万 token |
| GPT-5.6 Terra | $2.50 / 百万 token | $15.00 / 百万 token |
| GPT-5.6 Luna | $1.00 / 百万 token | $6.00 / 百万 token |
7 月 30 日的更新调整了 Terra 和 Luna 的价格:
| 模型 | 新输入价格 | 新输出价格 | 变化幅度 |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 / 百万 token | $30.00 / 百万 token | 不变 |
| GPT-5.6 Terra | $2.00 / 百万 token | $12.00 / 百万 token | 降价 20% |
| GPT-5.6 Luna | $0.20 / 百万 token | $1.20 / 百万 token | 降价 80% |
Luna 的价格现已降至最初发布价格的五分之一。
Terra 的新价格为其原价的五分之四。
Sol 在 Standard 处理下保持不变,但 Fast mode 现在为开发者提供了一个选择:以两倍 Standard token 价格获得最高 2.5 倍的响应速度。
表面上的输入和输出价格并未显示完整的计费结构。
GPT-5.6 支持缓存输入折扣和显式缓存写入。使用超过 272,000 个输入 token 的请求还可对整个请求享受长上下文定价。
以下费率按每百万 token 计算:
| 模型 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $0.50 | $6.25 | $30.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 |
缓存读取相比普通未缓存输入可享受 90% 的折扣。
缓存写入按未缓存输入价格的 1.25 倍计费。
对于包含超过 272,000 个输入 token 的提示词,OpenAI 目前对完整请求收取以下费用:
| 模型 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| GPT-5.6 Sol | $10.00 | $1.00 | $12.50 | $45.00 |
| GPT-5.6 Terra | $4.00 | $0.40 | $5.00 | $18.00 |
| GPT-5.6 Luna | $0.40 | $0.04 | $0.50 | $1.80 |
长上下文规则意味着
成本估算应同时考虑令牌数量,以及请求是否跨越272,000令牌的门槛。
单个非常大的提示并非通过将前272,000个令牌按短上下文费率计费、其余部分按更高费率计费来处理的。长上下文倍率适用于整个请求。
OpenAI的主要论点是,高效的AI部署始于结果,而非模型名称。
同一工作流程的不同阶段可能需要不同水平的智能、速度和可靠性。
一项任务的理想模型取决于:
GPT-5.6 Luna专为成本敏感、高量级工作而设计。
其当前API模型页面将其描述为大致对应早期GPT-5系列中使用的nano层级。
Luna是以下场景的实用候选:
OpenAI估计,Luna能够以约六美分每美元任务成本、近九倍的速度,提供与约一年前被视为前沿类模型相当的性能。
该比较基于OpenAI的评估和成本方法论。团队应针对自身工作负载进行验证。
GPT-5.6 Terra是该系列中的平衡型成员。
OpenAI将其定位在早期GPT-5时代mini模型所处的位置,但具有更强的代理性和专业工作能力。
Terra适合以下工作:
GPT-5.6 Sol是面向复杂专业工作的旗舰模型。
当模型必须满足以下条件时,它是最佳选择:
gpt-5.6 API别名路由至gpt-5.6-sol。
此次定价更新使混合模型工作流程更加实用。
编码代理不需要为每个令牌和每次工具调用都使用Sol。
一种可能的架构是:
是很高的。
同样的模式也可以应用于软件工程之外。
一个文档处理系统可能会使用Luna进行提取,使用Terra进行综合,并且仅在材料存在歧义或影响重大时才使用Sol。
正确的路由策略应通过评估来确定,而不是依赖假设。
OpenAI的公告中包含了来自多个生产用户的早期客户反馈。
这些示例是公司和客户自行报告的,而非独立的基准测试。
| 公司 | 报告的使用情况或结果 |
|---|---|
| Replit | Luna让以往不切实际的使用场景变得成本可控,足以进行探索 |
| Notion | Terra在内部评估中,以一半的任务成本和缩短60%的时间,达到了与GPT-5.5相当的质量 |
| Ramp | Terra和Luna在成本效率方面引领了内部编码评估;Luna成为后台自动化任务的默认选择 |
| Blitzy | Luna将提示缓存复用率从24%提升至90%,与之前的默认方案相比大幅降低了成本 |
| Cognition | Luna在Devin Fusion中作为成本更低的编码伙伴,与更大的模型配合使用 |
| Dust | 据报告,在相似的智能体任务中,Luna比该公司之前的默认方案快40%、便宜40% |
这些示例表明,按Token计费并非唯一有用的衡量标准。
一个更便宜的模型还可能改变:
更有意义的指标通常是每次成功结果的成本。
OpenAI将性能价格比的提升归因于三个相互关联的层面。
GPT-5.6系列模型旨在更直接地完成工作。
一个需要更少输出Token、更少重试或更少推理循环的模型,即使在标价不变的情况下,也能降低总任务成本。
生产堆栈决定了模型使用硬件的效率。
OpenAI表示,优化过的服务软件可以更高效地生成Token,并保持计算资源的生产力。
框架是模型周围的软件,提供工具、上下文、路由、状态和工作流控制。
OpenAI表示,更好的上下文管理有助于智能体避免重复已完成的工作。
这可以减少:
这三个层面相互影响。
更强的模型可能在服务堆栈中找到优化空间。这种优化降低了成本,使更大规模的智能体使用变得经济实惠。更多的使用量又会创造更多改进系统的机会。
公告中最引人注目的声明之一是,GPT-5.6 Sol为OpenAI的内部效率工作做出了贡献。
在人类主导的工程流程中,OpenAI表示Sol:
OpenAI 报告称,内核方面的优化使模型的端到端服务成本降低了约20%。
该公司还表示,这些实验将令牌生成效率提升了超过15%。
这些是OpenAI的内部结果,尚未通过公开基准测试进行独立复现。
更重要的一个观点是,模型正逐渐成为改进其运行基础设施这一流程中的一部分。
这形成了一个更紧密的工程反馈闭环:
更强的模型
→ 更好的基础设施优化
→ 更低的服务成本
→ 更广泛的应用
→ 更多反馈与投入
→ 更强大的下一代模型
更低的定价并不意味着OpenAI需要的总算力减少。
该公司认为,实现充足的智能需要同时具备两点:
前者扩大总容量。
后者提升每单位硬件完成的有效工作量。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
OpenAI表示,它正在构建多元化基础设施组合,并将工作负载匹配到最适合运行它们的系统上。
这同时支撑GPT-5.6系列的两端:
可能更容易实现规模化运行的工作负载示例包括:
与此同时,当更快得到答案的价值足以覆盖额外费用时,复杂的Sol请求可以使用Fast模式。
Fast模式是OpenAI优先处理服务层的新名称。
使用以下方式的现有API请求:
"service_tier": "priority"
仍然保持兼容。
开发者也可以使用:
"service_tier": "fast"
对于GPT-5.6 Sol,OpenAI表示Fast模式在保持相同模型智能的同时,速度可达标准处理的2.5倍。
代价是价格。
目前,GPT-5.6 Sol的Fast模式费用为标准API令牌价格的2倍。
缓存输入的折扣仍然适用。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Review this migration plan and identify the three highest-risk assumptions.",
service_tier="fast",
)
print(response.output_text)
Fast模式可通过Responses API和Chat Completions API用于受支持的模型。
对于GPT-5.6及更早的模型,即使请求使用了更新的fast名称,响应对象也可能将服务层报告为priority。
Fast模式并非对所有Sol请求都自动是最佳设置。
当延迟直接影响结果的价值时,它最为有用。
示例包括:
对延迟敏感的业务流量。
对于以下场景,标准处理可能更经济:
只有当下游完成所创造的价值超过其成本时,两倍的代币溢价才有意义。
新的标价使 Luna 和 Terra 更便宜,但提示缓存对长时间运行的代理同样能产生巨大的影响。
代理循环中的每一轮都可能重新发送:
如果没有缓存,应用程序可能会为相同的前缀重复付费。
GPT-5.6 同时支持自动缓存和显式缓存断点。
OpenAI 目前的计费方式为:
缓存写入的成本高于普通输入,但后续的读取可获得大幅折扣。
当相同的稳定前缀被重复使用足够多次以收回更高的写入成本时,缓存最为有用。
应用程序应跟踪:
当前的 API 模型页面列出了多项共享规格:
| 规格 | Sol | Terra | Luna |
|---|---|---|---|
| 上下文窗口 | 1,050,000 个 token | 1,050,000 个 token | 1,050,000 个 token |
| 最大输出 | 128,000 个 token | 128,000 个 token | 128,000 个 token |
| 知识截止日期 | 2026 年 2 月 16 日 | 2026 年 2 月 16 日 | 2026 年 2 月 16 日 |
| 文本输入/输出 | 支持 | 支持 | 支持 |
| 图像输入 | 支持 | 支持 | 支持 |
| 推理 token | 支持 | 支持 | 支持 |
| 函数调用 | 支持 | 支持 | 支持 |
| 结构化输出 | 支持 | 支持 | 支持 |
| 微调 | 不支持 | 不支持 | 不支持 |
这三个模型均可通过 Responses API 使用。
模型页面还列出了广泛的工具支持,但具体功能可用性可能因端点、账户、产品和发布阶段而异。
OpenAI 表示 GPT-5.6 Terra 和 Luna 仍可在以下平台使用:
价格公告中描述的当前访问权限包括:
| 套餐组 | ChatGPT Work 和 Codex 中的 GPT-5.6 访问权限 |
|---|---|
| 免费版和 Go | Terra |
| Plus、Pro、Business、Enterprise | Terra 和 Luna |
Sol 在 ChatGPT、ChatGPT Work、Codex 和 API 中有自己的访问规则。
7 月 30 日的更新并未降低 ChatGPT 或 Codex 的订阅价格。
也未提高所声明的配额预算。
相反,Luna 和 Terra 现在消耗更少的积分,因为其底层使用成本更低。
OpenAI 还表示,定价更新将在公告发布当天通过 AWS 开始推出。通过第三方平台提供的模型定价可能与 OpenAI API 直接定价有所不同。
选择正确的GPT-5.6模型
一个实用的选择流程可以遵循五个步骤。
写下什么算作成功。
避免仅根据“编程”或“研究”等宽泛标签来选择模型。
低风险的分类任务和生产环境数据库迁移不应使用相同的决策规则。
对于困难任务,先测试Sol以了解可用的最高质量水平。
衡量成本更低的模型是否保留了真正重要的质量。
跟踪:
不要只优化最便宜的输入Token价格。
GPT-5.6 Luna现在的标准短上下文输入Token价格为每百万个0.20美元,缓存输入Token价格为每百万个0.02美元,输出Token价格为每百万个1.20美元。缓存写入价格为每百万个Token 0.25美元。
GPT-5.6 Terra现在的标准短上下文输入Token价格为每百万个2.00美元,缓存输入Token价格为每百万个0.20美元,输出Token价格为每百万个12.00美元。缓存写入价格为每百万个Token 2.50美元。
其标准Token价格没有变化。Sol仍然是短上下文输入Token每百万个5美元,输出Token每百万个30美元,而Fast模式提供比标准价格高两倍的2.5倍处理速度。
OpenAI于2026年7月30日将Priority Processing更名为Fast模式。使用service_tier: "priority"的现有请求仍然兼容,新请求可以使用service_tier: "fast"。
当前的模型页面说明,包含超过272,000个输入Token的提示将对整个请求使用更高的输入和输出费率。开发人员在估算超大提示的成本时应考虑这一阈值。
OpenAI将Luna定位为面向成本敏感、高吞吐量工作的模型。当Luna无法提供足够质量时,Terra是平衡的选择,而Sol则面向最困难的专业任务。
不会。OpenAI表示订阅价格和配额预算保持不变。Terra和Luna现在在受支持的付费产品工作流中消耗更少的点数。
直接OpenAI API价格于7月30日发生变化。OpenAI表示AWS定价将于当天晚些时候开始推出,但第三方平台的价格和可用性可能有所不同,因此用户应核实提供商的当前费率表。
适用于既需要智能又希望降低成本的负载的模型。
OpenAI 在 7 月 30 日的更新中,将 GPT-5.6 Luna 的标准 API 价格下调了 80%,Terra 下调了 20%。Sol 的标准价格保持不变,而新的快速模式可将 API 响应速度提升至原来的 2.5 倍,token 费率则为原来的两倍。
本次公告围绕更广泛的性价比策略展开。OpenAI 表示,正在改进模型、推理栈、路由、上下文管理和智能体框架,以降低每个成功任务所需的时间、token 数或算力。
对于开发者而言,正确的选择并非简单地挑选最便宜的模型。Luna 面向高吞吐量执行,Terra 在成本与智能之间取得平衡,Sol 则负责最复杂的工作。混合模型路由、缓存、评估和每次成功成本衡量所带来的节省,可能远超单纯更换模型的效果。
核心变化在于,GPT-5.6 现在提供了更宽的工作区间:Luna 和 Terra 层级提供了更经济的日常智能,而在延迟表现值得更高成本时,可通过 Sol 获得更快速的尖端智能。
该 Markdown 文件是对官方文章的独立编辑性改编。它保留了主题、事实顺序和实际含义,但未逐字复制 OpenAI 的措辞或客户引述。
从一句话开始,几分钟内拿到完整网站。