引言
OpenAI 在 GPT-5.6 系列正式发布不到一个月后,便调整了其定价体系。
自 2026 年 7 月 30 日起:
- GPT-5.6 Luna 降价 80%。
- GPT-5.6 Terra 降价 20%。
- GPT-5.6 Sol 保持原有 Standard 价格,但新增了更快的 API 处理选项。
- Priority Processing 已更名为 Fast mode。
此次更新并非仅限于临时折扣。OpenAI 表示,降价反映了模型本身、推理架构、路由系统、上下文管理以及连接模型与工具的智能体软件等多方面的改进。
实际结果是,生产环境中的选择范围更广了。
Luna 现在的定价适合高并发、成本敏感的智能体工作流。Terra 仍然是日常工作中需要更高智能时的均衡之选。Sol 继续服务于要求最高的任务,而 Fast mode 则在对延迟敏感、等待时间比 token 溢价更重要时提供更低延迟的选择。
2026 年 7 月 30 日的变化
GPT-5.6 于 7 月 9 日发布时,OpenAI 公布的 Standard 短上下文 API 价格如下:
| 模型 | 原输入价格 | 原输出价格 |
|---|---|---|
| GPT-5.6 Sol | $5.00 / 百万 token | $30.00 / 百万 token |
| GPT-5.6 Terra | $2.50 / 百万 token | $15.00 / 百万 token |
| GPT-5.6 Luna | $1.00 / 百万 token | $6.00 / 百万 token |
7 月 30 日的更新调整了 Terra 和 Luna 的价格:
| 模型 | 新输入价格 | 新输出价格 | 变化幅度 |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 / 百万 token | $30.00 / 百万 token | 不变 |
| GPT-5.6 Terra | $2.00 / 百万 token | $12.00 / 百万 token | 降价 20% |
| GPT-5.6 Luna | $0.20 / 百万 token | $1.20 / 百万 token | 降价 80% |
Luna 的价格现已降至最初发布价格的五分之一。
Terra 的新价格为其原价的五分之四。
Sol 在 Standard 处理下保持不变,但 Fast mode 现在为开发者提供了一个选择:以两倍 Standard token 价格获得最高 2.5 倍的响应速度。
当前 Standard API 定价
表面上的输入和输出价格并未显示完整的计费结构。
GPT-5.6 支持缓存输入折扣和显式缓存写入。使用超过 272,000 个输入 token 的请求还可对整个请求享受长上下文定价。
短上下文 Standard 定价
以下费率按每百万 token 计算:
| 模型 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $0.50 | $6.25 | $30.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 |
缓存读取相比普通未缓存输入可享受 90% 的折扣。
缓存写入按未缓存输入价格的 1.25 倍计费。
长上下文 Standard 定价
对于包含超过 272,000 个输入 token 的提示词,OpenAI 目前对完整请求收取以下费用:
| 模型 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| GPT-5.6 Sol | $10.00 | $1.00 | $12.50 | $45.00 |
| GPT-5.6 Terra | $4.00 | $0.40 | $5.00 | $18.00 |
| GPT-5.6 Luna | $0.40 | $0.04 | $0.50 | $1.80 |
长上下文规则意味着
成本估算应同时考虑令牌数量,以及请求是否跨越272,000令牌的门槛。
单个非常大的提示并非通过将前272,000个令牌按短上下文费率计费、其余部分按更高费率计费来处理的。长上下文倍率适用于整个请求。
将智能与结果匹配
OpenAI的主要论点是,高效的AI部署始于结果,而非模型名称。
同一工作流程的不同阶段可能需要不同水平的智能、速度和可靠性。
一项任务的理想模型取决于:
- 错误的后果。
- 工作的难度。
- 可接受的响应时间。
- 请求量。
- 人工复核的成本。
- 自动验证结果的能力。
- 任务是明确指定的,还是仍然模糊不清。
何时选择Luna
GPT-5.6 Luna专为成本敏感、高量级工作而设计。
其当前API模型页面将其描述为大致对应早期GPT-5系列中使用的nano层级。
Luna是以下场景的实用候选:
- 分类。
- 结构化提取。
- 后台代理步骤。
- 常规代码变更。
- 测试生成。
- 文档分类处理。
- 重复性工具调用循环。
- 大规模处理,其中每个单独任务的负面影响有限。
OpenAI估计,Luna能够以约六美分每美元任务成本、近九倍的速度,提供与约一年前被视为前沿类模型相当的性能。
该比较基于OpenAI的评估和成本方法论。团队应针对自身工作负载进行验证。
何时选择Terra
GPT-5.6 Terra是该系列中的平衡型成员。
OpenAI将其定位在早期GPT-5时代mini模型所处的位置,但具有更强的代理性和专业工作能力。
Terra适合以下工作:
- 工作区问答。
- 限定范围的研究。
- 日常编码。
- 文档分析。
- 中等复杂度的代理规划。
- 需要推理的客户支持工作流程。
- Luna不够可靠但Sol又非必要时的重复性业务任务。
何时选择Sol
GPT-5.6 Sol是面向复杂专业工作的旗舰模型。
当模型必须满足以下条件时,它是最佳选择:
- 解决歧义。
- 为困难项目制定计划。
- 审查高价值决策。
- 处理复杂编码或调试。
- 在长时间工作流程中协调工具。
- 进行深度研究。
- 生成或验证失败代价高昂的工作。
gpt-5.6 API别名路由至gpt-5.6-sol。
一个工作流程可以使用多个模型
此次定价更新使混合模型工作流程更加实用。
编码代理不需要为每个令牌和每次工具调用都使用Sol。
一种可能的架构是:
- 使用Sol理解代码库并识别不确定性。
- 让Sol创建计划并定义成功标准。
- 将明确指定的实现任务发送给Luna。
- 使用Luna编写常规测试并执行重复性检查。
- 将不确定或失败的步骤路由至Terra或Sol。
- 在错误后果严重时,使用Sol进行最终审查。
是很高的。
同样的模式也可以应用于软件工程之外。
一个文档处理系统可能会使用Luna进行提取,使用Terra进行综合,并且仅在材料存在歧义或影响重大时才使用Sol。
正确的路由策略应通过评估来确定,而不是依赖假设。
OpenAI分享的客户成果
OpenAI的公告中包含了来自多个生产用户的早期客户反馈。
这些示例是公司和客户自行报告的,而非独立的基准测试。
| 公司 | 报告的使用情况或结果 |
|---|---|
| Replit | Luna让以往不切实际的使用场景变得成本可控,足以进行探索 |
| Notion | Terra在内部评估中,以一半的任务成本和缩短60%的时间,达到了与GPT-5.5相当的质量 |
| Ramp | Terra和Luna在成本效率方面引领了内部编码评估;Luna成为后台自动化任务的默认选择 |
| Blitzy | Luna将提示缓存复用率从24%提升至90%,与之前的默认方案相比大幅降低了成本 |
| Cognition | Luna在Devin Fusion中作为成本更低的编码伙伴,与更大的模型配合使用 |
| Dust | 据报告,在相似的智能体任务中,Luna比该公司之前的默认方案快40%、便宜40% |
这些示例表明,按Token计费并非唯一有用的衡量标准。
一个更便宜的模型还可能改变:
- 工具调用的次数。
- 缓存复用情况。
- 上下文长度。
- 输出冗长度。
- 重试频率。
- 人工审核需求。
- 总完成时间。
更有意义的指标通常是每次成功结果的成本。
OpenAI所称的效率提升方式
OpenAI将性能价格比的提升归因于三个相互关联的层面。
- 模型
GPT-5.6系列模型旨在更直接地完成工作。
一个需要更少输出Token、更少重试或更少推理循环的模型,即使在标价不变的情况下,也能降低总任务成本。
- 推理系统
生产堆栈决定了模型使用硬件的效率。
OpenAI表示,优化过的服务软件可以更高效地生成Token,并保持计算资源的生产力。
- 智能体框架
框架是模型周围的软件,提供工具、上下文、路由、状态和工作流控制。
OpenAI表示,更好的上下文管理有助于智能体避免重复已完成的工作。
这可以减少:
- 重复的工具调用。
- 对未变化上下文的重复处理。
- 重复的规划。
- 不必要的模型往返调用。
- 用于复述先前结果的Token消耗。
这三个层面相互影响。
更强的模型可能在服务堆栈中找到优化空间。这种优化降低了成本,使更大规模的智能体使用变得经济实惠。更多的使用量又会创造更多改进系统的机会。
GPT-5.6 Sol帮助优化了自身的服务堆栈
公告中最引人注目的声明之一是,GPT-5.6 Sol为OpenAI的内部效率工作做出了贡献。
在人类主导的工程流程中,OpenAI表示Sol:
- 重写并优化了生产内核。
- 设计并运行了数百次Token生成实验。
- 监控训练过程。
- 在出现问题时进行干预。
OpenAI 报告称,内核方面的优化使模型的端到端服务成本降低了约20%。
该公司还表示,这些实验将令牌生成效率提升了超过15%。
这些是OpenAI的内部结果,尚未通过公开基准测试进行独立复现。
更重要的一个观点是,模型正逐渐成为改进其运行基础设施这一流程中的一部分。
这形成了一个更紧密的工程反馈闭环:
更强的模型
→ 更好的基础设施优化
→ 更低的服务成本
→ 更广泛的应用
→ 更多反馈与投入
→ 更强大的下一代模型
面向规模的算力策略
更低的定价并不意味着OpenAI需要的总算力减少。
该公司认为,实现充足的智能需要同时具备两点:
- 更多的算力。
- 更高产出的算力。
前者扩大总容量。
后者提升每单位硬件完成的有效工作量。
OpenAI表示,它正在构建多元化基础设施组合,并将工作负载匹配到最适合运行它们的系统上。
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
这同时支撑GPT-5.6系列的两端:
- Luna和Terra让高容量工作负载成本更低。
- Sol和Fast模式支持困难且对延迟敏感的工作。
可能更容易实现规模化运行的工作负载示例包括:
- 大型文档分析流水线。
- 客户交互分类。
- 常规软件实施。
- 后台智能体自动化。
- 重复性数据处理任务。
- 高缓存复用率的工具调用工作流。
与此同时,当更快得到答案的价值足以覆盖额外费用时,复杂的Sol请求可以使用Fast模式。
Fast模式取代优先处理
Fast模式是OpenAI优先处理服务层的新名称。
使用以下方式的现有API请求:
"service_tier": "priority"
仍然保持兼容。
开发者也可以使用:
"service_tier": "fast"
对于GPT-5.6 Sol,OpenAI表示Fast模式在保持相同模型智能的同时,速度可达标准处理的2.5倍。
代价是价格。
目前,GPT-5.6 Sol的Fast模式费用为标准API令牌价格的2倍。
缓存输入的折扣仍然适用。
Python示例
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Review this migration plan and identify the three highest-risk assumptions.",
service_tier="fast",
)
print(response.output_text)
Fast模式可通过Responses API和Chat Completions API用于受支持的模型。
对于GPT-5.6及更早的模型,即使请求使用了更新的fast名称,响应对象也可能将服务层报告为priority。
何时Fast模式的溢价值得
Fast模式并非对所有Sol请求都自动是最佳设置。
当延迟直接影响结果的价值时,它最为有用。
示例包括:
- 面向用户、完成高价值工作流的助手。
- 等待解除开发者阻塞的编程智能体。
- 交互式研究或分析。
- 事件响应支持。
- 决策前的实时审查。
- 稳定运行的生产系统。
对延迟敏感的业务流量。
对于以下场景,标准处理可能更经济:
- 后台任务。
- 隔夜研究。
- 异步报告生成。
- 批量分析。
- 用户无需等待的任务。
- 瓶颈在于外部工具而非模型的工作流。
只有当下游完成所创造的价值超过其成本时,两倍的代币溢价才有意义。
在长周期代理工作流中,提示缓存更为重要
新的标价使 Luna 和 Terra 更便宜,但提示缓存对长时间运行的代理同样能产生巨大的影响。
代理循环中的每一轮都可能重新发送:
- 系统指令。
- 工具定义。
- 共享文档。
- 代码库上下文。
- 对话历史。
- 稳定的工作流规则。
如果没有缓存,应用程序可能会为相同的前缀重复付费。
GPT-5.6 同时支持自动缓存和显式缓存断点。
OpenAI 目前的计费方式为:
- 缓存读取按未缓存输入价格的 10% 计费。
- 缓存写入按未缓存输入价格的 125% 计费。
缓存写入的成本高于普通输入,但后续的读取可获得大幅折扣。
当相同的稳定前缀被重复使用足够多次以收回更高的写入成本时,缓存最为有用。
应用程序应跟踪:
- 缓存命中率。
- 前缀稳定性。
- 请求之间的间隔时间。
- 缓存上下文的大小。
- 工作流是否频繁使前缀失效。
整个系列共享的模型规格
当前的 API 模型页面列出了多项共享规格:
| 规格 | Sol | Terra | Luna |
|---|---|---|---|
| 上下文窗口 | 1,050,000 个 token | 1,050,000 个 token | 1,050,000 个 token |
| 最大输出 | 128,000 个 token | 128,000 个 token | 128,000 个 token |
| 知识截止日期 | 2026 年 2 月 16 日 | 2026 年 2 月 16 日 | 2026 年 2 月 16 日 |
| 文本输入/输出 | 支持 | 支持 | 支持 |
| 图像输入 | 支持 | 支持 | 支持 |
| 推理 token | 支持 | 支持 | 支持 |
| 函数调用 | 支持 | 支持 | 支持 |
| 结构化输出 | 支持 | 支持 | 支持 |
| 微调 | 不支持 | 不支持 | 不支持 |
这三个模型均可通过 Responses API 使用。
模型页面还列出了广泛的工具支持,但具体功能可用性可能因端点、账户、产品和发布阶段而异。
在 ChatGPT Work、Codex 和 API 中的可用性
OpenAI 表示 GPT-5.6 Terra 和 Luna 仍可在以下平台使用:
- ChatGPT Work。
- Codex。
- OpenAI API。
价格公告中描述的当前访问权限包括:
| 套餐组 | ChatGPT Work 和 Codex 中的 GPT-5.6 访问权限 |
|---|---|
| 免费版和 Go | Terra |
| Plus、Pro、Business、Enterprise | Terra 和 Luna |
Sol 在 ChatGPT、ChatGPT Work、Codex 和 API 中有自己的访问规则。
7 月 30 日的更新并未降低 ChatGPT 或 Codex 的订阅价格。
也未提高所声明的配额预算。
相反,Luna 和 Terra 现在消耗更少的积分,因为其底层使用成本更低。
OpenAI 还表示,定价更新将在公告发布当天通过 AWS 开始推出。通过第三方平台提供的模型定价可能与 OpenAI API 直接定价有所不同。
如何
选择正确的GPT-5.6模型
一个实用的选择流程可以遵循五个步骤。
第一步:明确预期结果
写下什么算作成功。
避免仅根据“编程”或“研究”等宽泛标签来选择模型。
第二步:识别失败的代价
低风险的分类任务和生产环境数据库迁移不应使用相同的决策规则。
第三步:建立Sol基线
对于困难任务,先测试Sol以了解可用的最高质量水平。
第四步:在同一评估集上测试Terra和Luna
衡量成本更低的模型是否保留了真正重要的质量。
第五步:优化整个工作流
跟踪:
- 任务成功率。
- 总Token数。
- 缓存复用率。
- 工具调用次数。
- 重试次数。
- 延迟。
- 人工审查时间。
- 每次成功结果的成本。
不要只优化最便宜的输入Token价格。
常见问题
GPT-5.6 Luna的新价格是多少?
GPT-5.6 Luna现在的标准短上下文输入Token价格为每百万个0.20美元,缓存输入Token价格为每百万个0.02美元,输出Token价格为每百万个1.20美元。缓存写入价格为每百万个Token 0.25美元。
GPT-5.6 Terra的新价格是多少?
GPT-5.6 Terra现在的标准短上下文输入Token价格为每百万个2.00美元,缓存输入Token价格为每百万个0.20美元,输出Token价格为每百万个12.00美元。缓存写入价格为每百万个Token 2.50美元。
GPT-5.6 Sol降价了吗?
其标准Token价格没有变化。Sol仍然是短上下文输入Token每百万个5美元,输出Token每百万个30美元,而Fast模式提供比标准价格高两倍的2.5倍处理速度。
Priority Processing发生了什么变化?
OpenAI于2026年7月30日将Priority Processing更名为Fast模式。使用service_tier: "priority"的现有请求仍然兼容,新请求可以使用service_tier: "fast"。
GPT-5.6长上下文定价何时适用?
当前的模型页面说明,包含超过272,000个输入Token的提示将对整个请求使用更高的输入和输出费率。开发人员在估算超大提示的成本时应考虑这一阈值。
哪种GPT-5.6模型最适合高吞吐量工作负载?
OpenAI将Luna定位为面向成本敏感、高吞吐量工作的模型。当Luna无法提供足够质量时,Terra是平衡的选择,而Sol则面向最困难的专业任务。
降价是否会降低ChatGPT和Codex的订阅费用?
不会。OpenAI表示订阅价格和配额预算保持不变。Terra和Luna现在在受支持的付费产品工作流中消耗更少的点数。
所有云提供商是否立即提供降价后的价格?
直接OpenAI API价格于7月30日发生变化。OpenAI表示AWS定价将于当天晚些时候开始推出,但第三方平台的价格和可用性可能有所不同,因此用户应核实提供商的当前费率表。
相关工具
- GPT-5.6 Sol:OpenAI面向复杂专业工作的旗舰GPT-5.6模型。
- GPT-5.6 Terra:平衡型GPT-5.6
适用于既需要智能又希望降低成本的负载的模型。
- GPT-5.6 Luna:面向高吞吐量、成本敏感型任务的最快且最经济的 GPT-5.6 模型。
- Responses API:OpenAI 用于推理、工具、多轮工作流和智能体应用的主要 API。
- Codex:OpenAI 基于 GPT-5.6 模型系列的智能体软件工程环境。
- OpenAI API Dashboard:管理 API 密钥、项目、用量、限额和计费的官方工作台。
相关链接
- 完整的 OpenAI API 定价:当前标准、批量、快速、缓存输入、缓存写入和长上下文 token 费率。
- 快速模式文档:更名服务层级的官方设置说明、兼容性详情和使用指南。
- GPT-5.6 模型指南:官方模型选择、迁移、推理、缓存和工作流建议。
- GPT-5.6 发布公告:原始模型系列发布、模型能力、初始价格、可用性和基准测试。
- GPT-5.6 效率工程:OpenAI 对效率提升背后模型和基础设施工作的说明。
- 提示缓存指南:关于自动和显式提示缓存的官方说明。
- OpenAI API 更新日志:价格更新、快速模式发布及其他 API 变更的带日期记录。
总结
OpenAI 在 7 月 30 日的更新中,将 GPT-5.6 Luna 的标准 API 价格下调了 80%,Terra 下调了 20%。Sol 的标准价格保持不变,而新的快速模式可将 API 响应速度提升至原来的 2.5 倍,token 费率则为原来的两倍。
本次公告围绕更广泛的性价比策略展开。OpenAI 表示,正在改进模型、推理栈、路由、上下文管理和智能体框架,以降低每个成功任务所需的时间、token 数或算力。
对于开发者而言,正确的选择并非简单地挑选最便宜的模型。Luna 面向高吞吐量执行,Terra 在成本与智能之间取得平衡,Sol 则负责最复杂的工作。混合模型路由、缓存、评估和每次成功成本衡量所带来的节省,可能远超单纯更换模型的效果。
核心变化在于,GPT-5.6 现在提供了更宽的工作区间:Luna 和 Terra 层级提供了更经济的日常智能,而在延迟表现值得更高成本时,可通过 Sol 获得更快速的尖端智能。
该 Markdown 文件是对官方文章的独立编辑性改编。它保留了主题、事实顺序和实际含义,但未逐字复制 OpenAI 的措辞或客户引述。



