简介
OpenAI 已对 GPT-5.6 系列做出重大价格调整。
自 2026 年 7 月 30 日起,该公司将 GPT-5.6 Luna 的 API 价格下调了 80%,将 GPT-5.6 Terra 的价格下调了 20%。旗舰模型 GPT-5.6 Sol 的标准价格保持不变,但 OpenAI 推出了 快速模式,其处理速度最高可达标准模式的 2.5 倍,同时保持相同的模型智能水平。
这一变化发布之际,OpenAI 刚刚公开了一份工程分析报告,展示了 GPT-5.6 Sol 如何帮助优化用于服务 GPT-5.6 自身的系统。据 OpenAI 称,生产级 GPU 内核的改进使端到端服务成本降低了 20%,而推测解码的改进使令牌生成效率提升了 15% 以上。
结果是,OpenAI 在所谓的 性价比前沿 上采取了更为激进的策略:将所使用的智能量与该任务的经济价值相匹配。

对于开发者而言,最重要的变化一目了然:Luna 现在对于高吞吐量的智能体工作负载来说价格大幅降低,Terra 的日常使用成本更低,而当延迟比价格更重要时,Sol 可以按更高的服务级别购买。
- Luna 降价 80%,Terra 降价 20%,Sol 推出快速模式
7 月 30 日的定价更新涵盖整个 GPT-5.6 系列,但各模型的调整幅度并不相同。
GPT-5.6 Luna:最大幅度降价
Luna 获得了最激进的降价。
其标准 API 价格从以下水平调整:
| 令牌类型 | 原价 | 新价 | 变化 |
|---|---|---|---|
| 输入 | 1.00 美元 / 100 万令牌 | 0.20 美元 / 100 万令牌 | -80% |
| 输出 | 6.00 美元 / 100 万令牌 | 1.20 美元 / 100 万令牌 | -80% |
OpenAI 将 Luna 描述为 GPT-5.6 系列中速度最快、价格最实惠的模型,并将其定位于对成本敏感的高吞吐量工作负载。
这包括以下任务:
- 分类
- 信息抽取
- 后台智能体
- 日常编码工作
- 测试生成
- 结构化输出工作流
- 使用工具的子智能体
- 大规模文档处理
更低的定价尤其改变了智能体循环的经济效益,因为一个用户请求可能涉及多次模型调用,而非单个简单的补全。
OpenAI 表示,Luna 能够使用工具并完成多步骤工作流,这使得将更多工作分配给成本更低的模型变得切实可行,而无需将智能体行为保留给价格更高的前沿级别。
GPT-5.6 Terra:较小但意义重大的降价
Terra 的标准 API 价格现为:
| 令牌类型 | 原价 | 新价 | 变化 |
|---|---|---|---|
| 输入 | 2.50 美元 / 100 万令牌 | 2.00 美元 / 100 万令牌 | -20% |
| 输出 | 15.00 美元 / 100 万令牌 | 12.00 美元 / 100 万令牌 | -20% |
Terra 仍然是 GPT-5.6 系列中的中端型号。
它专为需要比 Luna 更强的推理能力但又未必需要 Sol 更高成本的工作负载而设计。
典型应用包括:
- 日常企业智能体
- 编码辅助
- 工作区问答
- 文档分析
- 限定范围的研究
多步骤专业工作流
OpenAI 提到 Notion 是使用 Terra 处理个人代理工作负载的客户之一,例如对延迟敏感的工作区问答和限定范围任务。
GPT-5.6 Sol 保持标准价格不变
Sol 的标准 API 定价保持不变:
| Token 类型 | 标准价格 |
|---|---|
| 输入 | 5.00 美元 / 100 万 Token |
| 输出 | 30.00 美元 / 100 万 Token |
Sol 的变化并非降价。
相反,OpenAI 推出了 Fast 模式。
Sol Fast 模式:速度提升最高 2.5 倍
Fast 模式取代了 OpenAI 之前的“优先处理”术语。
对于 GPT-5.6 Sol,OpenAI 表示 Fast 模式的处理速度比标准处理快最高 2.5 倍,且模型智能水平不变。
代价是价格。
Fast 模式的成本是标准处理的两倍。
对于 Sol,这意味着:
| Token 类型 | 标准 | Fast 模式 |
|---|---|---|
| 输入 | 5.00 美元 / 100 万 | 10.00 美元 / 100 万 |
| 缓存输入 | 0.50 美元 / 100 万 | 1.00 美元 / 100 万 |
| 输出 | 30.00 美元 / 100 万 | 60.00 美元 / 100 万 |
现有的 API 请求使用:
service_tier="priority"
保持向后兼容,并路由至 Fast 模式。
OpenAI 还支持:
service_tier="fast"
作为更名后的服务标识。
当等待的成本高于更快推理的成本时,Fast 模式非常有用。
示例包括:
- 交互式编码代理
- 时间敏感的生产工作流
- 实时分析师辅助
- 高价值客户运营
- 延迟在多步骤中累积的复杂代理任务
一个需要调用 20 或 30 次模型的工作流,即使每次单独调用的延迟都不高,整体感受也可能比单次聊天响应慢得多。因此,在代理系统中,更快的处理速度可能产生不成比例的重要影响。
ChatGPT Work 和 Codex 的使用计量方式也有变化
Luna 和 Terra 更低的定价也反映在 ChatGPT Work 和 Codex 的用量计算方式上。
OpenAI 表示:
- 免费用户和 Go 用户可以使用 Terra。
- Plus、Pro、Business 和 Enterprise 用户可以选择 Terra 和 Luna。
- 订阅价格和配额预算保持不变。
- 由于 Luna 和 Terra 更便宜,现在使用它们消耗的积分更少。
这并不意味着付费订阅本身变得更便宜。
这一变化意味着,当用户选择 Luna 或 Terra 时,相同的配额可以使用更久。

性价比正成为更重要的模型衡量指标
OpenAI 发布了一张基于 Artificial Analysis Intelligence Index v4.1 的价格与智能对比图,用以说明 Luna 的新定位。
该图将 GPT-5.6 Luna 置于智能指数 50 分以上,同时显示价格调整后其中一个 Luna 配置的估算任务成本约为 0.05 美元。
此数据不应与任意单次 API 调用的价格混淆。
Artificial Analysis 根据模型 Token 使用量和基准测试的加权方法计算每个智能指数任务的成本。实际生产请求的成本取决于:
-
输入大小
-
输出大小
-
推理深度
-
提示缓存
-
工具调用次数
-
智能体运行轮数
-
长上下文计费
-
重试机制
在7月30日降价之前,Artificial Analysis 报告称,GPT-5.6 Luna 在最大推理配置下的智能指数约为51。
新的更低 token 价格使 Luna 进一步向“智能-成本”曲线的低成本端靠拢。
OpenAI 传达的更广泛信息是:企业不应在每个环节都使用最昂贵的模型。
一个工作流可能先用 Sol 来消除歧义并制定计划,再将定义明确的实施、测试或重复性工作分配给 Luna。
当较低层级的模型已具备使用工具和完成多步骤工作流的能力时,这种模型路由方式会变得更具吸引力。
- GPT-5.6 帮助优化了运行 GPT-5.6 的基础设施
此次降价的前一天,OpenAI 发布了一篇详细的技术文章,介绍 GPT-5.6 是如何变得更高效的。
该故事中最不寻常的一点是,GPT-5.6 Sol 本身参与了优化过程。
OpenAI 表示,其工程师通过 Codex 使用 Sol 来分析生产系统、编写性能代码、测试备选方案并监控实验。
该公司描述了三个主要层面的优化:
- 智能体工具套件
- API 与请求编排
- GPU 基础设施上的模型推理
Sol 帮助优化了生产环境的 GPU 内核
在推理层,OpenAI 表示 GPT-5.6 Sol 自主重写并优化了生产内核。
GPU 内核是负责在加速器硬件上高效执行数学运算的低层程序。
即使底层模型架构不变,低效的内存移动、同步、调度或数据布局也会导致昂贵的 GPU 资源得不到充分利用。
OpenAI 表示,Sol 帮助识别了以下可优化的计算类型:
- 可预计算的
- 可避免的
- 可并行化的
- 可重新排序的
- 可通过更高效的内核实现的
该公司特别提到了 Triton 和 Gluon 这两种 GPU 编程技术参与了这项工作。
据 OpenAI 称,内核改进及相关的服务优化使 GPT-5.6 的端到端服务成本降低了20%。
Sol 还改进了推测解码
另一项重要优化来自推测解码。
推测解码的简化版本如下:
- 一个较小的草稿模型预测几个可能的后续 token。
- 主模型并行评估这些候选 token。
- 被接受的 token 无需相同量的顺序生成工作即可输出。
因此,草稿模型的质量至关重要。
OpenAI 表示,GPT-5.6 Sol 针对推测模型的架构设计并运行了数百项实验,改动包括:
- 规模
- 结构
- 特征
- 训练配置
Sol 还会监控训练过程,并在出现硬件故障或训练不稳定性时进行干预。
OpenAI 表示,由此产生的改进使令牌生成效率提高了 15% 以上。

负载均衡同样重要
模型成本不仅仅取决于单块 GPU 内部运行的代码。
请求需要在以下层级之间进行路由:
- 区域
- 数据中心
- 加速器类型
- 集群
- 模型实例
- 模型子网络
- 计算核心
如果工作分配不合理,部分硬件闲置,那么即使加速器性能强劲,成本依然可能居高不下。
OpenAI 表示,Sol 帮助分析了生产流量,找出了负载不均衡的根源,测试了替代路由策略,并调整了用于分发请求的启发式规则。
这类运营层面的优化可以在不增加相应硬件投入的情况下提升整体吞吐量。
上下文管理减少重复计算
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
OpenAI 还优化了 Codex 和 ChatGPT Work 等系统所使用的智能体框架。
智能体在返回一个最终结果之前,可能需要多次调用模型和工具。
例如,Codex 可能会:
- 检查源代码。
- 搜索部署历史。
- 阅读事故报告。
- 编辑文件。
- 运行测试。
- 检查错误。
- 修改代码。
- 重新运行测试。
每一次循环都可能携带上下文、工具定义、先前结果和环境信息。
如果这些上下文不必要地增长,成本和延迟也会随之增加。
OpenAI 表示,其智能体框架采用了延迟发现等技术,只有在需要时才暴露工具、技能、插件和 MCP 集成。
工具输出默认限制为 10,000 个令牌,除非模型请求不同的限制。
这降低了大型工具结果不必要地填满上下文窗口的可能性。
只追加历史记录以保留提示缓存
智能体循环通常会多次复用相同的指令和上下文。
提示缓存可以避免重复计算稳定的提示前缀。
但只有当重复前缀保持完全一致时,缓存才有效。
OpenAI 表示,其框架保持模型可见历史的只追加特性:
- 新消息添加到末尾。
- 工具结果添加到末尾。
- 环境更新添加到末尾。
- 工具排序是确定性的。
- 运行时审批设置不在工具定义中处理。
这种设计提高了 Codex 和 ChatGPT Work 中提示缓存的复用率。
基本原则很简单:
模型更便宜,不仅因为其令牌成本更低,还因为周围的系统从一开始就避免了生成和处理不必要的令牌。
效率循环可以产生复合效应
OpenAI 将此描述为一个反馈循环。
更强的模型帮助工程师改进:
- GPU 内核
- 路由
- 推测解码
- 缓存
- 工作负载配置
- 智能体编排
这些改进降低了成本和延迟。
更高效率的基础设施又使得以更大规模运行更强的模型变得更加经济。
OpenAI 认为,这可以缩短从模型研发到大规模部署的周期,从而加速 AI 创新的迭代速度。
必须找到下一代优化收益。
7月30日Luna和Terra的价格下调是迄今为止最明显的面向客户的结果。
- 开发者反应:Luna获得更多关注,竞争对手面临新的价格压力
原始中文报告还强调了公告发布后开发者群体的热烈反响。
一些用户关注的是Luna降价幅度之大。
80%的降幅远大于前沿API中常见的渐进式价格调整。
另一些人则认为,Luna在降价之前就被低估了,尤其是对于智能体工作负载而言——在这些场景中,成本更低的模型可以在更强规划器的指导下处理常规执行任务。
这次定价调整也立即引发了与其他注重成本模型的对比,包括Kimi K3。
社区中流传的一个爆款梗图将这一情况描述为:Luna突然开始争夺那些被Kimi K3低价定位吸引的用户。
这个梗图很有趣,但它不是技术基准测试,因此未收录在正文图片中。
开发者立即质问Anthropic是否会回应
另一个常见的反应是@Anthropic,询问Claude API定价是否会相应调整。
这种反应反映了大模型前沿竞争格局的更广泛变化。
一年前,最显眼的竞争集中在:
- 基准测试分数
- 编码能力
- 上下文窗口
- 多模态功能
这些维度仍然重要。
但运行生产级智能体的开发者越来越关注:
- 每完成一个任务的成本
- 延迟
- 输出token使用量
- 提示缓存效率
- 工具调用次数
- 可靠性
- 模型路由灵活性
最便宜的token并不总是最便宜的工作流。
同样,最智能的模型也不一定是工作流中每一步的最佳模型。
Luna降价使模型路由更具吸引力
假设一个任务由五个阶段组成:
- 理解一个模糊的问题。
- 制定计划。
- 修改常规文件。
- 编写测试。
- 检查结果。
一个团队可能在阶段1和2使用Sol。
当工作被明确指定时,Luna可以处理阶段3到5。
Luna越便宜,将常规智能体工作从旗舰模型分流出去的动机就越强。
这并不意味着Luna在每项能力上都接近Sol。
这意味着较小模型的价值取决于它对于分配到的特定任务是否足够智能。
重要指标是每次成功结果的成本
OpenAI的新宣传口径反复强调每美元的成果。
这比只关注token价格更有用。
生产环境评估应跟踪:
- 任务成功率
- 输入token
- 输出token
- 缓存输入复用
- 模型轮次
- 工具调用
- 端到端延迟
- 重试率
- 人工修正时间
- 每个成功任务的总成本
一个每token成本只有五分之一模型,如果需要大量重试,仍然可能很昂贵。
一个更贵的模型如果能用更少的步骤完成工作,总体成本反而可能更低。
新的Luna定价使计算对较小模型更有利,但开发者仍然需要
针对特定工作负载的评估。
结论:模型竞争正转向智能与成本之比
7月29日和7月30日发生的事件表明,OpenAI正在同时推进两个相关的理念。
首先,GPT-5.6越来越多地被用于改进运行GPT-5.6自身的基础设施。
其次,该公司将这些效率提升的一部分转化为更低客户定价和更快的服务选项。
这改变了竞争格局。
模型市场的下一阶段不仅仅是:
哪个模型最聪明?
还包括:
开发者每花一美元、每等待一秒延迟,能买到多少有用的智能?
Luna降价80%让这个问题尤为突出。
Terra对日常专业工作来说变得更便宜。
Sol仍然是高端模型,但Fast模式让开发者可以在时间紧迫时支付更多费用以获得更快速度。
随着模型质量在更多任务上趋于接近,那些能让相同硬件完成更多有用工作——并将这些效率提升转化为更优定价的公司——可能会获得日益重要的竞争优势。
常见问题
新的GPT-5.6 Luna API价格是多少?
自2026年7月30日起,OpenAI将GPT-5.6 Luna在标准处理模式下的定价列为每百万输入token 0.20美元、每百万输出token 1.20美元。这比最初每百万token 1美元/6美元的定价降低了80%。
新的GPT-5.6 Terra价格是多少?
GPT-5.6 Terra目前在标准处理模式下的定价为每百万输入token 2美元、每百万输出token 12美元。OpenAI表示,这比之前的每百万token 2.50美元/15美元定价降低了20%。
GPT-5.6 Sol降价了吗?
没有。Sol的标准API价格仍然是每百万输入token 5美元、每百万输出token 30美元。主要变化是引入了Fast模式。
什么是GPT-5.6 Sol Fast模式?
Fast模式是OpenAI更快的API处理层级,取代了之前的Priority Processing(优先处理)名称。对于GPT-5.6 Sol,OpenAI表示,在标准token价格两倍的情况下,它可以将处理速度提升至标准模式的2.5倍,同时不改变模型的智能水平。
旧的Priority Processing API请求仍然有效吗?
是的。OpenAI表示,使用priority服务层级的请求仍然向后兼容,并会自动使用Fast模式。开发者也可以使用fast服务层级值。
GPT-5.6真的帮助优化了自身吗?
OpenAI表示,在人工主导的工程流程中通过Codex使用的GPT-5.6 Sol,帮助分析了生产流量、重写了GPU内核、运行了数百次投机解码实验,并监控了训练过程。OpenAI将端到端服务成本降低20%和token生成效率提升15%以上的部分成果归功于这些工作。
降价会改变ChatGPT订阅吗?
订阅价格和配额预算不会改变。OpenAI表示,由于底层价格更低,Luna和Terra现在在Codex和ChatGPT Work中消耗的积分更少。
Luna现在是所有智能体工作负载的最佳模型吗?
不是。Luna便宜得多,但模型选择仍然取决于任务难度和可接受的错误率。常见的策略是:对模糊的规划任务使用更强的模型,对定义明确的执行任务使用更便宜的模型。
相关工具
- [OpenAI
API:OpenAI 的开发者平台,用于访问 GPT-5.6 模型和 API 服务。
- GPT-5.6 Sol:旗舰 GPT-5.6 模型的官方规格说明。
- GPT-5.6 Terra:均衡型 GPT-5.6 层级的官方模型文档。
- GPT-5.6 Luna:成本敏感型 GPT-5.6 层级的官方文档。
- Codex:OpenAI 的智能体编码环境,部分 GPT-5.6 优化工作中使用了该环境。
- Artificial Analysis:一个独立的模型分析平台,涵盖智能水平、速度、令牌使用和单任务成本。
相关链接
- OpenAI:借助 GPT-5.6 推进性价比前沿:OpenAI 于 7 月 30 日发布的关于 Luna 和 Terra 降价以及 Sol Fast 模式的官方公告。
- OpenAI:GPT-5.6 如何融合前沿智能与前沿效率:关于负载均衡、GPU 内核、推测解码、上下文管理和提示缓存的工程细节。
- OpenAI Fast 模式:关于更快 API 处理和 Fast 模式定价的官方文档。
- OpenAI GPT-5.6 发布:GPT-5.6 家族的原始全面可用性公告和基准测试背景。
- Artificial Analysis:GPT-5.6 基准测试:在 7 月 30 日降价之前对 GPT-5.6 智能水平、编码性能、速度和成本的独立分析。
- Artificial Analysis GPT-5.6 Luna:Luna 的模型级方法论和智能指数详细信息。
- OpenAI 模型目录:官方 API 模型目录和当前模型规格。
总结
OpenAI 已将 GPT-5.6 Luna API 价格下调 80%,Terra 下调 20%,同时保持 Sol Standard 价格不变。Sol 反而新增了 Fast 模式,该模式可将 API 处理速度提升最高 2.5 倍,但价格为 Standard 的两倍。
这一时间点与 OpenAI 近期的工程工作密切相关。该公司表示,GPT-5.6 Sol 帮助优化了 GPU 内核、推测解码、负载均衡和智能体基础设施,使端到端服务成本降低了 20%,并在部分技术栈中实现了超过 15% 的令牌生成效率提升。
对开发者而言,结果是性价比范围更广:Sol 用于最困难的任务,Terra 用于均衡的专业任务,Luna 则以更低价格用于大规模智能体执行。
GPT-5.6 的更新表明,前沿模型的竞争越来越聚焦于每个成功结果的成本——而不仅仅是原始基准智能水平。



