引言
OpenAI正在同时从两个方面进行变革。
首先,ChatGPT的前端经历了一次重大优化,专门针对那些在数百次工具调用后变得难以打开和导航的长对话。来源文章报道,一次包含741轮对话和231 MB数据的测试会话,打开时间从27.62秒缩短到了1.66秒。
其次,Codex已经转向更加自动化的多智能体工作流,采用GPT-5.6多智能体V2。不再要求用户为每个子任务手动选择最佳模型,主智能体可以将不同的工作部分委派给不同的模型,并独立设置推理强度。
OpenAI官方的GPT-5.6文档确认了更广泛的架构:GPT-5.6包含Sol、Terra和Luna,其Codex/API体验支持并行子智能体和综合处理复杂工作。
其结果是一个简单但影响深远的理念:
该系统正在尝试消除用户通常需要自行管理的等待时间和模型选择工作。
ChatGPT打开大型对话的速度大幅提升
在智能体时代,长对话正成为一个截然不同的问题。
普通的聊天机器人对话可能包含几十轮。而智能体会话很容易变得更大,因为模型可能读取代码、调用工具、检查结果、运行测试、进行修改,并重复这一过程数百次。
来源文章称,OpenAI测试了一个包含741轮对话、重达231 MB的会话来衡量新前端的行为表现。
结果非常显著:
| 指标 | 优化前 | 优化后 |
|---|---|---|
| 对话打开时间 | 27.62秒 | 1.66秒 |
| 内存增长 | 1030.7 MiB | 606 MiB |
| 网络请求数 | 894 | 16 |
| 加载的对话条目 | 15,529 | 64 |
根据来源文章,主要的性能变化包括:
- 应用加载速度提升94%
- 堆内存增长降低87.8%
- 整体内存使用降低41.2%
- 网络请求减少98.2%
- 加载的对话条目减少99.6%
这一重要变化是架构层面的,而非表面修饰。
ChatGPT不再需要每次用户打开时加载和渲染整个历史对话。
取而代之的是,大部分历史记录可以继续存储,只有当前需要的部分才会被加载到界面中。
为什么这在智能体时代更为重要
对于传统的聊天机器人来说,超长对话主要是一个存储问题。
而对于智能体来说,它变成了一个工作流问题。
一次编码会话可能涉及:
- 读取大型代码库。
- 运行命令。
- 检查输出结果。
- 编辑文件。
- 运行测试。
- 修复失败。
- 重复该循环。
一个任务可能轻易产生数百条交互记录。
这意味着对话界面本身也成为了智能体基础设施的一部分。
来源文章将新的渲染策略描述为:仅加载用户需要看到的那部分历史记录,而不是重建整个会话。
这就是为什么一年前看起来微不足道的前端优化,如今却能产生巨大影响的原因。
现在的不同之处。
结果:长时间会话感觉轻快多了
最明显的好处很简单。
一个持续了数周或数月的对话,打开时不应该让人感觉应用程序正在浏览器中重建整个数据库。
原文指出,这些变化对于经常执行数百次工具调用的重度 Codex 用户来说尤其明显。
用户无需等待庞大的会话变得可交互,而是可以快速回到对话中继续工作。
这是一种基础设施层面的改进,当它运行良好时,用户可能几乎察觉不到。
这也正是关键所在。
最好的前端优化往往是那种融入产品体验、让人浑然不觉的优化。
GPT-5.6 多智能体 V2 迈向自动模型选择
几乎在同一时间,OpenAI 也扩展了其多智能体工作流。
原文报道称,GPT-5.6 多智能体 V2 已全面可用,允许主智能体将子任务委派给不同的受支持模型。
每个子智能体可以有自己的推理强度。
OpenAI 官方的 GPT-5.6 文档独立确认该系列包含三个能力层级:
- GPT-5.6 Sol — 面向最难任务的主力模型。
- GPT-5.6 Terra — 适合日常工作的均衡模型。
- GPT-5.6 Luna — 最快且最具成本效益的模型。
OpenAI 还将多智能体记录为 Responses API 中的一项测试功能,其中一个 GPT-5.6 实例可以并行协调多个子智能体并综合它们的结果。
这就是新工作流背后的核心理念。
用户不一定需要知道对于大型任务的每个小部分来说哪个模型最合适。
智能体可以自行决定。
模型阵容为不同任务而设计
原文大致如下展示了模型阵容:
| 模型 | 典型角色 |
|---|---|
| GPT-5.6 Sol | 复杂的智能体编码和最难的推理任务 |
| GPT-5.6 Terra | 日常编程和均衡的工作负载 |
| GPT-5.6 Luna | 快速、低成本的子任务 |
| Daybreak | 网络安全重点任务 |
| GPT-5.5 | 复杂编码、研究和一般任务 |
OpenAI 官方的公开文档确认了前三个 GPT-5.6 层级,并强调了它们不同的能力和成本特性。
例如,OpenAI 目前将 Luna 描述为其针对成本敏感、高吞吐量工作负载而优化的模型,当前模型页面上公开的 API 价格为每百万输入令牌 1 美元、每百万输出令牌 6 美元。
这就形成了自然的任务分工。
困难的架构决策可以交给更强的模型。
常规的代码转换可以交给更便宜的模型。
小型的分类或查找步骤可以使用最快的选项。
从手动选模型到自动路由
原文将此描述为从手动模型选择转变的过程。
如今,用户经常这样思考:
“这部分很难,所以我应该用最强的模型。”
然后他们在任务的下一部分重复同样的决定。
而多智能体系统可以将模型视为内部计算资源。
主智能体将工作分解为更小的单元,决定
模型应处理每个单元,然后合并结果。
简化的工作流程如下:
用户任务
↓
主代理
├── 复杂规划 → GPT-5.6 Sol
├── 常规编码 → GPT-5.6 Terra
├── 快速子任务 → GPT-5.6 Luna
└── 专业任务 → 专用模型
↓
结果合成
↓
最终响应
OpenAI 官方文档明确描述了这种并行子代理模式:一个 GPT-5.6 实例可以协调多个并行工作的代理,并将输出合成为单一结果。
为什么这可以降低推理成本
源文章提出了一个简单的经济学观察。
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
复杂任务并不需要每个步骤都使用最强的模型。
也许只有规划、架构或困难调试阶段才需要最强大的模型。
其他步骤可以由较便宜的模型处理。
在源文章的示例中,工作流程中可能只有约 20% 需要最强模型,其余部分委托给低成本模型。
这精确的 20% 应被视为经验法则的说明,而非 OpenAI 的保证。
其背后的核心思想仍然重要。
如果代理可以根据难度自动路由工作,复杂任务的平均完成成本就可以下降,而无需用户手动精细管理路由。
开发者不再需要考虑每个模型
这带来的用户体验变化与经济层面的变化同等重要。
手动选择模型是一种认知负担。
开发者必须问:
- 我应该使用哪个模型?
- 这个任务值得用昂贵的模型吗?
- 我应该在过程中途切换模型吗?
- 较便宜的模型是否损失了太多质量?
- 节省的时间是否值得额外的成本?
在良好的多代理系统中,这些问题大部分被转移到系统本身。
用户提供目标。
代理决定如何分配工作。
这是从模型选择到资源编排的有意义转变。
两者结合大于单一功能的简单相加
源文章最有力的论点是这两种变化相互强化。
前端经过优化,可以更高效地处理庞大的代理历史记录。
与此同时,后端代理系统在跨模型拆分工作方面变得更加有能力。
这为 OpenAI 提供了两种减少摩擦的方式:
减少等待界面的秒数。
减少选择使用哪个模型的决策。
第一个是性能改进。
第二个是工作流程改进。
两者结合,使 ChatGPT 和 Codex 进一步远离简单聊天界面的定位。
ChatGPT 正在向工作流平台迈进
OpenAI 官方 GPT-5.6 公告已经将该系列描述为能够协调工具、处理中间结果并支持多代理工作流。它还引入了 Codex 中
将工作委派给其他模型,并行运行任务,并综合各项结果。
用户越来越成为那个定义目标并检查成果的人。
内部编排在幕后进行。
“不选择模型”的理念才是真正的产品变革
人们很容易把注意力集中在基准测试的数字上。
但更重要的产品决策可能是尝试向用户隐藏模型的复杂性。
随着模型数量的增长,直接暴露每一个选择可能会让系统更难使用。
如果 OpenAI 有五到十个专门模型,用户不应为了完成一个项目而必须全部了解它们。
一个成熟的智能体平台理应当理解这一点:
任务是界面,而不是模型。
用户说出需要做什么。
系统决定需要多少推理,哪个模型应做哪个部分,以及如何组合结果。
这对开发者意味着什么
对于构建 AI 产品的开发者来说,这一教训比 OpenAI 本身更具普遍性。
现代智能体架构越来越需要三个层次:
- 任务分解——将大型工作拆分为有意义的子任务。
- 模型路由——为每个子任务选择最便宜且能胜任的模型。
- 结果综合——将部分输出合并为一个连贯的结果。
在此基础上,前端需要处理比传统聊天产品设计所面向的更大的会话历史。
如果你正在构建智能体产品,对话渲染不再只是 UI 打磨。
它是基础设施。
常见问题
什么是 GPT-5.6 多智能体?
GPT-5.6 多智能体是一种智能体编排能力,其中一个 GPT-5.6 实例可以并行协调多个子智能体并综合它们的工作。OpenAI 目前将该能力记录为 Responses API 中的一项测试功能。
Codex 中的 Multi-agent V2 是什么?
源文章将 Multi-agent V2 描述为一种 Codex 工作流,其中主智能体可以将不同的子任务委派给支持的模型,并控制每个子智能体的推理强度。具体推出时间和模型可用性可能会发生变化,因此应查看当前的 OpenAI Codex 文档以获取最新配置。
什么是 GPT-5.6 Sol、Terra 和 Luna?
它们是 GPT-5.6 系列中的三个能力层级。OpenAI 将 Sol 描述为旗舰型号,Terra 为均衡选项,Luna 为最快且最具成本效益的模型。
GPT-5.6 Luna 用于什么?
OpenAI 将 GPT-5.6 Luna 定位用于对成本敏感、高吞吐量的工作负载。其当前 API 页面列出每百万输入 token 1 美元,每百万输出 token 6 美元。
为什么 ChatGPT 的长对话性能得到了改进?
智能体会话可能比普通聊天大得多,因为它们可能包含数百次工具调用、执行结果和中间步骤。源文章报道称,OpenAI 改变了大型历史记录的加载和渲染方式,使应用程序无需每次处理整个对话。
ChatGPT 现在会自动为每个任务选择最佳模型吗?
更广泛的趋势是走向自动模型路由和委派,但可用性取决于产品和模型推出进展。
功能说明。OpenAI的GPT-5.6文档确认了多智能体编排和不同的GPT-5.6能力层级;这并不意味着每次标准ChatGPT对话都会暴露完整的自动路由控制。
多智能体执行能降低AI成本吗?
可以。如果困难的子任务使用更强的模型,而常规工作交给更便宜的模型,整个工作流的平均成本可能低于每一步都使用最强模型。实际节省取决于路由策略和工作负载。
相关工具
- OpenAI Codex:OpenAI的编程代理,用于多步骤软件开发与代理式工作流。
- OpenAI API:用于GPT-5.6和多智能体应用开发的官方API平台。
- GPT-5.6模型:Sol、Terra、Luna及相关能力的官方模型文档。
- Responses API:OpenAI的API接口,支持工具调用、程序化调用和多智能体工作流。
- ChatGPT:OpenAI的消费者和企业AI工作空间。
相关链接
- GPT-5.6官方公告:OpenAI关于GPT-5.6的主要发布页面,包括多智能体和超级能力。
- GPT-5.6模型指南:面向开发者的官方模型能力与多智能体使用文档。
- GPT-5.6 Luna:低成本GPT-5.6层级的当前API定价和技术详情。
- ChatGPT中的GPT-5.6:当前ChatGPT可用性和套餐信息。
- OpenAI Codex:关于Codex和代理式编程的官方产品信息。
- OpenAI API文档:使用OpenAI模型构建的主要文档中心。
总结
OpenAI的最新变更针对随着AI代理越来越强大而日益重要的两种摩擦。第一种是等待:包含数百轮对话和工具调用的大型对话也应该快速打开。第二种是决策开销:用户不应为每个子任务手动选择模型。
GPT-5.6的多智能体架构指向一个模型路由系统,其中更强的模型可以规划和委派,而更便宜的模型处理常规工作。与此同时,前端优化使那些更长的代理会话更易于使用。
方向很明确:ChatGPT和Codex正在从用户与模型对话的地方,演变为决定工作应如何执行的系统。



