GPT-6 Astra 深度解析:智能体工作流、基准测试、定价及与 Claude Fable 5.1 的对比

OpenAI 于 2026 年 9 月 3 日推出 GPT-6 Astra,而在北京时间已经是 9 月 4 日。OpenAI 称其为迄今为止智能程度最高且对齐程度最好的模型,并将其定位为面向计算机操作、浏览、软件工程、网络安全、科学研究和专业工作流等复杂端到端任务的模型。
这一定位很重要,因为 Astra 不应被简单理解为一个普通的下一代聊天机器人。
它最明显的改进集中在这样的任务中:模型必须跨越多个步骤持续工作,包括检查环境、使用工具、修改计划、处理失败、操作软件,并最终交付完整结果,而不是只提供一个答案。
原文将这一变化描述为“原生智能体时代”的开始。这个方向具有一定参考价值,但实际实现比“整个智能体执行框架都已经被移入模型权重”这一说法更加复杂。
OpenAI 自己的文档描述了两个协作层:
换句话说,Astra 的智能体能力明显更强,但应用仍然需要围绕模型搭建执行环境。

本文保留原文的五部分结构,从以下五个角度分析 Astra:

在查看基准测试数据之前,首先需要将模型与周边产品技术栈区分开来。
一个传统语言模型工作流很容易理解:
用户提示
→ 模型推理
→ 模型响应
对于更复杂的智能体,周边应用通常还需要增加一层:
用户目标
→ 智能体执行框架
→ 模型
→ 工具调用
→ 环境结果
→ 模型
→ 下一步行动
→ 最终结果
外部执行框架负责决定如何提供工具、如何返回结果、如何延续上下文、适用哪些权限,以及何时应该停止循环。
OpenAI 仍然采用这种架构。事实上,OpenAI 曾单独介绍过 Codex/ChatGPT Work 的智能体执行框架,将其描述为连接模型、工具和用户环境的 Rust 编排层。
Astra 针对能够让执行框架发挥作用的行为进行了更深入的训练。
OpenAI 的模型指南重点强调了以下能力:
因此,这种差异更适合被描述为模型与执行框架的协同设计,而不是“执行框架消失并进入了模型”。
实际目标已经不再只是:
Astra 主要面向更复杂的执行型工作负载,例如:
OpenAI 的发布材料反复强调的是端到端工作,而不是更好的人格化对话体验。
可以这样理解这一代际变化:
更早期的以模型为中心的工作流:
强推理能力 + 外部编排
GPT-6 Astra 工作流:
更强的智能体训练推理能力 + 为发挥该能力而设计的外部编排
第二种系统之所以能力更强,是因为模型本身更擅长规划、利用反馈、操作工具、委派工作,并在长时间任务轨迹中保持连贯性。

原文最有价值的观点之一是:不应将 Astra 理解为自动替代所有工作负载中的每一个更便宜模型。
Astra 最大的优势出现在困难的智能体任务和专业任务中。
下表在可获得数据的情况下,采用 OpenAI 官方 GPT-6 Astra 发布对比中的数值。
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | 测试内容 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | 新颖交互环境与抽象规则发现 |
| FrontierMath Tier 4(v2) | 97.6% | 83.0% | 研究级数学 |
| ExploitBench | 100.0% | 78.5% | 评估环境中的已知漏洞利用开发 |
| ExploitBench,2026 年 6 月至 8 月 | 39.0% | 5.5% | 模型知识截止日期之后出现的最新漏洞 |
| AutomationBench | 41.4% | 18.1% | 多步骤专业自动化 |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 使用代码和终端工具完成科学工作流 |
| BenchCAD | 95.9% | 83.3% | 根据多视角渲染图进行 CAD 重建 |
| Agents’ Last Exam | 59.3% | 53.6% | 复杂专业计算机操作任务 |
| 发布时的 Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 综合独立智能指数 |
阅读这张表时,有几个细节值得注意。
首先,OpenAI 在标题性文字中将 FrontierMath Tier 4 四舍五入为 98%,而基准测试表针对 v2 评估给出的数值是 97.6%。
其次,ARC-AGI-3 的惊人结果来自一项智能体风格的交互式基准测试。OpenAI 说明,Astra 使用其 Responses API 执行框架运行,而且评估设置可能不同于生产环境中的 ChatGPT。
第三,网络安全得分是在受控评估条件下测得的。根据其 Preparedness Framework,OpenAI 目前将 Astra 归类为达到 Critical(关键) 网络安全能力阈值的模型,并围绕这些能力部署了更强的安全防护措施。
ARC-AGI-3 是最清晰的例子。
在 OpenAI 发布的评估中,Astra 得分为 99.9%,而 GPT-5.6 Sol 为 7.8%。这项基准测试要求系统通过交互推断目标和规则,而不是仅仅根据静态提示提供答案。
这一模式也出现在多个操作型基准测试中:
这正是为什么在智能体工作流中,Astra 给人的代际跃升感可能远大于普通聊天场景。
在发布时的 Artificial Analysis Intelligence Index v4.1.1 中,OpenAI 报告的数据为:
GPT-6 Astra:61.2
GPT-5.6 Sol:60.9
Claude Fable 5.1:65.7
与 ARC-AGI-3 或 Terminal-Bench Science 上的差距相比,Astra 与 Sol 在这一综合指数上的差距非常小。
Artificial Analysis 后来已经升级到采用不同基准测试组合的 v4.2,因此绝对数值发生了变化。更广泛的结论仍然成立:Astra 的突出优势并不是所有通用智能指标都突然翻倍。
OpenAI 对 GPT-6 Astra 的标准 API 定价如下:
| 令牌类型 | 每 100 万令牌价格 |
|---|---|
| 输入 | $10.00 |
| 缓存输入 | $1.00 |
| 缓存写入 | $12.50 |
| 输出 | $50.00 |
GPT-5.6 Sol 当前价格更低,为每百万输入令牌 4 美元、每百万输出令牌 20 美元。
因此,只有当更高的任务完成率能够抵消更高的令牌价格时,Astra 才最有意义。
长上下文定价还有一个细节:根据当前 Astra 模型页面的说明,输入令牌超过 272K 的请求,其完整请求都会按照更高费率计费——输入和缓存费率为 2 倍,输出费率为 1.5 倍。
原文将 GPT-4o 作为低成本通用选项。GPT-4o 仍然存在于 API 目录中,但 OpenAI 当前的模型指南已经建议,大多数新集成优先考虑更新的 GPT-5.6 家族模型。
更符合当前情况的选择指南是:
| 场景 | 推荐起点 | 原因 |
|---|---|---|
| 高调用量、成本敏感型通用任务 | GPT-5.6 Luna 或 Terra | 成本更低,足以满足许多常规工作负载的能力要求 |
| 专业推理与编码 | GPT-5.6 Sol | 以低于 Astra 的价格提供较强的专业表现 |
| 困难的端到端工作流、计算机操作、科学任务、高级智能体工作 | GPT-6 Astra | 更适合困难的多步骤执行和工具密集型任务 |
| 旧版 GPT-4o 集成 | 适当情况下可以继续使用 GPT-4o | 仍然可用,但不是新前沿工作流的默认推荐选项 |
实际规则很简单:
从能够可靠完成任务的最便宜模型开始。当任务成功率、自主性或执行质量比原始令牌价格更重要时,再升级到 Astra。

原文将 OpenAI 和 Anthropic 描述为采取完全不同的路线。
这种侧重点上的差异确实存在,但当前产品之间的重叠程度比这一表述所暗示的更高。
Claude Fable 5.1 同样明确面向长时间运行的智能体、编码、浏览器操作、企业工作流和托管式智能体执行。Astra 也同样是一款拥有 100 万级上下文的多模态模型,并具备较强的通用推理能力。
因此,更准确的比较方式不是“一个是智能体,另一个不是”。
真正应该比较的是:目前每个系统在哪些方面展现出更强的证据,以及产品侧重点分别在哪里。
以下数据来自 OpenAI 的发布对比表,除非另有说明。
| 基准测试 | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | 能力维度 |
|---|---|---|---|---|
| ARC-AGI-3 | 99.9% | — | 30.2% | 交互式抽象推理 |
| FrontierMath Tier 4(v2) | 97.6% | 87.8% | 73.2% | 高级数学 |
| ExploitBench | 100.0% | — | 70.0% | 网络安全评估 |
| AutomationBench | 41.4% | 31.4% | 26.9% | 专业自动化 |
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | 30.0% | 科学工作流 |
| BenchCAD | 95.9% | 84.3% | 82.1% | 工程/CAD |
| Agents’ Last Exam | 59.3% | — | 55.5% | 专业计算机操作任务 |
| Astra 发布时的 Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 65.7 | 63.1 | 综合独立指数 |
破折号并不意味着模型不具备相应能力,而是表示 OpenAI 的对比表没有公布该项的直接可比得分。
Anthropic 将 Claude Fable 5.1 定位为其面向普遍用户提供的、最适合高难度编码和知识工作的模型。
其官方产品页面强调了以下能力:
Fable 5.1 还在发布时的 Artificial Analysis v4.1.1 综合指数中领先,并且在当前独立排行榜上仍然是表现最强的模型之一。
因此,将 Claude 简化为“仍然需要外部执行框架的聊天模型”是不准确的。与 Astra 一样,它也参与智能体技术栈;模型本身和周边执行环境都很重要。
Astra 在以下方面的发布证据尤其强:
OpenAI 还围绕 Astra 引入了异步工具调用和回合中途指令调整等面向智能体的 API 功能,并说明当执行框架提供协作工具时,Astra 可以拆分工作并委派给子智能体。
当任务重点不是产出一个精心润色的答案,而是跨越多个工具和环境完成一项困难工作流时,Astra 会特别有吸引力。
原文将 Astra 的长上下文和多模态能力描述为“标准水平”,并认为 Claude 在这方面更强。
但按照当前规格,这一结论过于笼统。
GPT-6 Astra 支持:
Claude Fable 5.1 同样支持约 100 万级上下文、图像输入、文件/PDF 理解、编码、浏览器操作和长时间运行的智能体工作流。
因此,正确的决策应当基于确切的工作负载和评估结果,而不能只看上下文窗口大小。
当你的工作负载主要包括以下内容时,可以优先选择 Claude Fable 5.1:
当你的工作负载主要包括以下内容时,可以优先选择 GPT-6 Astra:
对于重要的生产系统,应当先使用具有代表性的自有任务对两个模型进行基准测试,再确定标准模型。

输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
原文主要将 Astra 的提升归因于架构,而不是参数量。
OpenAI 并未披露 Astra 的参数量,因此无法直接验证模型规模在其中所起的作用。
OpenAI 已经公开说明的是模型训练、推理改进和智能体执行框架设计的组合。
这是需要对原文进行最大修正的地方。
OpenAI 并没有表示整个智能体执行框架已经被字面意义上嵌入 Astra 的模型权重中。
OpenAI 单独将其智能体执行框架描述为连接模型、工具和用户环境的编排层。同时,OpenAI 也表示,Astra 经过训练,能够在这类系统中更有效地执行多步骤工作。
实际架构更接近于:
用户目标
↓
智能体执行框架 / Responses API
↓
GPT-6 Astra
↓
工具请求或委派的子任务
↓
应用程序 / 工具执行工作
↓
结果返回给 Astra
↓
Astra 更新计划
↓
持续执行直至完成
这一差异对开发者很重要,因为应用仍然需要负责以下关键事项:
更强的模型可以减少你需要编写的脆弱提示词和编排逻辑,但不会消除系统工程的必要性。
OpenAI 表示,GPT-6 Astra 经过训练,可以拆分工作,并将任务委派给能够并行运行的子智能体。
不过,官方指南也明确说明:这发生在你通过自己的执行框架实现多智能体系统,并为其提供协作工具时。
这意味着 Astra 可以表现出类似项目经理的行为:
复杂目标
→ 拆分为相互独立的工作流
→ 并行委派
→ 收集结果
→ 解决依赖关系
→ 继续主任务
但这些子智能体的实际创建、执行环境和通信渠道,仍然来自周边智能体系统。
Astra 最强的结果往往来自这类基准测试:模型可以与环境交互并观察结果。
一个稳健的智能体循环如下:
规划
→ 行动
→ 观察结果
→ 判断是否成功
→ 修改计划
→ 再次行动
这与一次性文本生成有本质区别。
模型可以利用工具返回的结果来决定是否继续、重试、改变策略,或者向用户请求澄清。
OpenAI 当前的 Responses API 功能进一步强化了这种工作方式,包括:
长时间运行的智能体任务会带来上下文管理问题。
每一个工具结果、文件、推理分支和此前的行动,都可能增加更多历史记录。如果系统只是不断重放所有内容,上下文就会变得昂贵且嘈杂。
Astra 拥有 105 万令牌的上下文窗口,但 OpenAI 也为长时间运行的 Responses API 对话提供了显式的上下文压缩功能。
有用的工作模式是:
庞大的任务历史
→ 保留重要的近期状态
→ 压缩较早的信息
→ 保留继续任务所需的事实
→ 继续工作
压缩并不是神奇的记忆功能。开发者仍然应该将持久化的项目状态保存在代码仓库、数据库、文档或其他存储中,而不是依赖一个无限增长的对话。
Astra 的新 API 能力之一是异步工具调用。
当应用程序仍在运行某个工具时,模型可以继续推理、调用其他工具,或回答任务中相互独立的部分。工具完成后,应用程序再使用原始调用标识符将结果发送回去。
在某个工具运行速度较慢的工作流中,这可以减少不必要的等待时间。
这也说明,智能体能力的跃升是系统层面的改进,而不只是神经网络规模变大。
更高程度的自主执行会增加错误的代价。
因此,OpenAI 为 Astra 配备了更强的安全防护和不对齐行为监测。其安全材料称,Astra 是 OpenAI 首个被归类为达到 Critical(关键)网络安全能力阈值的模型。
OpenAI 还报告称,在用于衡量模型是否超出授权任务边界的测试中,Astra 的行为有所改善。
对于开发者而言,这意味着架构应当包括:
更强的智能体模型会让这些控制变得更加重要,而不是相反。
核心结论: Astra 的跃升最好理解为更强的智能体训练模型行为与更强大的执行技术栈共同作用的结果。推理与执行之间的协调更加紧密,但执行框架、工具、权限和环境仍然是相互独立的工程层。
在以下工作中,Astra 是一个强有力的选项:
这些正是 OpenAI 已发布的评估中,Astra 与 GPT-5.6 Sol 差距最明显的领域。
以下场景通常不需要 Astra:
对于这些场景,GPT-5.6 Terra 或 Luna 可以作为更经济的起点,而 Sol 仍然是强大的专业默认选项。
Astra 的令牌定价为输入 10 美元、输出 50 美元,明显高于 GPT-5.6 Sol 的输入 4 美元、输出 20 美元。
但在智能体工作流中,选择令牌价格最低的模型并不总是最便宜的方案。
价格较低的模型可能需要:
OpenAI 表示,在若干发布评估中,Astra 使用更少的输出令牌取得了更强的结果;尽管其单令牌价格更高,但按每个已完成基准测试任务估算的 API 成本有时反而更低。
这才是评估生产环境智能体模型的正确方式:
成功完成一项任务的总成本
= 模型令牌成本
+ 工具成本
+ 重试成本
+ 延迟成本
+ 人工审核成本
+ 失败成本
原文指出的更大趋势具有说服力。
多年来,前沿模型的比较重点主要集中在:
这些因素仍然重要。
但下一阶段越来越关注以下问题:
Astra 是这一变化最清晰的例子之一。
这是最重要的工程结论。
一个模型可以具备很强的智能体能力,同时仍然需要执行框架。
事实上,模型越擅长执行复杂任务,设计良好的执行框架就越有价值,因为它能够提供:
因此,开发者不应因为 Astra 更擅长智能体任务,就停止学习智能体工程。
相反,他们更应该深入学习这一领域。
GPT-6 Astra 不应被视为全面替代方案,也不应因为它与其他前沿模型的综合得分接近,就被低估。
当任务是一个工作流而不是一个提示词时,Astra 的价值最为突出。
如果你的应用主要需要简短回答,那么更便宜的模型可能是更好的工程选择。
如果你的应用需要一个 AI 系统跨越多个步骤进行检查、决策、行动、验证、恢复并持续推进,那么 Astra 就更值得关注。
这才是真正的代际信号。
GPT-6 Astra 是 OpenAI 当前面向困难端到端工作的旗舰模型。OpenAI 将其定位为适用于复杂推理、编码、计算机操作、研究、专业工作流和工具密集型智能体任务的模型。
与其说整个智能体执行框架都存在于模型内部,不如将 Astra 称为一款面向智能体优化的模型。Astra 经过训练,能够处理多步骤工作、使用工具并委派子智能体,而 Codex、ChatGPT Work 或你自己的应用仍然提供外部执行框架、工具、权限和执行环境。
API 模型 ID 是 gpt-6-astra。OpenAI 当前通过 Responses API 和 Chat Completions 提供该模型,但围绕 Astra 的工具调用文档主要集中在 Responses API 上。
标准 API 定价为每百万输入令牌 10 美元、每百万输出令牌 50 美元。缓存输入为每百万令牌 1 美元,缓存写入为每百万令牌 12.50 美元;根据当前定价规则,输入超过 272K 令牌的请求将采用更高的长上下文费率。
在 ARC-AGI-3、AutomationBench、Terminal-Bench Science 和最新网络安全任务等多个已发布的智能体与环境交互评估中,Astra 明显更强。Sol 的价格仍然低得多;如果不需要 Astra 级别的任务执行能力,Sol 仍然是通用专业推理和编码的强力选择。
两者都是面向复杂、长时间运行工作的前沿模型。Astra 目前在 OpenAI 公布的计算机操作、自动化、科学、CAD 和网络安全对比中表现尤其突出;Claude Fable 5.1 在编码和知识工作方面极为强大,并且根据指数版本和推理设置的不同,在近期 Artificial Analysis 综合评估中处于领先位置。
OpenAI 记录的上下文窗口为 1,050,000 个令牌,最多支持 128,000 个输出令牌。超长请求的成本更高,开发者仍然应当在长时间运行的智能体工作流中使用上下文压缩和外部持久化状态。
当困难多步骤工作的更高完成率能够证明溢价价格合理时,可以选择 Astra。对于常规信息提取、客户支持、文案写作、简单 RAG 或高调用量低风险任务,更低成本的模型通常是更好的起点。
GPT-6 Astra 是智能体工作流的一次有意义的进步,但最准确的描述并不是“OpenAI 将整个智能体执行框架都放进了模型”。Astra 更擅长经过长时间、多步骤的执行,而 Codex、ChatGPT Work、Responses API 和自定义应用仍然负责提供周边的编排、工具、权限和环境。
它已发布的最明显提升出现在交互式推理、计算机操作、专业自动化、科学工作流、CAD 和网络安全评估中。在广泛的综合智能指标上,它与其他前沿模型的差距可能小得多,因此 Astra 不应自动替代常规工作中的更便宜模型。
对于开发者而言,战略变化已经很清晰:模型选择越来越取决于系统中的任务成功完成情况,而不仅仅是聊天窗口中的回答质量。
GPT-6 Astra 最重要的价值,不在于“AI 应该说什么”,而在于“AI 能否安全地将工作从开始推进到结束”。
从一句话开始,几分钟内拿到完整网站。