引言
xAI 发布了 Grok Voice Think Fast 2.0,这是其面向开发实时语音智能体的下一代语音到语音模型。
新版本聚焦于生产级语音系统中最重要的四个方面:智能水平、转录准确性、对话行为以及可靠的工具调用。xAI 表示,在大多数情况下,现有应用无需重写提示词即可迁移到新模型。
Think Fast 2.0 定价为 每分钟音频 0.08 美元。开发者可使用带版本号的模型名称 grok-voice-think-fast-2.0,而 grok-voice-latest 别名计划于 2026 年 8 月 5 日从 1.0 版本切换至 2.0 版本。
该模型专为实际语音智能体工作负载设计,例如客户支持、销售、电话自动化以及多步骤业务工作流——在这些场景中,智能体必须理解语音、进行推理、调用工具,并快速响应以保持自然对话的流畅进行。
Grok Voice Think Fast 2.0 在主要语音基准测试中全面提升
xAI 发布了来自 Artificial Analysis 的基准测试结果,将 Think Fast 2.0 与其前代产品、OpenAI 的 GPT-Realtime-2.1 以及 Google 的 Gemini 3.1 Flash 进行了对比。

报告的结果如下:
| 基准测试 | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| AA 语音到语音质量指数 | 82.9% | 75.7% | 79.1% | 69.5% |
| Big Bench 音频 | 97.2% | 97.1% | 96.0% |
96.6% |
| 全双工测试 | 95.1% | 77.8% | 95.7% | 74.3% |
| τ-语音测试 | 56.5% | 52.1% | 45.7% | 37.7% |
| 首次音频响应时间 | 0.70秒 | 1.25秒 | — | 2.98秒 |
与 Think Fast 1.0 相比,整体人工智能分析语音到语音质量指数从 75.7% 提升至 82.9%。
最显著的实际变化体现在对话动态、代理性能和响应延迟方面。
语音推理
在 Big Bench Audio 测试中,Think Fast 2.0 得分为 97.2%,仅略高于上一代模型的 97.1%。
这表明本次发布并非主要追求原始语音推理能力的跨越式提升。相反,大部分改进体现在模型在实时对话中的行为表现。
对话动态
Think Fast 2.0 在全双工测试中达到 95.1%,而 Think Fast 1.0 为 77.8%。
全双工测试评估的行为包括:把握发言时机、处理停顿、应对打断、识别反馈信号以及维持自然的话轮转换。
GPT-Realtime-2.1 High 在单项测试中得分略高,为 95.7%,因此 xAI 模型并非在所有类别中都领先。
代理性能
在更侧重评估语音代理能否完成实际任务的 τ-语音测试中,Think Fast 2.0 得分 56.5%。
该成绩高于 Think Fast 1.0 的 52.1%、GPT-Realtime-2.1 High 的 45.7% 和 Gemini 3.1 Flash High 的 37.7%。
这一指标对客服和销售代理尤为重要,因为仅凭优质的对话音频是不够的。系统还需正确遵循指令、使用工具、收集信息并完成工作流程。
更快的首次音频响应
xAI 报告称,首次音频响应时间为 0.70 秒,低于 Think Fast 1.0 的 1.25 秒。
更低的延迟减少用户说完一句话到 AI 开始回复之间令人尴尬的沉默。
人工智能分析目前将 Think Fast 2.0 列为所测量过响应较快的语音到语音系统之一,不过它并非整个排行榜上最快的模型。
跨 24 种语言的转录准确率提升
xAI 还使用覆盖 24 种语言的数千个短语音样本对 Think Fast 2.0 进行了测试。
据该公司称,在其评估中,新模型的转录准确率比 Deepgram Nova 3 和 ElevenLabs Scribe v2 高约 1.5-2.0 倍,比 Grok Voice Think Fast 1.0 高约 1.4 倍。
xAI 还表示,在某些嘈杂和电话压缩环境下,差距可扩大至约 10 倍。
这些数据来自 xAI 自身的转录评估,而非人工智能分析的基准测试表。这一区分很重要,因为基准测试对比和转录实验衡量的不同指标,且来自不同的评估设置。
对嘈杂音频的强调对生产环境下的语音代理意义重大。真实的通话往往包含移动网络压缩、劣质麦克风、道路或办公室噪音、口音、语速快、打断、不完整的句子、姓名、地址和账户详细信息。
模型边说话边推理
Grok Voice Think Fast 中一项较为独特的设计选择是并行推理。
xAI
该模型可以在说话的同时继续推理,而非在生成音频前完成所有推理。这一设计旨在减少智能与延迟之间的权衡。
Think Fast 2.0 使用的推理令牌数也比前代更少。xAI 报告的推理令牌中位相对使用量如下:
| 模型 | 每次响应的相对推理令牌数 |
|---|---|
| Grok Voice Think Fast 2.0 | 0.4× |
| Grok Voice Think Fast 1.0 | 1.0× |
该公司表示,这能加快工具调用速度,通常允许在智能助手说完第一句话之前工具就已执行完毕。
例如,一个客服助手可能刚开口说“我帮您查一下……”,同时就在后台调用账户查询工具。当口播介绍结束时,工具结果可能已经就绪,可用于下一部分回复。
强化学习让对话更简洁
xAI 表示,Think Fast 2.0 通过大量强化学习训练,使其在真实对话中更像一个实用的人工坐席。
该模型被鼓励使用更短的句子、一次只问一个问题、避免不必要的填充词、保持对话聚焦,并在引导用户完成复杂流程时不暴露不必要的复杂性。
这听起来可能只是小改动,但语音界面对于长回复的容忍度远低于文字聊天。长回复在屏幕上或许可以接受,但在通话中收听则会令人沮丧。
工具使用是语音 API 的核心部分
当前 xAI 的语音转语音 API 直接在语音会话中支持多种工具类型:
file_searchweb_searchx_search- 远程 MCP 工具
- 自定义函数
这使得语音智能助手能够超越简单的问答。
根据应用程序提供的权限,智能助手可以理解来电者的请求、搜索已批准文档、查询账户信息、调用业务 API、执行允许的操作,并通过语音解释结果。
对于生产环境,应用程序仍需设置严格的权限边界。即使模型具备调用敏感工具的能力,也不应直接授予其访问权限。
Starlink 正在 A/B 测试 Think Fast 2.0
Grok Voice 已用于 Starlink 的基于电话的销售和客服工作流程中。
xAI 表示,已通过 +1 888 GO STARLINK 在 Starlink 电话线上对 Think Fast 2.0 进行了 A/B 测试。
该公司报告称,销售转化率和客服问题解决率均有显著提升。
xAI 在发布公告中未公布 Think Fast 2.0 A/B 测试的具体提升百分比。
这不应与早期针对原始 Think Fast 1.0 部署的公开数据混淆。xAI 当时报告了 20% 的销售转化率和 70% 的自主客服问题解决率。而 2.0 版本的公告仅表示新版本改进了 Starlink 的现有结果。
定价:每分钟 0.08 美元
xAI 官方定价页面列出:
| 语音模型 | 音频价格 |
|---|---|
grok-voice-think-fast-1.0 | 0.05 美元/分钟 |
grok-voice-think-fast-2.0 | 0.08 美元/分钟 |
因此,Think Fast 2.0 的音频成本为 每小时 4.80 美元,
已发布的 API 费率。
语音转语音 API 的文本输入单独计价,每 0.004 美元。
额外服务器端工具也可能产生独立费用。例如,xAI 目前将网络搜索、X 搜索和代码执行定价为每 1000 次工具调用 5 美元。
因此,开发者应基于完整工作流计算总成本,而非仅按音频费率相乘。
grok-voice-latest 将于 2026 年 8 月 5 日切换至 2.0 版本
已在使用 Grok 语音 API 的开发者需关注模型别名。
当前文档说明:
grok-voice-latest
指向:
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
grok-voice-think-fast-1.0
直至 2026 年 8 月 5 日。
2026 年 8 月 5 日,该别名将自动切换至:
grok-voice-think-fast-2.0
使用 grok-voice-latest 的应用无需任何更改即可获得升级。
然而,需要稳定行为的团队应显式固定版本。
要停留在 1.0 版本:
grok-voice-think-fast-1.0
要立即采用新模型:
grok-voice-think-fast-2.0
对于具有监管工作流、固定评估基线或变更管理需求的生产系统,版本固定尤为重要。
现有提示词通常无需更改
xAI 表示 Think Fast 2.0 旨在无需修改提示词即可改进大多数现有应用。
这使得迁移相对简单,但生产团队仍需运行回归测试。
语音模型升级可能影响回答长度、时序、轮换发言、工具调用频率、澄清问题、升级机制、转录、发音和结构化数据收集。
合理的迁移流程为:
- 固定现有 1.0 模型。
- 对 2.0 运行相同测试对话。
- 比较任务成功率与工具使用情况。
- 测试噪声和电话质量音频。
- 检查中断处理。
- 审查延迟情况。
- 衡量每个完成任务的成本。
- 逐步迁移生产流量。
最小化 Grok 语音连接
原 AIBase 报告未包含代码,但 xAI 官方文档提供了连接语音转语音 API 的简单 WebSocket 示例。
通过 WebSocket URL 选择模型:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
随后会话可定义语音、指令和轮流发言检测:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "你是一位简洁的客户支持助手。",
"turn_detection": {
"type": "server_vad"
}
}
}
对于浏览器或移动客户端,xAI 建议使用临时令牌,而非向客户端暴露长期有效的 API 密钥。服务器端应用可通过授权头中的 API 密钥进行身份验证。
支持的音频格式
语音转语音 API 目前支持:
| 格式 | 典型用途 |
|---|---|
| PCM | 通用高质量音频 |
G.711 μ-law / audio/pcmu | 电话音频 |
G.711 A-law / audio/pcma | 电话系统 |
| Opus | 压缩实时音频 |
PCM支持从8 kHz到48 kHz的多种采样率。
对于普通语音应用,官方文档默认推荐使用24 kHz的PCM。原生G.711支持对电话系统很有用,因为它可以减少某些电话系统中额外转码的需求。
Think Fast 2.0最适合的应用场景
此次发布主要面向实时坐席工作流,而非简单的离线转录。
客户支持
该模型可以聆听客户问题、搜索已批准信息、使用账户工具,并完成多步骤故障排查。
电话销售
语音坐席可以回答问题、识别潜在客户、使用销售工具,并引导来电者完成购买流程。
预约与预订坐席
系统可以在调用排程API的同时收集日期、时间、姓名和偏好信息。
企业内部助手
员工可以通过语音与企业系统交互,同时模型调用内部工具或搜索已批准的知识库。
多语言语音服务
xAI的Grok Voice平台支持超过25种语言,使该模型适用于全球支持业务。
开发者仍需自行测试的内容
基准测试数据很有用,但无法判断模型是否适合特定应用。
在生产部署前,请测试实际来电者的口音、电话编解码器、背景噪音、产品名称、客户姓名、地址、长账号、中断、沉默、用户改变主意、工具故障、错误工具结果、人工转接条件以及安全或合规规则。
仅当响应正确时,0.70秒的首音频时间才有价值。同样,高基准分数并不能保证坐席会遵循公司特定的退款政策或准确输入不常见的客户姓名。
常见问题
什么是Grok Voice Think Fast 2.0?
Grok Voice Think Fast 2.0是xAI推出的新一代语音到语音模型,专为实时语音坐席设计。它融合了原生音频交互、推理、对话轮换、转录和工具使用功能。
Grok Voice Think Fast 2.0的价格是多少?
xAI将此模型定价为每分钟音频0.08美元,相当于每小时4.80美元。工具调用和其他一些API功能可能产生额外费用。
Think Fast 2.0比Think Fast 1.0更快吗?
是的。xAI和Artificial Analysis报告显示,首音频时间从1.25秒降至0.70秒。
它是否优于GPT-Realtime-2.1?
在Artificial Analysis语音到语音质量总指数和τ-语音代理基准测试中,Think Fast 2.0在已公布的对比中得分更高。GPT-Realtime-2.1 High在全双工基准测试上仍略占优势,因此Think Fast 2.0并非在所有单项指标中都领先。
我是否需要为2.0版本重写提示词?
xAI表示,大多数应用无需更改提示词即可获得性能提升。生产团队仍应运行回归测试,因为时序、工具使用、轮换方式和响应风格可能因模型版本而异。
grok-voice-latest何时会切换到Think Fast 2.0?
xAI表示,该别名将于2026年8月5日自动切换。
需要继续使用 1.0 版本的开发者,应锁定 grok-voice-think-fast-1.0。
Grok Voice Think Fast 2.0 能调用工具吗?
可以。目前的语音转语音 API 支持自定义函数、文件搜索、网络搜索、X 搜索以及远程 MCP 工具。
Think Fast 2.0 仅用于客户支持吗?
不是。客户支持与销售是典型的应用场景,但该模型也可用于其他实时语音代理工作流,例如预订服务、企业助手和交互式应用。
相关工具
- Grok Voice Think Fast 2.0:xAI 针对新旗舰语音模型的官方公告。
- Grok Voice API:官方语音转语音 API 文档,涵盖模型选择、音频格式、工具和会话设置。
- Grok Voice Agent Builder:xAI 提供的无代码环境,用于构建生产级语音代理。
- Artificial Analysis 语音转语音排行榜:覆盖语音推理、对话动态、代理性能、速度与定价的独立基准对比。
- Deepgram Nova:xAI 转录对比中参考的语音识别平台。
- ElevenLabs:语音 AI 平台,其 Scribe 模型被包含在 xAI 的转录评估中。
相关链接
- Introducing Grok Voice Think Fast 2.0:官方发布公告,含基准测试、转录结果、推理效率、Starlink 测试、迁移及定价。
- 语音转语音 API 文档:针对实时 Grok Voice 应用的官方实施指南。
- xAI API 定价:当前语音、语音转文字、文字转语音及工具的定价。
- Artificial Analysis 语音转语音模型:xAI 发布对比中使用的独立基准数据。
- Grok Voice Think Fast 1.0:上一代模型及其 Starlink 生产结果。
- Grok Voice Agent Builder:关于电话、工具、护栏、可观测性、SIP 支持及代理配置的官方信息。
- Grok 语音转文字与文字转语音 API:关于 xAI 独立音频 API 的官方详情。
摘要
Grok Voice Think Fast 2.0 在生产级代理最关键的领域——代理任务完成度、对话动态、转录准确性和延迟——提升了 xAI 的实时语音技术栈。
该模型在 Artificial Analysis 语音转语音质量指数中达到 82.9%,τ-voice 得分为 56.5%,首次音频响应时间为 0.70 秒。xAI 还报告称,该模型在 24 种语言的转录上表现更佳,推理效率更高,能使工具调用在语音回复中更早执行。
开发者现可使用该模型,价格为每分钟音频 0.08 美元。现有
用户还需注意,grok-voice-latest 计划于 2026 年 8 月 5 日自动从 Think Fast 1.0 切换至 Think Fast 2.0。
本次升级并非仅仅是更智能的语音模型,而是一个更面向生产的智能体,能够以更低的延迟完成聆听、推理、对话及工具调用。



