はじめに
xAI は、リアルタイム音声エージェントを開発するための次世代音声間モデル Grok Voice Think Fast 2.0 をリリースしました。
本バージョンは、プロダクションレベルの音声システムにおいて最も重要な4つの側面、すなわちインテリジェンスのレベル、文字起こしの精度、対話の振る舞い、そして信頼性の高いツール呼び出しに焦点を当てています。xAI によれば、ほとんどの場合、既存のアプリケーションはプロンプトを書き換えることなく新しいモデルに移行できます。
Think Fast 2.0 の料金は 1分あたり0.08米ドル です。開発者は、バージョン付きのモデル名 grok-voice-think-fast-2.0 を使用できます。一方、grok-voice-latest エイリアスは、2026年8月5日にバージョン1.0から2.0に切り替わる予定です。
本モデルは、カスタマーサポート、セールス、電話自動化、マルチステップの業務ワークフローなど、実際の音声エージェントワークロード向けに設計されています。これらのシナリオでは、エージェントが音声を理解し、推論し、ツールを呼び出し、自然な会話の流れを維持するために迅速に応答する必要があります。
Grok Voice Think Fast 2.0、主要な音声ベンチマークで全般的に向上
xAI は、Artificial Analysis によるベンチマーク結果を公開し、Think Fast 2.0 を前世代モデル、OpenAI の GPT-Realtime-2.1、Google の Gemini 3.1 Flash と比較しました。

報告された結果は以下の通りです。
| ベンチマーク | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| AA 音声間音声品質指数 | 82.9% | 75.7% | 79.1% | 69.5% |
| Big Bench 音声 | 97.2% | 97.1% | 96.0% | 96.6% |
| 全二重テスト | 95.1% | 77.8% | 95.7% | 74.3% |
| τ-音声テスト | 56.5% | 52.1% | 45.7% | 37.7% |
| 初回音声応答時間 | 0.70秒 | 1.25秒 | — | 2.98秒 |
Think Fast 1.0 と比較して、全体的な人工知能分析による音声間音声品質指数は 75.7% から 82.9% に向上しました。
最も顕著な実際の変化は、対話ダイナミクス、エージェント性能、応答レイテンシに見られます。
音声推論
Big Bench Audio テストでは、Think Fast 2.0 は 97.2% のスコアを記録し、前世代モデルの 97.1% からわずかに上昇しました。
これは、今回のリリースが主に生の音声推論能力の飛躍的な向上を追求したものではないことを示しています。むしろ、改善の大部分は、リアルタイムの会話におけるモデルの振る舞いに現れています。
対話ダイナミクス
Think Fast 2.0 は、全二重テストで 95.1% を達成しました。一方、Think Fast 1.0 は 77.8% でした。
全二重テストでは、発言のタイミング、ポーズの処理、割り込みへの対応、フィードバック信号の認識、自然なターンテイキングの維持といった行動が評価されます。
GPT-Realtime-2.1 High は単一テストでわずかに高い 95.7% を記録しており、xAI のモデルがすべてのカテゴリーでトップというわけではありません。
エージェント性能
音声エージェントが実際のタスクを完了できるかをより重視する τ-音声テストでは、Think Fast 2.0 は 56.5% のスコアでした。
このスコアは、Think Fast 1.0 の 52.1%、GPT-Realtime-2.1 High の 45.7%、Gemini 3.1 Flash High の 37.7% を上回っています。
この指標は、カスタマーサービスやセールスエージェントにとって特に重要です。なぜなら、良質な対話音声だけでは不十分であり、システムが指示を正確に理解し、ツールを使用し、情報を収集し、ワークフローを完了する必要があるからです。
高速化された初回音声応答
xAI は、初回音声応答時間が 0.70 秒 であり、Think Fast 1.0 の 1.25 秒から短縮されたと報告しています。
レイテンシの低減により、ユーザーが発言を終えてからAIが応答を開始するまでの気まずい沈黙が減少します。
人工知能分析は現在、Think Fast 2.0 を、測定された中で応答が速い音声間システムの一つに挙げていますが、全体的なランキングで最速のモデルというわけではありません。
24言語における文字起こし精度の向上
xAI はまた、24言語にわたる数千の短い音声サンプルを用いて Think Fast 2.0 をテストしました。
同社によれば、自社の評価において、新モデルの文字起こし精度は Deepgram Nova 3 および ElevenLabs Scribe v2 よりも約 1.5〜2.0倍 高く、Grok Voice Think Fast 1.0 よりも約 1.4倍 高いとのことです。
xAI
また、電話の圧縮環境や騒音環境によっては、その差は約 10倍 にまで広がる可能性があると述べています。
これらのデータは、xAI 自身の文字起こし評価に基づくものであり、人工知能分析のベンチマーク表に基づくものではありません。この区別は重要です。なぜなら、ベンチマーク比較と文字起こし実験では異なる指標が測定され、評価設定も異なるからです。
騒がしい環境の音声を重視する点は、本番環境の音声エージェントにとって非常に重要です。実際の通話には、モバイルネットワークの圧縮、品質の低いマイク、道路やオフィスの騒音、訛り、早口、割り込み、不完全な文、氏名、住所、アカウントの詳細情報などが含まれます。
モデルが話しながら推論
Grok Voice Think Fast のユニークな設計上の選択の一つに、並行推論があります。
xAI
このモデルは、音声を生成する前にすべての推論を完了するのではなく、話しながら推論を続けることができます。この設計は、インテリジェンスとレイテンシのトレードオフを減らすことを目的としています。
Think Fast 2.0 は、前世代よりも使用する推論トークン数が少なくなっています。xAI が報告する推論トークン使用量の中央値は以下の通りです。
| モデル | 応答ごとの相対的推論トークン数 |
|---|---|
| Grok Voice Think Fast 2.0 | 0.4× |
| Grok Voice Think Fast 1.0 | 1.0× |
同社によると、これによりツール呼び出しが高速化され、多くの場合、スマートアシスタントが最初のフレーズを言い終える前にツールが実行を完了できるようになります。
例えば、カスタマーサポート担当者が「少々お調べしますね……」と言い始めると同時に、バックグラウンドでアカウント照会ツールを呼び出すことができます。口頭での案内が終了する頃には、ツールの結果が準備できており、次の応答部分で使用できる状態になります。
強化学習で会話をより簡潔に
xAI は、Think Fast 2.0 は広範な強化学習トレーニングを通じて、実際の会話においてより実用的な有人エージェントのように振る舞うようになったと述べています。
このモデルは、より短い文を使用すること、一度に一つの質問だけをすること、不要なフィラーワードを避けること、会話の焦点を維持すること、複雑な手順をユーザーに案内する際に不必要な複雑さを露呈しないことが奨励されています。
これは小さな変更に聞こえるかもしれませんが、音声インターフェースはテキストチャットに比べて長い応答に対する許容度がはるかに低くなっています。長い応答は画面上では許容できても、通話中に聞くのはイライラするものです。
ツール使用は音声APIの中核部分
現在、xAI の音声-to-音声APIは、音声セッション内で直接複数のツールタイプをサポートしています。
file_searchweb_searchx_search- リモートMCPツール
- カスタム関数
これにより、音声スマートアシスタントは単純なQ&Aを超えた機能を発揮できます。
アプリケーションが提供する権限に応じて、スマートアシスタントは発信者のリクエストを理解し、承認されたドキュメントを検索し、アカウント情報を照会し、ビジネスAPIを呼び出し、許可された操作を実行し、音声で結果を説明することができます。
本番環境では、アプリケーションは厳格な権限境界を設定する必要があります。モデルが機密性の高いツールを呼び出す能力を持っていたとしても、そのアクセス権を直接付与すべきではありません。
Starlink が Think Fast 2.0 をA/Bテスト中
Grok Voice は既に、Starlink の電話ベースのセールスおよびカスタマーサービスのワークフローで使用されています。
xAI によると、+1 888 GO STARLINK を介して、Starlink の電話回線上で Think Fast 2.0 のA/Bテストを実施したとのことです。
同社は、販売成約率とカスタマーサービスの問題解決率の両方において顕著な改善があったと報告しています。
xAI は発表の中で、Think Fast 2.0 のA/Bテストにおける具体的な改善率は明らかにしていません。
これは、初期のオリジナル Think Fast 1.0 導入に関する公開データと混同されるべきではありません。xAI は当時、20%の販売成約率と70%のカスタマーサービスの問題自主解決率を報告していました。一方、2.0 に関する発表では、新バージョンが Starlink の既存の結果を改善したと述べるにとどまっています。
料金:1分あたり0.08米ドル
xAI の公式料金ページには、以下のように記載されています。
| 音声モデル | 音声価格 |
|---|---|
grok-voice-think-fast-1.0 | 0.05米ドル/分 |
grok-voice-think-fast-2.0 | 0.08米ドル/分 |
つまり、Think Fast 2.0 の音声コストは 1時間あたり4.80米ドル となります。
公開されているAPI料金です。
音声-to-音声APIのテキスト入力は別途課金され、1トークンあたり0.004米ドルです。
追加のサーバーサイドツールも独立した費用が発生する可能性があります。例えば、xAI は現在、ウェブ検索、X検索、コード実行をツール呼び出し1000回あたり5米ドルと価格設定しています。
したがって、開発者は完全なワークフローに基づいて総コストを計算する必要があり、単に音声料金を掛け合わせるだけでは不十分です。
grok-voice-latest は2026年8月5日に2.0に切り替わります
既に Grok 音声APIを使用している開発者は、モデルエイリアスに注意する必要があります。
現在のドキュメントでは:
grok-voice-latest
が、以下のエイリアスとなっています:
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
grok-voice-think-fast-1.0
2026年8月5日まで。
2026年8月5日、このエイリアスは自動的に以下のモデルに切り替わります:
grok-voice-think-fast-2.0
grok-voice-latest を使用しているアプリケーションは、変更を加えることなくアップグレードされます。
ただし、安定した動作が必要なチームは、明示的にバージョンを固定する必要があります。
1.0 に留まる場合:
grok-voice-think-fast-1.0
新しいモデルを直ちに採用する場合:
grok-voice-think-fast-2.0
規制対象のワークフロー、固定された評価ベースライン、または変更管理のニーズがある本番システムでは、バージョン固定が特に重要です。
既存のプロンプトは通常変更不要
xAI は、Think Fast 2.0 はプロンプトを変更することなく、ほとんどの既存アプリケーションを改善するように設計されていると述べています。
これにより移行は比較的簡単ですが、本番チームはそれでも回帰テストを実行する必要があります。
音声モデルのアップグレードは、応答の長さ、タイミング、発言のターン、ツール呼び出し頻度、質問の明確化、エスカレーションメカニズム、文字起こし、発音、構造化データ収集に影響を与える可能性があります。
合理的な移行プロセスは以下の通りです:
- 既存の1.0モデルを固定する。
- 2.0で同じテスト対話を実行する。
- タスク成功率とツール使用状況を比較する。
- 騒音環境と電話品質の音声をテストする。
- 割り込み処理を確認する。
- レイテンシをレビューする。
- タスク完了あたりのコストを測定する。
- 本番トラフィックを段階的に移行する。
Grok 音声接続の最小限の実装
元の AIBase レポートにはコードは含まれていませんでしたが、xAI 公式ドキュメントには音声-to-音声APIに接続するためのシンプルなWebSocketの例が提供されています。
WebSocket URL を介してモデルを選択します:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
その後、セッションで音声、指示、発言のターン検出を定義できます:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "あなたは簡潔なカスタマーサポートアシスタントです。",
"turn_detection": {
"type": "server_vad"
}
}
}
ブラウザやモバイルクライアントの場合、xAI は長期有効なAPIキーをクライアントに公開するのではなく、一時的なトークンの使用を推奨しています。サーバーサイドアプリケーションは、認証ヘッダーのAPIキーを使用して認証できます。
サポートされる音声フォーマット
音声-to-音声APIは現在、以下のフォーマットをサポートしています:
| フォーマット | 典型的な用途 |
|---|---|
| PCM | 汎用高品質音声 |
G.711 μ-law / audio/pcmu | 電話音声 |
G.711 A-law / audio/pcma | 電話システム |
| Opus | 圧縮リアルタイム音声 |
PCM は 8
kHzから48kHzまでの複数のサンプリングレートに対応しています。
一般的な音声アプリケーションでは、公式ドキュメントはデフォルトで24kHzのPCMを推奨しています。ネイティブのG.711対応は、一部の電話システムにおける追加のトランスコードの必要性を減らすため、電話システムにおいて有用です。
Think Fast 2.0に最も適したユースケース
今回のリリースは、主にリアルタイムのエージェントワークフローを対象としており、単なるオフライン文字起こしのためのものではありません。
カスタマーサポート
このモデルは、顧客の質問を聞き取り、承認済み情報を検索し、アカウントツールを使用し、多段階のトラブルシューティングを完了することができます。
テレセールス
音声エージェントは質問に答え、潜在顧客を特定し、販売ツールを使用し、発信者の購買プロセスを導くことができます。
予約・受付エージェント
システムは、スケジュールAPIを呼び出しながら、日付、時間、名前、希望などの情報を収集できます。
社内アシスタント
従業員は音声で企業システムとやり取りし、同時にモデルが内部ツールを呼び出したり、承認済みのナレッジベースを検索したりできます。
多言語音声サービス
xAIのGrok Voiceプラットフォームは25以上の言語をサポートしており、このモデルはグローバルなサポート業務に適しています。
開発者が自らテストすべき内容
ベンチマークデータは有用ですが、モデルが特定のアプリケーションに適しているかどうかを判断することはできません。
本番環境にデプロイする前に、実際の発信者のアクセント、電話コーデック、背景雑音、製品名、顧客名、住所、長いアカウント番号、割り込み、沈黙、ユーザーの意思変更、ツール障害、誤ったツール結果、人間への転送条件、セキュリティやコンプライアンスルールなどをテストしてください。
応答が正しい場合にのみ、0.70秒の初回音声時間に価値があります。同様に、高いベンチマークスコアは、エージェントが会社固有の返金ポリシーに従ったり、一般的でない顧客名を正確に入力したりすることを保証するものではありません。
よくある質問
Grok Voice Think Fast 2.0とは何ですか?
Grok Voice Think Fast 2.0は、xAIが提供する次世代の音声間モデルであり、リアルタイム音声エージェント向けに設計されています。ネイティブの音声インタラクション、推論、会話のターン交代、文字起こし、ツール使用機能を統合しています。
Grok Voice Think Fast 2.0の価格はいくらですか?
xAIはこのモデルを、音声1分あたり0.08米ドル、すなわち1時間あたり4.80米ドルと価格設定しています。ツール呼び出しやその他の一部のAPI機能には追加料金が発生する場合があります。
Think Fast 2.0はThink Fast 1.0よりも高速ですか?
はい。xAIおよびArtificial Analysisのレポートによると、初回音声時間が1.25秒から0.70秒に短縮されました。
GPT-Realtime-2.1よりも優れていますか?
Artificial Analysisの音声間品質総合指数およびτ-音声エージェントベンチマークにおいて、Think Fast 2.0は公開された比較でより高いスコアを達成しています。GPT-Realtime-2.1 Highは全二重ベンチマークで依然としてわずかに優位であるため、Think Fast 2.0がすべての個別指標でリードしているわけではありません。
バージョン2.0にプロンプトを書き直す必要がありますか?
xAIは、ほとんどのアプリケーションでプロンプトを変更せずにパフォーマンス向上が得られると述べています。ただし、本番チームは、タイミング、ツール使用、ターン交代方式、応答スタイルがモデルバージョンによって異なる可能性があるため、リグレッションテストを実行する必要があります。
grok-voice-latestはいつThink Fast 2.0に切り替わりますか?
xAIは、このエイリアスが2026年8月5日に自動的に切り替わると述べています。
バージョン1.0を引き続き使用したい開発者は、grok-voice-think-fast-1.0を固定してください。
Grok Voice Think Fast 2.0はツールを呼び出せますか?
はい。現在の音声間APIは、カスタム関数、ファイル検索、ウェブ検索、X検索、リモートMCPツールをサポートしています。
Think Fast 2.0はカスタマーサポート専用ですか?
いいえ。カスタマーサポートとセールスは典型的なユースケースですが、このモデルは予約サービス、社内アシスタント、インタラクティブアプリケーションなど、他のリアルタイム音声エージェントワークフローにも使用できます。
関連ツール
- Grok Voice Think Fast 2.0:xAIによる新しいフラッグシップ音声モデルの公式発表。
- Grok Voice API:モデル選択、音声フォーマット、ツール、セッション設定を網羅した公式音声間APIドキュメント。
- Grok Voice Agent Builder:xAIが提供する、プロダクション向け音声エージェントを構築するためのノーコード環境。
- Artificial Analysis 音声間リーダーボード:音声推論、会話ダイナミクス、エージェントパフォーマンス、速度、価格をカバーする独立したベンチマーク比較。
- Deepgram Nova:xAIの文字起こし比較で参照された音声認識プラットフォーム。
- ElevenLabs:音声AIプラットフォーム。そのScribeモデルはxAIの文字起こし評価に含まれています。
関連リンク
- Introducing Grok Voice Think Fast 2.0:ベンチマーク、文字起こし結果、推論効率、Starlinkテスト、移行、価格設定を含む公式リリース発表。
- 音声間APIドキュメント:リアルタイムGrok Voiceアプリケーション向けの公式実装ガイド。
- xAI API価格設定:現在の音声、音声からテキスト、テキストから音声、ツールの価格。
- Artificial Analysis 音声間モデル:xAIの発表で使用された独立したベンチマークデータ。
- Grok Voice Think Fast 1.0:前世代モデルとそのStarlinkでの本番結果。
- Grok Voice Agent Builder:電話、ツール、ガードレール、可観測性、SIPサポート、エージェント設定に関する公式情報。
- Grok 音声からテキストおよびテキストから音声API:xAIの独立した音声APIに関する公式詳細。
まとめ
Grok Voice Think Fast 2.0は、プロダクション向けエージェントにとって最も重要な領域、すなわちエージェントタスク完了度、会話ダイナミクス、文字起こし精度、レイテンシーにおいて、xAIのリアルタイム音声技術スタックを向上させました。
このモデルは、Artificial Analysis音声間品質指数で82.9%、τ-voiceスコアで56.5%、初回音声応答時間0.70秒を達成しました。xAIはまた、このモデルが24言語での文字起こし性能が向上し、推論効率が高く、音声応答内でのツール呼び出しの早期実行を可能にすると報告しています。
開発者は現在、このモデルを音声1分あたり0.08米ドルの価格で利用できます。既存の
ユーザーは、grok-voice-latestが2026年8月5日にThink Fast 1.0からThink Fast 2.0へ自動的に切り替わる予定であることにも注意が必要です。
今回のアップグレードは、単に賢い音声モデルというだけでなく、より低いレイテンシーで聞き取り、推論、会話、ツール呼び出しを実行できる、よりプロダクション向けのエージェントです。



