Introduction
xAI a publié Grok Voice Think Fast 2.0, son modèle voix-à-voix de nouvelle génération pour le développement d'agents vocaux en temps réel.
Cette nouvelle version se concentre sur les quatre aspects les plus importants des systèmes vocaux de production : le niveau d'intelligence, la précision de transcription, le comportement conversationnel et l'appel fiable d'outils. xAI indique que, dans la plupart des cas, les applications existantes peuvent migrer vers le nouveau modèle sans réécrire leurs prompts.
Think Fast 2.0 est proposé à 0,08 $ par minute audio. Les développeurs peuvent utiliser le nom de modèle versionné grok-voice-think-fast-2.0, tandis que l'alias grok-voice-latest est prévu pour basculer de la version 1.0 à la version 2.0 le 5 août 2026.
Ce modèle est conçu pour des charges de travail d'agents vocaux réels, telles que le support client, la vente, l'automatisation téléphonique et les workflows métier multi-étapes
- des scénarios où l'agent doit comprendre la parole, raisonner, appeler des outils et répondre rapidement pour maintenir le flux naturel d'une conversation.
Grok Voice Think Fast 2.0 s'améliore sur tous les principaux benchmarks vocaux
xAI a publié les résultats de benchmarks d'Artificial Analysis, comparant Think Fast 2.0 à son prédécesseur, à GPT-Realtime-2.1 d'OpenAI et à Gemini 3.1 Flash de Google.

Les résultats rapportés sont les suivants :
| Benchmark | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| Indice de qualité voix-à-voix AA | 82,9 % | 75,7 % | 79,1 % | 69,5 % |
| Big Bench Audio | 97,2 % | 97,1 % | 96,0 % | 96,6 % |
| Test Full-duplex | 95,1 % | 77,8 % | 95,7 % | 74,3 % |
| Test τ-voice | 56,5 % | 52,1 % | 45,7 % | 37,7 % |
| Temps de première réponse audio | 0,70 s | 1,25 s | — | 2,98 s |
Par rapport à Think Fast 1.0, l'indice global de qualité voix-à-voix d'Artificial Analysis est passé de 75,7 % à 82,9 %.
Les changements pratiques les plus significatifs concernent la dynamique conversationnelle, les performances des agents et la latence de réponse.
Raisonnement vocal
Au test Big Bench Audio, Think Fast 2.0 a obtenu un score de 97,2 %, seulement légèrement supérieur aux 97,1 % de la génération précédente.
Cela indique que cette version ne vise pas principalement un bond en avant dans la capacité de raisonnement vocal brut. Au contraire, la plupart des améliorations portent sur le comportement du modèle dans une conversation en temps réel.
Dynamique conversationnelle
Think Fast 2.0 atteint 95,1 % au test Full-duplex, contre 77,8 % pour Think Fast 1.0.
Le test Full-duplex évalue des comportements tels que : savoir quand prendre la parole, gérer les pauses, réagir aux interruptions, reconnaître les signaux de feedback et maintenir un tour de parole naturel.
GPT-Realtime-2.1 High obtient un score légèrement supérieur dans ce test unique, à 95,7 %, démontrant que le modèle de xAI n'est pas en tête dans toutes les catégories.
Performances des agents
Au test τ-voice, qui évalue davantage la capacité des agents vocaux à accomplir des tâches réelles, Think Fast 2.0 a obtenu 56,5 %.
Ce score est supérieur à ceux de Think Fast 1.0 (52,1 %), de GPT-Realtime-2.1 High (45,7 %) et de Gemini 3.1 Flash High (37,7 %).
Cet indicateur est particulièrement important pour les agents de service client et de vente, car un simple audio de conversation de bonne qualité ne suffit pas. Le système doit également suivre correctement les instructions, utiliser des outils, collecter des informations et accomplir des workflows.
Temps de première réponse audio plus rapide
xAI rapporte un temps de première réponse audio de 0,70 seconde, inférieur à celui de Think Fast 1.0 qui était de 1,25 seconde.
Une latence plus faible réduit le silence gênant entre la fin de la phrase d'un utilisateur et le début de la réponse de l'IA.
Artificial Analysis classe actuellement Think Fast 2.0 parmi les systèmes voix-à-voix les plus réactifs qu'il ait mesurés, bien qu'il ne soit pas le modèle le plus rapide de l'ensemble du classement.
Amélioration de la précision de transcription dans 24 langues
xAI a également testé Think Fast 2.0 sur des milliers d'échantillons vocaux courts couvrant 24 langues.
Selon l'entreprise, dans ses évaluations, la précision de transcription du nouveau modèle est environ 1,5 à 2,0 fois supérieure à celle de Deepgram Nova 3 et d'ElevenLabs Scribe v2, et environ 1,4 fois supérieure à celle de Grok Voice Think Fast 1.0. xAI
Il indique également que, dans certains environnements bruyants ou de compression téléphonique, l’écart peut atteindre environ 10 fois.
Ces données proviennent des propres évaluations de transcription de xAI, et non de tableaux de référence d’analyse par intelligence artificielle. Cette distinction est importante, car les comparaisons de référence et les expériences de transcription mesurent des indicateurs différents et proviennent de contextes d’évaluation distincts.
L’accent mis sur l’audio bruité est crucial pour les agents vocaux en environnement de production. Les appels réels incluent souvent la compression des réseaux mobiles, des microphones de mauvaise qualité, du bruit ambiant, des accents, un débit rapide, des interruptions, des phrases incomplètes, des noms, adresses et détails de compte.
Le modèle réfléchit en parlant
L’un des choix de conception les plus uniques de Grok Voice Think Fast est le raisonnement parallèle.
xAI
Le modèle peut continuer à raisonner tout en parlant, plutôt que d’achever tout le raisonnement avant de générer l’audio. Cette conception vise à réduire le compromis entre intelligence et latence.
Think Fast 2.0 utilise également moins de jetons de raisonnement que la version précédente. Voici l’utilisation relative médiane des jetons de raisonnement signalée par xAI :
| Modèle | Jetons de raisonnement relatifs par réponse |
|---|---|
| Grok Voice Think Fast 2.0 | 0,4× |
| Grok Voice Think Fast 1.0 | 1,0× |
L’entreprise indique que cela accélère l’appel d’outils, permettant généralement à l’outil d’être exécuté avant même la fin de la première phrase de l’assistant vocal.
Par exemple, un assistant de service client pourrait commencer par dire « Je vais vérifier cela pour vous… » tout en appelant en arrière-plan un outil de consultation de compte. Lorsque l’introduction orale se termine, le résultat de l’outil peut déjà être prêt pour la partie suivante de la réponse.
L’apprentissage par renforcement rend les dialogues plus concis
xAI indique que Think Fast 2.0 a été formé par un apprentissage par renforcement intensif, le rendant plus proche d’un agent humain pratique dans les conversations réelles.
Le modèle est encouragé à utiliser des phrases plus courtes, à poser une question à la fois, à éviter les mots de remplissage inutiles, à maintenir le dialogue focalisé et à ne pas exposer des complexités inutiles lorsqu’il guide l’utilisateur à travers des processus complexes.
Cela peut sembler de petites modifications, mais les interfaces vocales tolèrent beaucoup moins les réponses longues que les discussions textuelles. Les longues réponses peuvent être acceptables à l’écran, mais sont frustrantes à écouter au téléphone.
L’utilisation d’outils est un élément central de l’API vocale
Actuellement, l’API vocale de xAI prend en charge plusieurs types d’outils directement dans les sessions vocales :
file_searchweb_searchx_search- Outils MCP distants
- Fonctions personnalisées
Cela permet aux assistants vocaux intelligents de dépasser les simples questions-réponses.
En fonction des autorisations fournies par l’application, l’assistant intelligent peut comprendre la demande de l’appelant, rechercher dans des documents approuvés, interroger les informations de compte, appeler des API métier, exécuter des actions autorisées et expliquer les résultats vocalement.
Pour les environnements de production, les applications doivent toujours définir des limites d’autorisation strictes. Même si le modèle a la capacité d’appeler des outils sensibles, il ne faut pas lui accorder directement l’accès.
Starlink teste Think Fast 2.0 par A/B
Grok Voice est déjà utilisé dans les workflows de vente et de service client téléphonique de Starlink.
xAI indique avoir effectué des tests A/B de Think Fast 2.0 sur la ligne téléphonique de Starlink via +1 888 GO STARLINK.
L’entreprise rapporte des améliorations significatives du taux de conversion des ventes et du taux de résolution des problèmes du service client.
xAI n’a pas divulgué les pourcentages d’amélioration spécifiques du test A/B de Think Fast 2.0 dans son annonce.
Cela ne doit pas être confondu avec les données publiques antérieures du déploiement original de Think Fast 1.0. xAI avait alors rapporté un taux de conversion des ventes de 20 % et un taux de résolution autonome des problèmes du service client de 70 %. L’annonce de la version 2.0 indique simplement que cette nouvelle version améliore les résultats existants de Starlink.
Tarification : 0,08 dollar par minute
La page de tarification officielle de xAI indique :
| Modèle vocal | Prix audio |
|---|---|
grok-voice-think-fast-1.0 | 0,05 dollar/minute |
grok-voice-think-fast-2.0 | 0,08 dollar/minute |
Ainsi, le coût audio de Think Fast 2.0 est de 4,80 dollars par heure,
Tarifs API annoncés.
L’entrée texte de l’API vocale est facturée séparément à 0,004 dollar.
Les outils supplémentaires côté serveur peuvent également entraîner des frais indépendants. Par exemple, xAI facture actuellement la recherche web, la recherche X et l’exécution de code à 5 dollars pour 1 000 appels d’outil.
Par conséquent, les développeurs doivent calculer le coût total basé sur le flux de travail complet, et non simplement multiplier le tarif audio.
grok-voice-latest basculera vers la version 2.0 le 5 août 2026
Les développeurs utilisant déjà l’API vocale Grok doivent prêter attention à l’alias du modèle.
La documentation actuelle précise :
grok-voice-latest
pointe vers :
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
grok-voice-think-fast-1.0
jusqu’au 5 août 2026.
Le 5 août 2026, cet alias basculera automatiquement vers :
grok-voice-think-fast-2.0
Les applications utilisant grok-voice-latest seront mises à niveau sans aucune modification.
Cependant, les équipes ayant besoin d’un comportement stable doivent explicitement fixer la version.
Pour rester sur la version 1.0 :
grok-voice-think-fast-1.0
Pour adopter dès maintenant le nouveau modèle :
grok-voice-think-fast-2.0
La fixation de version est particulièrement importante pour les systèmes de production avec des flux de travail réglementés, des références d’évaluation fixes ou des besoins en gestion des changements.
Les instructions existantes ne nécessitent généralement pas de modification
xAI indique que Think Fast 2.0 est conçu pour améliorer la plupart des applications existantes sans modifier les instructions.
Cela rend la migration relativement simple, mais les équipes de production doivent tout de même effectuer des tests de régression.
La mise à niveau du modèle vocal peut affecter la longueur des réponses, le timing, les tours de parole, la fréquence des appels d’outils, les questions de clarification, les mécanismes d’escalade, la transcription, la prononciation et la collecte de données structurées.
Un processus de migration raisonnable est le suivant :
- Fixer le modèle 1.0 existant.
- Exécuter les mêmes dialogues de test sur la version 2.0.
- Comparer le taux de succès des tâches et l’utilisation des outils.
- Tester le bruit et la qualité audio téléphonique.
- Vérifier la gestion des interruptions.
- Examiner la latence.
- Mesurer le coût par tâche accomplie.
- Migrer progressivement le trafic de production.
Connexion minimale à Grok Voice
Le rapport original d’AIBase ne contenait pas de code, mais la documentation officielle de xAI fournit un exemple simple de connexion WebSocket à l’API vocale.
Sélectionner le modèle via l’URL WebSocket :
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
Ensuite, la session peut définir la voix, les instructions et la détection des tours de parole :
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "Tu es un assistant de support client concis.",
"turn_detection": {
"type": "server_vad"
}
}
}
Pour les clients navigateur ou mobile, xAI recommande l’utilisation de jetons temporaires plutôt que d’exposer des clés API à longue durée de vie au client. Les applications côté serveur peuvent s’authentifier via une clé API dans l’en-tête d’autorisation.
Formats audio pris en charge
L’API vocale prend actuellement en charge :
| Format | Utilisation typique |
|---|---|
| PCM | Audio haute qualité général |
G.711 μ-law / audio/pcmu | Audio téléphonique |
G.711 A-law / audio/pcma | Systèmes téléphoniques |
| Opus | Audio en temps réel compressé |
PCM prend en charge 8
Taux d'échantillonnage de plusieurs kHz à 48 kHz.
Pour les applications vocales classiques, la documentation officielle recommande par défaut du PCM à 24 kHz. Le support natif du G.711 est utile pour les systèmes téléphoniques, car il réduit le besoin de transcodage supplémentaire dans certains environnements téléphoniques.
Cas d'utilisation idéaux pour Think Fast 2.0
Cette version est principalement destinée aux flux de travail des agents en temps réel, et non à la simple transcription hors ligne.
Support client
Le modèle peut écouter les questions des clients, rechercher des informations approuvées, utiliser des outils de gestion de compte et effectuer un dépannage en plusieurs étapes.
Télévente
Les agents vocaux peuvent répondre aux questions, identifier les prospects, utiliser des outils de vente et guider les appelants tout au long du processus d'achat.
Agent de réservation et de prise de rendez-vous
Le système peut collecter des informations sur les dates, les horaires, les noms et les préférences tout en appelant l'API de planification.
Assistant interne d'entreprise
Les employés peuvent interagir vocalement avec les systèmes d'entreprise, tandis que le modèle appelle des outils internes ou recherche dans une base de connaissances approuvée.
Services vocaux multilingues
La plateforme Grok Voice de xAI prend en charge plus de 25 langues, rendant ce modèle adapté aux opérations de support mondiales.
Ce que les développeurs doivent encore tester par eux-mêmes
Les données de référence sont utiles, mais ne permettent pas de déterminer si le modèle convient à une application spécifique.
Avant le déploiement en production, veuillez tester les accents réels des appelants, les codecs téléphoniques, le bruit de fond, les noms de produits, les noms de clients, les adresses, les longs numéros de compte, les interruptions, les silences, les changements d'avis de l'utilisateur, les pannes d'outils, les résultats erronés des outils, les conditions de transfert vers un opérateur humain, ainsi que les règles de sécurité ou de conformité.
Un temps de première réponse audio de 0,70 seconde n'a de valeur que si la réponse est correcte. De même, un score de référence élevé ne garantit pas que l'agent suivra la politique de remboursement spécifique de l'entreprise ou saisira correctement des noms de clients peu courants.
Questions fréquentes
Qu'est-ce que Grok Voice Think Fast 2.0 ?
Grok Voice Think Fast 2.0 est la nouvelle génération de modèle vocal-à-vocal de xAI, conçu pour les agents vocaux en temps réel. Il intègre l'interaction audio native, le raisonnement, la gestion des tours de parole, la transcription et l'utilisation d'outils.
Combien coûte Grok Voice Think Fast 2.0 ?
xAI a fixé le prix de ce modèle à 0,08 $ par minute audio, soit 4,80 $ de l'heure. Les appels d'outils et certaines autres fonctionnalités de l'API peuvent entraîner des frais supplémentaires.
Think Fast 2.0 est-il plus rapide que Think Fast 1.0 ?
Oui. xAI et Artificial Analysis rapportent que le temps de première réponse audio est passé de 1,25 seconde à 0,70 seconde.
Est-il supérieur à GPT-Realtime-2.1 ?
Dans l'indice global de qualité vocale-à-vocal d'Artificial Analysis et le benchmark τ-voix-agent, Think Fast 2.0 obtient des scores plus élevés dans les comparaisons publiées. GPT-Realtime-2.1 High conserve un léger avantage sur le benchmark full-duplex, Think Fast 2.0 n'est donc pas en tête sur tous les indicateurs individuels.
Dois-je réécrire mes prompts pour la version 2.0 ?
xAI indique que la plupart des applications bénéficieront d'une amélioration des performances sans modification des prompts. Les équipes de production doivent néanmoins effectuer des tests de régression, car le timing, l'utilisation des outils, le mode de gestion des tours et le style de réponse peuvent varier selon la version du modèle.
Quand grok-voice-latest basculera-t-il vers Think Fast 2.0 ?
xAI indique que cet alias basculera automatiquement le 5 août 2026.
Les développeurs qui souhaitent continuer à utiliser la version 1.0 doivent verrouiller grok-voice-think-fast-1.0.
Grok Voice Think Fast 2.0 peut-il utiliser des outils ?
Oui. L'API vocale-à-vocale actuelle prend en charge les fonctions personnalisées, la recherche de fichiers, la recherche web, la recherche X et les outils MCP à distance.
Think Fast 2.0 est-il uniquement destiné au support client ?
Non. Le support client et la vente sont des cas d'utilisation typiques, mais le modèle peut également être utilisé pour d'autres flux de travail d'agents vocaux en temps réel, tels que les services de réservation, les assistants d'entreprise et les applications interactives.
Outils connexes
- Grok Voice Think Fast 2.0 : Annonce officielle de xAI pour son nouveau modèle vocal phare.
- Grok Voice API : Documentation officielle de l'API vocale-à-vocale, couvrant la sélection du modèle, les formats audio, les outils et la configuration des sessions.
- Grok Voice Agent Builder : Environnement sans code de xAI pour construire des agents vocaux de production.
- Classement vocal-à-vocal d'Artificial Analysis : Comparaison indépendante couvrant le raisonnement vocal, la dynamique conversationnelle, les performances agent, la vitesse et la tarification.
- Deepgram Nova : Plateforme de reconnaissance vocale de référence dans les comparaisons de transcription de xAI.
- ElevenLabs : Plateforme d'IA vocale dont le modèle Scribe est inclus dans les évaluations de transcription de xAI.
Liens associés
- Présentation de Grok Voice Think Fast 2.0 : Annonce officielle incluant les benchmarks, les résultats de transcription, l'efficacité du raisonnement, les tests Starlink, la migration et la tarification.
- Documentation de l'API vocale-à-vocale : Guide officiel de mise en œuvre pour les applications Grok Voice en temps réel.
- Tarification de l'API xAI : Tarifs actuels pour la voix, la reconnaissance vocale, la synthèse vocale et les outils.
- Modèles vocaux-à-vocaux d'Artificial Analysis : Données de référence indépendantes utilisées dans la comparaison de lancement de xAI.
- Grok Voice Think Fast 1.0 : Modèle de la génération précédente et ses résultats de production avec Starlink.
- Grok Voice Agent Builder : Informations officielles sur la téléphonie, les outils, les garde-fous, l'observabilité, le support SIP et la configuration des agents.
- API de reconnaissance et de synthèse vocale Grok : Détails officiels sur les API audio indépendantes de xAI.
Résumé
Grok Voice Think Fast 2.0 améliore la pile technologique vocale en temps réel de xAI dans les domaines les plus critiques pour les agents de production : l'accomplissement des tâches agent, la dynamique conversationnelle, la précision de la transcription et la latence.
Le modèle atteint un score de 82,9 % dans l'indice de qualité vocale-à-vocale d'Artificial Analysis, un score τ-voix de 56,5 %, et un temps de première réponse audio de 0,70 seconde. xAI rapporte également de meilleures performances de transcription dans 24 langues, une efficacité de raisonnement accrue permettant des appels d'outils plus précoces dans les réponses vocales.
Les développeurs peuvent désormais utiliser le modèle au tarif de 0,08 $ par minute audio. Les utilisateurs existants doivent également noter que grok-voice-latest devrait automatiquement passer de Think Fast 1.0 à Think Fast 2.0 le 5 août 2026.
Cette mise à niveau n'est pas simplement un modèle vocal plus intelligent, mais un agent plus orienté production, capable d'écouter, de raisonner, de converser et d'utiliser des outils avec une latence réduite.



