Grok Voice Think Fast 2.0: el modelo de agente de voz más rápido y preciso de xAI Guía de Grok Voice Think Fast 2.0: pruebas de referencia, ...

xAI ha lanzado Grok Voice Think Fast 2.0, su modelo de voz a voz de próxima generación para desarrollar agentes de voz en tiempo real.
La nueva versión se centra en los cuatro aspectos más importantes para los sistemas de voz de producción: nivel de inteligencia, precisión de transcripción, comportamiento conversacional y llamadas a herramientas confiables. xAI afirma que, en la mayoría de los casos, las aplicaciones existentes pueden migrar al nuevo modelo sin necesidad de reescribir los prompts.
Think Fast 2.0 tiene un precio de 0.08 USD por minuto de audio. Los desarrolladores pueden usar el nombre del modelo con versión grok-voice-think-fast-2.0, mientras que el alias grok-voice-latest está programado para cambiar de la versión 1.0 a la 2.0 el 5 de agosto de 2026.
Este modelo está diseñado para cargas de trabajo reales de agentes de voz, como atención al cliente, ventas, automatización telefónica y flujos de trabajo empresariales de varios pasos, donde el agente debe comprender el habla, razonar, llamar a herramientas y responder rápidamente para mantener el flujo natural de la conversación.
xAI ha publicado resultados de benchmarks de Artificial Analysis, comparando Think Fast 2.0 con su predecesor, GPT-Realtime-2.1 de OpenAI y Gemini 3.1 Flash de Google.

Los resultados reportados son los siguientes:
| Benchmark | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| Índice de calidad voz a voz AA | 82.9% | 75.7% | 79.1% | 69.5% |
| Big Bench Audio | 97.2% | 97.1% | 96.0% | 96.6% |
| Prueba Full-Dúplex | 95.1% | 77.8% | 95.7% | 74.3% |
| Prueba τ-Voice | 56.5% | 52.1% | 45.7% | 37.7% |
| Tiempo de primera respuesta de audio | 0.70 s | 1.25 s | — | 2.98 s |
En comparación con Think Fast 1.0, el índice general de calidad voz a voz de Artificial Analysis mejoró de 75.7% a 82.9%.
Los cambios prácticos más notables se dan en la dinámica conversacional, el rendimiento del agente y la latencia de respuesta.
En la prueba Big Bench Audio, Think Fast 2.0 obtuvo 97.2%, solo ligeramente por encima del 97.1% de la generación anterior.
Esto indica que este lanzamiento no busca un salto significativo en la capacidad bruta de razonamiento de voz. En cambio, la mayoría de las mejoras se reflejan en el comportamiento del modelo durante conversaciones en tiempo real.
Think Fast 2.0 alcanzó 95.1% en la prueba Full-Dúplex, mientras que Think Fast 1.0 obtuvo 77.8%.
La prueba Full-Dúplex evalúa comportamientos como saber cuándo hablar, manejar pausas, gestionar interrupciones, identificar señales de retroalimentación y mantener un cambio de turno natural.
GPT-Realtime-2.1 High obtuvo un puntaje ligeramente superior en esta prueba individual, con un 95.7%, por lo que el modelo de xAI no lidera en todas las categorías.
En la prueba τ-Voice, que evalúa más la capacidad de los agentes de voz para completar tareas reales, Think Fast 2.0 obtuvo 56.5%.
Este resultado es superior al 52.1% de Think Fast 1.0, al 45.7% de GPT-Realtime-2.1 High y al 37.7% de Gemini 3.1 Flash High.
Este indicador es especialmente importante para agentes de atención al cliente y ventas, ya que no basta con un audio de conversación de buena calidad. El sistema también debe seguir instrucciones correctamente, usar herramientas, recopilar información y completar flujos de trabajo.
xAI informa que el tiempo de primera respuesta de audio es de 0.70 segundos, inferior a los 1.25 segundos de Think Fast 1.0.
Una latencia más baja reduce el silencio incómodo entre el momento en que el usuario termina de hablar y el inicio de la respuesta de la IA.
Artificial Analysis clasifica actualmente a Think Fast 2.0 como uno de los sistemas de voz a voz más rápidos que ha medido, aunque no es el modelo más rápido de todo el ranking.
xAI también evaluó Think Fast 2.0 usando miles de muestras de voz cortas en 24 idiomas.
Según la compañía, en sus evaluaciones, la precisión de transcripción del nuevo modelo es aproximadamente 1.5-2.0 veces mayor que la de Deepgram Nova 3 y ElevenLabs Scribe v2, y aproximadamente 1.4 veces mayor que la de Grok Voice Think Fast 1.0.
xAI
También indican que, en entornos ruidosos y con compresión telefónica, la brecha puede aumentar hasta aproximadamente 10 veces.
Estos datos provienen de las evaluaciones de transcripción propias de xAI, no de tablas de referencia de análisis de inteligencia artificial. Esta distinción es importante porque las comparaciones de referencia y los experimentos de transcripción miden diferentes métricas y provienen de diferentes configuraciones de evaluación.
El énfasis en el audio ruidoso es significativo para los agentes de voz en entornos de producción. Las llamadas reales a menudo incluyen compresión de redes móviles, micrófonos de baja calidad, ruido de la calle o de la oficina, acentos, habla rápida, interrupciones, oraciones incompletas, nombres, direcciones y detalles de cuentas.
Una de las opciones de diseño más singulares en Grok Voice Think Fast es el razonamiento paralelo.
xAI
El modelo puede seguir razonando mientras habla, en lugar de completar todo el razonamiento antes de generar el audio. Este diseño tiene como objetivo reducir la compensación entre inteligencia y latencia.
Think Fast 2.0 también utiliza menos tokens de razonamiento que su predecesor. xAI informa el uso relativo mediano de tokens de razonamiento de la siguiente manera:
| Modelo | Tokens de razonamiento relativos por respuesta |
|---|---|
| Grok Voice Think Fast 2.0 | 0.4× |
| Grok Voice Think Fast 1.0 | 1.0× |
La compañía afirma que esto acelera las llamadas a herramientas, lo que normalmente permite que las herramientas se ejecuten antes de que el asistente inteligente termine de decir su primera frase.
Por ejemplo, un asistente de atención al cliente podría comenzar diciendo "Déjeme consultar...", mientras en segundo plano invoca una herramienta de consulta de cuenta. Cuando termina la introducción hablada, el resultado de la herramienta podría estar listo para la siguiente parte de la respuesta.
xAI indica que Think Fast 2.0, entrenado con una gran cantidad de aprendizaje por refuerzo, se asemeja más a un agente humano práctico en conversaciones reales.
Se anima al modelo a usar oraciones más cortas, hacer una sola pregunta a la vez, evitar palabras de relleno innecesarias, mantener el enfoque de la conversación y no exponer complejidades innecesarias al guiar al usuario a través de procesos complejos.
Esto puede parecer un cambio pequeño, pero las interfaces de voz toleran mucho menos las respuestas largas que el chat de texto. Las respuestas largas pueden ser aceptables en la pantalla, pero escucharlas en una llamada resulta frustrante.
Actualmente, la API de voz a voz de xAI admite directamente varios tipos de herramientas en las sesiones de voz:
file_searchweb_searchx_searchEsto permite que los asistentes de voz vayan más allá de simples preguntas y respuestas.
Según los permisos proporcionados por la aplicación, el asistente inteligente puede entender la solicitud de la persona que llama, buscar en documentos aprobados, consultar información de la cuenta, invocar API empresariales, ejecutar acciones permitidas y explicar los resultados mediante voz.
Para entornos de producción, las aplicaciones aún deben establecer límites de permisos estrictos. Incluso si el modelo tiene la capacidad de invocar herramientas sensibles, no se le debe otorgar acceso directamente.
Grok Voice ya se utiliza en los flujos de trabajo de ventas y atención al cliente basados en teléfono de Starlink.
xAI afirma que ha realizado pruebas A/B de Think Fast 2.0 en las líneas telefónicas de Starlink a través del +1 888 GO STARLINK.
La compañía informa mejoras significativas en las tasas de conversión de ventas y en las tasas de resolución de problemas de atención al cliente.
xAI no publicó los porcentajes de mejora específicos de la prueba A/B de Think Fast 2.0 en el anuncio.
Esto no debe confundirse con los datos públicos anteriores del despliegue original de Think Fast 1.0. xAI informó en ese momento de una tasa de conversión de ventas del 20% y una tasa de resolución autónoma de problemas de atención al cliente del 70%. El anuncio de la versión 2.0 solo indica que la nueva versión mejora los resultados existentes de Starlink.
La página de precios oficial de xAI enumera:
| Modelo de voz | Precio de audio |
|---|---|
grok-voice-think-fast-1.0 | 0,05 USD/minuto |
grok-voice-think-fast-2.0 | 0,08 USD/minuto |
Por lo tanto, el costo de audio de Think Fast 2.0 es de 4,80 USD por hora,
las tarifas de API publicadas.
La entrada de texto de la API de voz a voz se factura por separado a 0,004 USD.
Las herramientas adicionales del lado del servidor también pueden generar costos independientes. Por ejemplo, xAI actualmente fija el precio de la búsqueda web, la búsqueda X y la ejecución de código en 5 USD por cada 1000 llamadas a herramientas.
Por lo tanto, los desarrolladores deben calcular el costo total basándose en el flujo de trabajo completo, no solo multiplicando la tarifa de audio.
grok-voice-latest cambiará a la versión 2.0 el 5 de agosto de 2026Los desarrolladores que ya utilizan la API de voz de Grok deben prestar atención al alias del modelo.
La documentación actual indica:
grok-voice-latest
apunta a:
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
grok-voice-think-fast-1.0
hasta el 5 de agosto de 2026.
El 5 de agosto de 2026, este alias cambiará automáticamente a:
grok-voice-think-fast-2.0
Las aplicaciones que usan grok-voice-latest obtendrán la actualización sin ningún cambio.
Sin embargo, los equipos que necesiten un comportamiento estable deberían fijar explícitamente la versión.
Para permanecer en la versión 1.0:
grok-voice-think-fast-1.0
Para adoptar el nuevo modelo inmediatamente:
grok-voice-think-fast-2.0
La fijación de versiones es especialmente importante para sistemas de producción con flujos de trabajo regulados, líneas base de evaluación fijas o necesidades de gestión de cambios.
xAI indica que Think Fast 2.0 está diseñado para mejorar la mayoría de las aplicaciones existentes sin necesidad de modificar los prompts.
Esto hace que la migración sea relativamente simple, pero los equipos de producción aún deben ejecutar pruebas de regresión.
Las actualizaciones del modelo de voz pueden afectar la longitud de las respuestas, el tiempo, los turnos de palabra, la frecuencia de llamadas a herramientas, las preguntas aclaratorias, los mecanismos de escalada, las transcripciones, la pronunciación y la recopilación de datos estructurados.
Un proceso de migración razonable sería:
El informe original de AIBase no incluía código, pero la documentación oficial de xAI proporciona un ejemplo simple de WebSocket para conectar a la API de voz a voz.
Seleccionar el modelo a través de la URL de WebSocket:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
Luego, la sesión puede definir la voz, las instrucciones y la detección de turnos:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "Eres un asistente de soporte al cliente conciso.",
"turn_detection": {
"type": "server_vad"
}
}
}
Para clientes de navegador o móviles, xAI recomienda usar tokens temporales, en lugar de exponer claves API de larga duración al cliente. Las aplicaciones del lado del servidor pueden autenticarse mediante claves API en el encabezado de autorización.
La API de voz a voz actualmente admite:
| Formato | Uso típico |
|---|---|
| PCM | Audio de alta calidad de uso general |
G.711 μ-law / audio/pcmu | Audio telefónico |
G.711 A-law / audio/pcma | Sistemas telefónicos |
| Opus | Audio en tiempo real comprimido |
El soporte de PCM varía desde 8
kHz a 48 kHz.
Para aplicaciones de voz generales, la documentación oficial recomienda PCM a 24 kHz. La compatibilidad nativa con G.711 resulta útil para sistemas telefónicos, ya que reduce la necesidad de transcodificación adicional en algunos de ellos.
Esta versión está diseñada principalmente para flujos de trabajo de agentes en tiempo real, no para transcripción offline simple.
El modelo puede escuchar preguntas de los clientes, buscar información aprobada, utilizar herramientas de cuenta y realizar diagnósticos de múltiples pasos.
Los agentes de voz pueden responder preguntas, identificar clientes potenciales, usar herramientas de ventas y guiar a los llamantes a través del proceso de compra.
El sistema puede recopilar información como fechas, horarios, nombres y preferencias mientras invoca APIs de programación.
Los empleados pueden interactuar con los sistemas empresariales por voz, mientras el modelo invoca herramientas internas o busca en bases de conocimiento autorizadas.
La plataforma Grok Voice de xAI admite más de 25 idiomas, lo que hace que el modelo sea adecuado para operaciones de soporte global.
Los datos de referencia son útiles, pero no determinan si un modelo es adecuado para una aplicación específica.
Antes del despliegue en producción, pruebe con acentos reales de llamantes, códecs telefónicos, ruido de fondo, nombres de productos, nombres de clientes, direcciones, números de cuenta largos, interrupciones, silencios, cambios de opinión del usuario, fallos de herramientas, resultados incorrectos de herramientas, condiciones de transferencia a humano, y reglas de seguridad o cumplimiento normativo.
Un tiempo hasta el primer audio de 0,70 segundos solo tiene valor si la respuesta es correcta. Del mismo modo, una puntuación alta en benchmarks no garantiza que el agente siga una política de reembolso específica de la empresa o introduzca correctamente nombres de cliente poco comunes.
Grok Voice Think Fast 2.0 es el nuevo modelo de voz a voz de xAI, diseñado para agentes de voz en tiempo real. Integra interacción de audio nativa, razonamiento, intercambio de turnos conversacionales, transcripción y uso de herramientas.
xAI ha fijado el precio de este modelo en 0,08 dólares por minuto de audio, lo que equivale a 4,80 dólares por hora. Las llamadas a herramientas y otras funciones de la API pueden generar costos adicionales.
Sí. xAI y Artificial Analysis informan que el tiempo hasta el primer audio se ha reducido de 1,25 segundos a 0,70 segundos.
En el Índice de Calidad General Voz a Voz de Artificial Analysis y en la benchmark τ-Voice Agent, Think Fast 2.0 obtiene puntuaciones más altas en las comparativas publicadas. GPT-Realtime-2.1 High aún mantiene una ligera ventaja en la benchmark full-duplex, por lo que Think Fast 2.0 no lidera en todos los indicadores individuales.
xAI indica que la mayoría de las aplicaciones obtendrán mejoras de rendimiento sin cambios en los prompts. Los equipos de producción deben seguir realizando pruebas de regresión, ya que los tiempos, el uso de herramientas, la forma de alternar turnos y el estilo de respuesta pueden variar según la versión del modelo.
grok-voice-latest a Think Fast 2.0?xAI ha informado que este alias cambiará automáticamente el 5 de agosto de 2026.
Los desarrolladores que necesiten seguir usando la versión 1.0 deben fijar grok-voice-think-fast-1.0.
Sí. La API actual de voz a voz admite funciones personalizadas, búsqueda de archivos, búsqueda web, búsqueda en X y herramientas MCP remotas.
No. La atención al cliente y las ventas son casos de uso típicos, pero el modelo también es adecuado para otros flujos de trabajo de agentes de voz en tiempo real, como servicios de reservas, asistentes empresariales y aplicaciones interactivas.
Grok Voice Think Fast 2.0 mejora el stack tecnológico de voz en tiempo real de xAI en las áreas más críticas para los agentes de producción: finalización de tareas del agente, dinámicas conversacionales, precisión de transcripción y latencia.
El modelo alcanza un 82,9% en el Índice de Calidad Voz a Voz de Artificial Analysis, una puntuación τ-voice del 56,5% y un tiempo de primera respuesta de audio de 0,70 segundos. xAI también informa de un mejor rendimiento en la transcripción de 24 idiomas, una mayor eficiencia de razonamiento y la capacidad de ejecutar llamadas a herramientas más temprano en las respuestas de voz.
Los desarrolladores pueden usar el modelo ahora, a un precio de 0,08 dólares por minuto de audio. Los usuarios
actuales también deben tener en cuenta que grok-voice-latest tiene previsto cambiar automáticamente de Think Fast 1.0 a Think Fast 2.0 el 5 de agosto de 2026.
Esta actualización no es solo un modelo de voz más inteligente, sino un agente más orientado a la producción, capaz de escuchar, razonar, conversar e invocar herramientas con menor latencia.
Empieza con una sola frase y obtén un sitio completo en minutos.