Introducción
xAI ha lanzado Grok Voice Think Fast 2.0, su modelo de voz a voz de próxima generación para desarrollar agentes de voz en tiempo real.
La nueva versión se centra en los cuatro aspectos más importantes para los sistemas de voz de producción: nivel de inteligencia, precisión de transcripción, comportamiento conversacional y llamadas a herramientas confiables. xAI afirma que, en la mayoría de los casos, las aplicaciones existentes pueden migrar al nuevo modelo sin necesidad de reescribir los prompts.
Think Fast 2.0 tiene un precio de 0.08 USD por minuto de audio. Los desarrolladores pueden usar el nombre del modelo con versión grok-voice-think-fast-2.0, mientras que el alias grok-voice-latest está programado para cambiar de la versión 1.0 a la 2.0 el 5 de agosto de 2026.
Este modelo está diseñado para cargas de trabajo reales de agentes de voz, como atención al cliente, ventas, automatización telefónica y flujos de trabajo empresariales de varios pasos, donde el agente debe comprender el habla, razonar, llamar a herramientas y responder rápidamente para mantener el flujo natural de la conversación.
Grok Voice Think Fast 2.0 mejora en todos los benchmarks principales de voz
xAI ha publicado resultados de benchmarks de Artificial Analysis, comparando Think Fast 2.0 con su predecesor, GPT-Realtime-2.1 de OpenAI y Gemini 3.1 Flash de Google.

Los resultados reportados son los siguientes:
| Benchmark | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| Índice de calidad voz a voz AA | 82.9% | 75.7% | 79.1% | 69.5% |
| Big Bench Audio | 97.2% | 97.1% | 96.0% | 96.6% |
| Prueba Full-Dúplex | 95.1% | 77.8% | 95.7% | 74.3% |
| Prueba τ-Voice | 56.5% | 52.1% | 45.7% | 37.7% |
| Tiempo de primera respuesta de audio | 0.70 s | 1.25 s | — | 2.98 s |
En comparación con Think Fast 1.0, el índice general de calidad voz a voz de Artificial Analysis mejoró de 75.7% a 82.9%.
Los cambios prácticos más notables se dan en la dinámica conversacional, el rendimiento del agente y la latencia de respuesta.
Razonamiento de voz
En la prueba Big Bench Audio, Think Fast 2.0 obtuvo 97.2%, solo ligeramente por encima del 97.1% de la generación anterior.
Esto indica que este lanzamiento no busca un salto significativo en la capacidad bruta de razonamiento de voz. En cambio, la mayoría de las mejoras se reflejan en el comportamiento del modelo durante conversaciones en tiempo real.
Dinámicas conversacionales
Think Fast 2.0 alcanzó 95.1% en la prueba Full-Dúplex, mientras que Think Fast 1.0 obtuvo 77.8%.
La prueba Full-Dúplex evalúa comportamientos como saber cuándo hablar, manejar pausas, gestionar interrupciones, identificar señales de retroalimentación y mantener un cambio de turno natural.
GPT-Realtime-2.1 High obtuvo un puntaje ligeramente superior en esta prueba individual, con un 95.7%, por lo que el modelo de xAI no lidera en todas las categorías.
Rendimiento del agente
En la prueba τ-Voice, que evalúa más la capacidad de los agentes de voz para completar tareas reales, Think Fast 2.0 obtuvo 56.5%.
Este resultado es superior al 52.1% de Think Fast 1.0, al 45.7% de GPT-Realtime-2.1 High y al 37.7% de Gemini 3.1 Flash High.
Este indicador es especialmente importante para agentes de atención al cliente y ventas, ya que no basta con un audio de conversación de buena calidad. El sistema también debe seguir instrucciones correctamente, usar herramientas, recopilar información y completar flujos de trabajo.
Primera respuesta de audio más rápida
xAI informa que el tiempo de primera respuesta de audio es de 0.70 segundos, inferior a los 1.25 segundos de Think Fast 1.0.
Una latencia más baja reduce el silencio incómodo entre el momento en que el usuario termina de hablar y el inicio de la respuesta de la IA.
Artificial Analysis clasifica actualmente a Think Fast 2.0 como uno de los sistemas de voz a voz más rápidos que ha medido, aunque no es el modelo más rápido de todo el ranking.
Mejora en la precisión de transcripción en 24 idiomas
xAI también evaluó Think Fast 2.0 usando miles de muestras de voz cortas en 24 idiomas.
Según la compañía, en sus evaluaciones, la precisión de transcripción del nuevo modelo es aproximadamente 1.5-2.0 veces mayor que la de Deepgram Nova 3 y ElevenLabs Scribe v2, y aproximadamente 1.4 veces mayor que la de Grok Voice Think Fast 1.0.
xAI
También indican que, en entornos ruidosos y con compresión telefónica, la brecha puede aumentar hasta aproximadamente 10 veces.
Estos datos provienen de las evaluaciones de transcripción propias de xAI, no de tablas de referencia de análisis de inteligencia artificial. Esta distinción es importante porque las comparaciones de referencia y los experimentos de transcripción miden diferentes métricas y provienen de diferentes configuraciones de evaluación.
El énfasis en el audio ruidoso es significativo para los agentes de voz en entornos de producción. Las llamadas reales a menudo incluyen compresión de redes móviles, micrófonos de baja calidad, ruido de la calle o de la oficina, acentos, habla rápida, interrupciones, oraciones incompletas, nombres, direcciones y detalles de cuentas.
El modelo razona mientras habla
Una de las opciones de diseño más singulares en Grok Voice Think Fast es el razonamiento paralelo.
xAI
El modelo puede seguir razonando mientras habla, en lugar de completar todo el razonamiento antes de generar el audio. Este diseño tiene como objetivo reducir la compensación entre inteligencia y latencia.
Think Fast 2.0 también utiliza menos tokens de razonamiento que su predecesor. xAI informa el uso relativo mediano de tokens de razonamiento de la siguiente manera:
| Modelo | Tokens de razonamiento relativos por respuesta |
|---|---|
| Grok Voice Think Fast 2.0 | 0.4× |
| Grok Voice Think Fast 1.0 | 1.0× |
La compañía afirma que esto acelera las llamadas a herramientas, lo que normalmente permite que las herramientas se ejecuten antes de que el asistente inteligente termine de decir su primera frase.
Por ejemplo, un asistente de atención al cliente podría comenzar diciendo "Déjeme consultar...", mientras en segundo plano invoca una herramienta de consulta de cuenta. Cuando termina la introducción hablada, el resultado de la herramienta podría estar listo para la siguiente parte de la respuesta.
El aprendizaje por refuerzo hace que las conversaciones sean más concisas
xAI indica que Think Fast 2.0, entrenado con una gran cantidad de aprendizaje por refuerzo, se asemeja más a un agente humano práctico en conversaciones reales.
Se anima al modelo a usar oraciones más cortas, hacer una sola pregunta a la vez, evitar palabras de relleno innecesarias, mantener el enfoque de la conversación y no exponer complejidades innecesarias al guiar al usuario a través de procesos complejos.
Esto puede parecer un cambio pequeño, pero las interfaces de voz toleran mucho menos las respuestas largas que el chat de texto. Las respuestas largas pueden ser aceptables en la pantalla, pero escucharlas en una llamada resulta frustrante.
El uso de herramientas es una parte central de la API de voz
Actualmente, la API de voz a voz de xAI admite directamente varios tipos de herramientas en las sesiones de voz:
file_searchweb_searchx_search- Herramientas MCP remotas
- Funciones personalizadas
Esto permite que los asistentes de voz vayan más allá de simples preguntas y respuestas.
Según los permisos proporcionados por la aplicación, el asistente inteligente puede entender la solicitud de la persona que llama, buscar en documentos aprobados, consultar información de la cuenta, invocar API empresariales, ejecutar acciones permitidas y explicar los resultados mediante voz.
Para entornos de producción, las aplicaciones aún deben establecer límites de permisos estrictos. Incluso si el modelo tiene la capacidad de invocar herramientas sensibles, no se le debe otorgar acceso directamente.
Starlink está probando A/B Think Fast 2.0
Grok Voice ya se utiliza en los flujos de trabajo de ventas y atención al cliente basados en teléfono de Starlink.
xAI afirma que ha realizado pruebas A/B de Think Fast 2.0 en las líneas telefónicas de Starlink a través del +1 888 GO STARLINK.
La compañía informa mejoras significativas en las tasas de conversión de ventas y en las tasas de resolución de problemas de atención al cliente.
xAI no publicó los porcentajes de mejora específicos de la prueba A/B de Think Fast 2.0 en el anuncio.
Esto no debe confundirse con los datos públicos anteriores del despliegue original de Think Fast 1.0. xAI informó en ese momento de una tasa de conversión de ventas del 20% y una tasa de resolución autónoma de problemas de atención al cliente del 70%. El anuncio de la versión 2.0 solo indica que la nueva versión mejora los resultados existentes de Starlink.
Precio: 0,08 USD por minuto
La página de precios oficial de xAI enumera:
| Modelo de voz | Precio de audio |
|---|---|
grok-voice-think-fast-1.0 | 0,05 USD/minuto |
grok-voice-think-fast-2.0 | 0,08 USD/minuto |
Por lo tanto, el costo de audio de Think Fast 2.0 es de 4,80 USD por hora,
las tarifas de API publicadas.
La entrada de texto de la API de voz a voz se factura por separado a 0,004 USD.
Las herramientas adicionales del lado del servidor también pueden generar costos independientes. Por ejemplo, xAI actualmente fija el precio de la búsqueda web, la búsqueda X y la ejecución de código en 5 USD por cada 1000 llamadas a herramientas.
Por lo tanto, los desarrolladores deben calcular el costo total basándose en el flujo de trabajo completo, no solo multiplicando la tarifa de audio.
grok-voice-latest cambiará a la versión 2.0 el 5 de agosto de 2026
Los desarrolladores que ya utilizan la API de voz de Grok deben prestar atención al alias del modelo.
La documentación actual indica:
grok-voice-latest
apunta a:
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
grok-voice-think-fast-1.0
hasta el 5 de agosto de 2026.
El 5 de agosto de 2026, este alias cambiará automáticamente a:
grok-voice-think-fast-2.0
Las aplicaciones que usan grok-voice-latest obtendrán la actualización sin ningún cambio.
Sin embargo, los equipos que necesiten un comportamiento estable deberían fijar explícitamente la versión.
Para permanecer en la versión 1.0:
grok-voice-think-fast-1.0
Para adoptar el nuevo modelo inmediatamente:
grok-voice-think-fast-2.0
La fijación de versiones es especialmente importante para sistemas de producción con flujos de trabajo regulados, líneas base de evaluación fijas o necesidades de gestión de cambios.
Los prompts existentes generalmente no necesitan cambios
xAI indica que Think Fast 2.0 está diseñado para mejorar la mayoría de las aplicaciones existentes sin necesidad de modificar los prompts.
Esto hace que la migración sea relativamente simple, pero los equipos de producción aún deben ejecutar pruebas de regresión.
Las actualizaciones del modelo de voz pueden afectar la longitud de las respuestas, el tiempo, los turnos de palabra, la frecuencia de llamadas a herramientas, las preguntas aclaratorias, los mecanismos de escalada, las transcripciones, la pronunciación y la recopilación de datos estructurados.
Un proceso de migración razonable sería:
- Fijar el modelo 1.0 existente.
- Ejecutar las mismas conversaciones de prueba en 2.0.
- Comparar la tasa de éxito de las tareas y el uso de herramientas.
- Probar con audio ruidoso y de calidad telefónica.
- Verificar el manejo de interrupciones.
- Revisar la latencia.
- Medir el costo por tarea completada.
- Migrar el tráfico de producción gradualmente.
Minimizando la conexión de Grok Voice
El informe original de AIBase no incluía código, pero la documentación oficial de xAI proporciona un ejemplo simple de WebSocket para conectar a la API de voz a voz.
Seleccionar el modelo a través de la URL de WebSocket:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
Luego, la sesión puede definir la voz, las instrucciones y la detección de turnos:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "Eres un asistente de soporte al cliente conciso.",
"turn_detection": {
"type": "server_vad"
}
}
}
Para clientes de navegador o móviles, xAI recomienda usar tokens temporales, en lugar de exponer claves API de larga duración al cliente. Las aplicaciones del lado del servidor pueden autenticarse mediante claves API en el encabezado de autorización.
Formatos de audio compatibles
La API de voz a voz actualmente admite:
| Formato | Uso típico |
|---|---|
| PCM | Audio de alta calidad de uso general |
G.711 μ-law / audio/pcmu | Audio telefónico |
G.711 A-law / audio/pcma | Sistemas telefónicos |
| Opus | Audio en tiempo real comprimido |
El soporte de PCM varía desde 8
kHz a 48 kHz.
Para aplicaciones de voz generales, la documentación oficial recomienda PCM a 24 kHz. La compatibilidad nativa con G.711 resulta útil para sistemas telefónicos, ya que reduce la necesidad de transcodificación adicional en algunos de ellos.
Escenarios más adecuados para Think Fast 2.0
Esta versión está diseñada principalmente para flujos de trabajo de agentes en tiempo real, no para transcripción offline simple.
Atención al cliente
El modelo puede escuchar preguntas de los clientes, buscar información aprobada, utilizar herramientas de cuenta y realizar diagnósticos de múltiples pasos.
Televentas
Los agentes de voz pueden responder preguntas, identificar clientes potenciales, usar herramientas de ventas y guiar a los llamantes a través del proceso de compra.
Agentes de reservas y citas
El sistema puede recopilar información como fechas, horarios, nombres y preferencias mientras invoca APIs de programación.
Asistente interno empresarial
Los empleados pueden interactuar con los sistemas empresariales por voz, mientras el modelo invoca herramientas internas o busca en bases de conocimiento autorizadas.
Servicio de voz multilingüe
La plataforma Grok Voice de xAI admite más de 25 idiomas, lo que hace que el modelo sea adecuado para operaciones de soporte global.
Lo que los desarrolladores deben probar por su cuenta
Los datos de referencia son útiles, pero no determinan si un modelo es adecuado para una aplicación específica.
Antes del despliegue en producción, pruebe con acentos reales de llamantes, códecs telefónicos, ruido de fondo, nombres de productos, nombres de clientes, direcciones, números de cuenta largos, interrupciones, silencios, cambios de opinión del usuario, fallos de herramientas, resultados incorrectos de herramientas, condiciones de transferencia a humano, y reglas de seguridad o cumplimiento normativo.
Un tiempo hasta el primer audio de 0,70 segundos solo tiene valor si la respuesta es correcta. Del mismo modo, una puntuación alta en benchmarks no garantiza que el agente siga una política de reembolso específica de la empresa o introduzca correctamente nombres de cliente poco comunes.
Preguntas frecuentes
¿Qué es Grok Voice Think Fast 2.0?
Grok Voice Think Fast 2.0 es el nuevo modelo de voz a voz de xAI, diseñado para agentes de voz en tiempo real. Integra interacción de audio nativa, razonamiento, intercambio de turnos conversacionales, transcripción y uso de herramientas.
¿Cuál es el precio de Grok Voice Think Fast 2.0?
xAI ha fijado el precio de este modelo en 0,08 dólares por minuto de audio, lo que equivale a 4,80 dólares por hora. Las llamadas a herramientas y otras funciones de la API pueden generar costos adicionales.
¿Es Think Fast 2.0 más rápido que Think Fast 1.0?
Sí. xAI y Artificial Analysis informan que el tiempo hasta el primer audio se ha reducido de 1,25 segundos a 0,70 segundos.
¿Es superior a GPT-Realtime-2.1?
En el Índice de Calidad General Voz a Voz de Artificial Analysis y en la benchmark τ-Voice Agent, Think Fast 2.0 obtiene puntuaciones más altas en las comparativas publicadas. GPT-Realtime-2.1 High aún mantiene una ligera ventaja en la benchmark full-duplex, por lo que Think Fast 2.0 no lidera en todos los indicadores individuales.
¿Necesito reescribir los prompts para la versión 2.0?
xAI indica que la mayoría de las aplicaciones obtendrán mejoras de rendimiento sin cambios en los prompts. Los equipos de producción deben seguir realizando pruebas de regresión, ya que los tiempos, el uso de herramientas, la forma de alternar turnos y el estilo de respuesta pueden variar según la versión del modelo.
¿Cuándo cambiará grok-voice-latest a Think Fast 2.0?
xAI ha informado que este alias cambiará automáticamente el 5 de agosto de 2026.
Los desarrolladores que necesiten seguir usando la versión 1.0 deben fijar grok-voice-think-fast-1.0.
¿Puede Grok Voice Think Fast 2.0 invocar herramientas?
Sí. La API actual de voz a voz admite funciones personalizadas, búsqueda de archivos, búsqueda web, búsqueda en X y herramientas MCP remotas.
¿Think Fast 2.0 se usa solo para atención al cliente?
No. La atención al cliente y las ventas son casos de uso típicos, pero el modelo también es adecuado para otros flujos de trabajo de agentes de voz en tiempo real, como servicios de reservas, asistentes empresariales y aplicaciones interactivas.
Herramientas relacionadas
- Grok Voice Think Fast 2.0: Anuncio oficial de xAI sobre el nuevo modelo de voz insignia.
- API de Grok Voice: Documentación oficial de la API de voz a voz, que cubre selección de modelos, formatos de audio, herramientas y configuración de sesiones.
- Grok Voice Agent Builder: Entorno sin código proporcionado por xAI para construir agentes de voz de nivel productivo.
- Ranking de voz a voz de Artificial Analysis: Comparativa independiente que cubre razonamiento de voz, dinámicas conversacionales, rendimiento de agentes, velocidad y precios.
- Deepgram Nova: Plataforma de reconocimiento de voz referenciada en las comparativas de transcripción de xAI.
- ElevenLabs: Plataforma de IA de voz, cuyo modelo Scribe se incluye en las evaluaciones de transcripción de xAI.
Enlaces relacionados
- Introducing Grok Voice Think Fast 2.0: Anuncio oficial de lanzamiento, con benchmarks, resultados de transcripción, eficiencia de razonamiento, pruebas con Starlink, migración y precios.
- Documentación de la API de voz a voz: Guía oficial de implementación para aplicaciones en tiempo real con Grok Voice.
- Precios de la API de xAI: Precios actuales para voz, voz a texto, texto a voz y herramientas.
- Modelos de voz a voz de Artificial Analysis: Datos de referencia independientes utilizados en las comparativas de lanzamiento de xAI.
- Grok Voice Think Fast 1.0: Modelo de la generación anterior y sus resultados de producción con Starlink.
- Grok Voice Agent Builder: Información oficial sobre telefonía, herramientas, protecciones, observabilidad, soporte SIP y configuración de agentes.
- API de voz a texto y texto a voz de Grok: Detalles oficiales sobre las APIs de audio independientes de xAI.
Resumen
Grok Voice Think Fast 2.0 mejora el stack tecnológico de voz en tiempo real de xAI en las áreas más críticas para los agentes de producción: finalización de tareas del agente, dinámicas conversacionales, precisión de transcripción y latencia.
El modelo alcanza un 82,9% en el Índice de Calidad Voz a Voz de Artificial Analysis, una puntuación τ-voice del 56,5% y un tiempo de primera respuesta de audio de 0,70 segundos. xAI también informa de un mejor rendimiento en la transcripción de 24 idiomas, una mayor eficiencia de razonamiento y la capacidad de ejecutar llamadas a herramientas más temprano en las respuestas de voz.
Los desarrolladores pueden usar el modelo ahora, a un precio de 0,08 dólares por minuto de audio. Los usuarios
actuales también deben tener en cuenta que grok-voice-latest tiene previsto cambiar automáticamente de Think Fast 1.0 a Think Fast 2.0 el 5 de agosto de 2026.
Esta actualización no es solo un modelo de voz más inteligente, sino un agente más orientado a la producción, capaz de escuchar, razonar, conversar e invocar herramientas con menor latencia.



