Introducción
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de voz a voz en tiempo real de extremo a extremo, diseñado para conversaciones de voz naturales en dúplex completo.
A diferencia de los flujos comunes que encadenan reconocimiento automático del habla, modelos de lenguaje grandes y conversión de texto a voz, VoiceChat procesa la comprensión y generación de voz dentro de una arquitectura unificada. Su objetivo es reducir los traspasos que suelen aumentar la latencia y hacer que los asistentes de voz se sientan menos naturales.
El modelo puede escuchar mientras la conversación continúa, ceder el turno cuando el usuario interrumpe y retomar con naturalidad cuando el usuario termina de hablar. NVIDIA reporta una latencia de turnos fluidos de 448 milisegundos en Full-Duplex-Bench 1.0 y una latencia de interrupción de aproximadamente 480 milisegundos.
VoiceChat también incorpora una función especialmente relevante para agentes de voz de nivel de producción: la llamada a herramientas en tiempo real mientras la conversación de voz sigue activa. Un canal de salida separado puede emitir instrucciones de llamada a herramientas, y mensajes de confirmación predefinidos ayudan al agente a evitar silencios incómodos durante solicitudes externas a APIs.
Este lanzamiento es significativo, pero aún se encuentra en una etapa temprana. NVIDIA etiqueta el modelo como de uso exclusivo para investigación, recomienda que su despliegue requiere mucha memoria de GPU y documenta varias limitaciones en diálogos largos, entornos ruidosos, razonamiento, uso de múltiples herramientas y habla descontrolada.
Arquitectura unificada de voz a voz
Los asistentes de voz en tiempo real tradicionales suelen verse así:
Voz del usuario
↓
ASR (Reconocimiento automático del habla)
↓
Texto
↓
LLM (Modelo de lenguaje grande)
↓
Respuesta de texto
↓
TTS (Conversión de texto a voz)
↓
Voz del agente
VoiceChat integra estas capacidades en un modelo mucho más estrechamente integrado.
NVIDIA describe este sistema de 11B como una arquitectura híbrida Mamba/Transformer compuesta por:
- Codificador de voz Fast Conformer
- Columna vertebral de modelo de lenguaje Nemotron Nano v2 de 9B
- Decodificador TTS y códec de audio de NVIDIA
- Canal separado para scripts de llamada a herramientas
El usuario proporciona voz a 16 kHz. Las salidas incluyen el texto del agente, la voz del agente y la transcripción del usuario, mientras que el audio del agente se genera a 22.05 kHz.
El dúplex completo implica que las conversaciones pueden superponerse
Los asistentes en semidúplex manejan la conversación básicamente como un walkie-talkie: una parte termina y luego la otra responde.
Los sistemas en dúplex completo pueden modelar continuamente a ambas partes de la conversación. Esto permite el manejo de interrupciones, pausas, intercambios y turnos de habla más naturales.
Los resultados publicados por NVIDIA de Full-Duplex-Bench 1.0 incluyen:
| Métrica | Resultado VoiceChat 11B |
|---|---|
| Turnos fluidos TOR (Tasa de ocupación del turno) | 0.82 |
| Latencia de turnos fluidos | 448 ms |
| Interrupción de usuario TOR | 1.0 |
| Latencia de interrupción de usuario | 480 ms |
| Puntuación GPT-4o de interrupción de usuario | 4.33 |
El dato de 448 milisegundos mencionado en el artículo original proviene de la evaluación de turnos fluidos. NVIDIA resume que el modelo ofrece una latencia de respuesta de aproximadamente 450 ms.
VoiceChat está diseñado para ceder el turno cuando el usuario interrumpe
El manejo de interrupciones es una de las mayores diferencias entre una demostración de voz y un agente conversacional utilizable.
VoiceChat se entrenó directamente para el intercambio conversacional de turnos. Cuando el usuario comienza a hablar a mitad de la respuesta del modelo, el sistema puede detener su turno de voz y escuchar.
La documentación de limitaciones conocidas de NVIDIA también señala que este comportamiento no es perfecto en todos los casos. El modelo aún puede interrumpir al usuario en las pausas de sus frases, seguir hablando después de que debería detenerse, iniciar nuevos turnos sin entrada nueva, caer en bucles o manejar incorrectamente las señales de retroalimentación.
La llamada a herramientas en tiempo real es la característica de ingeniería más interesante
VoiceChat 11B es el primer modelo de dúplex completo de código abierto de NVIDIA compatible con llamadas a herramientas, y su diseño busca mantener una interacción de voz natural mientras se utilizan herramientas.
Los agentes de voz a menudo necesitan información que no está dentro del modelo. Por ejemplo:
¿Cuál es el estado actual de mi pedido?
El modelo puede necesitar llamar primero a una API de gestión de pedidos antes de poder responder.
VoiceChat admite mensajes de confirmación para herramientas. Los desarrolladores pueden definir frases cortas como:
Claro, déjame verificar eso por ti.
Cuando el modelo decide llamar a una herramienta, el sistema puede pronunciar una de esas frases mientras procesa la solicitud externa.
El flujo simplificado se ve así:
El usuario habla
↓
VoiceChat responde
↓
El modelo determina que necesita una herramienta
↓
El evento de llamada a herramienta se envía al cliente
↓
El cliente ejecuta la función externa
↓
El resultado de la herramienta regresa a VoiceChat
↓
VoiceChat retoma la respuesta por voz
Limitaciones importantes de las llamadas a herramientas
NVIDIA recomienda un máximo de aproximadamente cinco herramientas por sesión, ya que con más herramientas disponibles el rendimiento puede degradarse.
Actualmente, el modelo tampoco puede llamar de manera fiable a múltiples herramientas al mismo tiempo.
Otras limitaciones incluyen errores de selección de herramientas, omisión de llamadas, parámetros inventados, errores al dictar los resultados de las herramientas y el uso de conocimiento interno cuando debería usarse una herramienta.
Un detalle especialmente importante: aunque VoiceChat admite la interrupción por parte del usuario en conversaciones normales, actualmente el usuario no puede interrumpir al agente durante la ejecución de una herramienta.
Resultados de las evaluaciones de llamadas a herramientas
Los resultados reportados con el harness AU son:
| Categoría de llamada a herramienta | Puntuación |
|---|---|
| Simple | 58.5% |
| Múltiple | 62.5% |
| Paralela | 42.5% |
| Paralela múltiple | 27.5% |
| Irrelevancia | 89.6% |
| Promedio | 56.1% |
En Full-Duplex-Bench v3, NVIDIA reporta:
| Métrica | Puntuación |
|---|---|
| Selección de herramienta | 82.5% |
| Precisión de parámetros | 44.2% |
| Pass@1 | 33% |
Estas cifras indican que las llamadas a herramientas en entornos de producción aún deben protegerse con lógica de aplicación y validación de parámetros.
VoiceChat se posiciona alto entre los modelos de dúplex completo de código abierto
NVIDIA reporta que VoiceChat ocupa el segundo lugar entre los modelos de dúplex completo de código abierto tanto en VoiceBench como en Full-Duplex-Bench 1.0.
El modelo está optimizado para el equilibrio entre inteligencia general y conversación natural en tiempo real. NVIDIA advierte explícitamente que su rendimiento en conocimiento, seguimiento de instrucciones, seguridad y tareas de razonamiento puede ser inferior al del modelo de lenguaje subyacente Nemotron Nano v2.
El modelo se entrenó con alrededor de 550.000 horas de audio
La ficha técnica del modelo de NVIDIA enumera aproximadamente 550.000 horas de datos de audio de entrenamiento.
Estos datos mixtos
incluyen voz real y sintética, así como datos de texto para los componentes del modelo de lenguaje. Las fuentes de datos mencionadas incluyen Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, datos de voz internos de NVIDIA, voz sintética, datos de llamadas a funciones de Nemotron y datos de entrenamiento de PersonaPlex.
VoiceChat usa una voz fija
Los puntos de control actuales de VoiceChat no admiten clonación de voz.
Las notas del repositorio de NVIDIA indican que el punto de control publicado utiliza una voz fija. El propósito de este lanzamiento es más enfocado: interacción de voz de baja latencia, comportamiento de dúplex completo y llamadas a herramientas.
Los requisitos de hardware son bastante elevados
Los requisitos previos actuales de despliegue en tiempo real de NVIDIA especifican claramente:
GPU NVIDIA con al menos 80 GB de memoria de video
Las GPU compatibles documentadas para el contenedor incluyen NVIDIA A100, H100, RTX 6000 Pro y B200. La ficha técnica más amplia también lista compatibilidad con H200 y B100.
Para el contenedor optimizado en tiempo real, NVIDIA actualmente requiere x86_64, Linux, Docker, NVIDIA Container Toolkit y controladores NVIDIA compatibles.
La guía de solución de problemas señala que el modelo en sí utiliza aproximadamente 66 GB de memoria de GPU.
Aún no hay una API de inferencia gestionada madura
Hasta el 11 de agosto, la página del modelo en Hugging Face no lista proveedores de inferencia activos para este checkpoint.
En su lugar, NVIDIA ofrece dos vías principales:
- Inferencia offline, a partir del checkpoint de Hugging Face
- Transmisión interactiva, mediante contenedores NVIDIA optimizados
El contenedor en tiempo real incluye CUDA, Triton, vLLM y la pila completa de inferencia de VoiceChat, y expone un servicio WebSocket bidireccional.
Cómo ejecutar la inferencia offline
Clona la rama experimental VoiceChat de NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Crea el entorno:
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Descarga el checkpoint:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /ruta/al/checkpoint
Ejecuta el ejemplo:
conda activate voicechat
export NEMO_DIR=/ruta/al/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /ruta/al/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /ruta/a/salida
NVIDIA recomienda añadir suficiente silencio al final del audio de entrada personalizado para que el modelo tenga tiempo de responder.
Cómo implementar el contenedor en tiempo real
Descarga el repositorio del modelo:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Inicia el servicio:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Comprueba el estado de preparación:
curl 'http://localhost:9000/v1/realtime/health'
A continuación, el servidor expone un endpoint WebSocket bidireccional en la siguiente dirección:
ws://localhost:9000/v1/realtime
Una definición de herramienta sencilla
Un ejemplo simplificado de definición de herramienta es el siguiente:
[
{
"name": "get_weather",
"description": "Obtiene el clima actual de una ciudad",
"ack_messages": [
"De acuerdo, déjeme consultarlo."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
El campo ack_messages proporciona al sistema respuestas naturales durante la ejecución de la herramienta.
Solo para investigación; los equipos de producción deben actuar con cautela
NVIDIA marca explícitamente VoiceChat 11B como solo para investigación.
La ventana de contexto de audio utilizada durante el entrenamiento del modelo no supera los dos minutos aproximadamente, por lo que los contextos de conversación más largos podrían no conservarse de forma fiable.
Los problemas conocidos incluyen errores de inferencia, alucinaciones, degradación de la calidad de voz tras múltiples turnos de conversación, repeticiones, texto ilegible, truncamiento de voz, continuaciones descontroladas, autodiálogos, bucles de aclaración, palabras faltantes en las transcripciones, cambio de idioma poco fiable y un rendimiento deficiente en entornos ruidosos o con mucha reverberación.
Casos de uso potenciales de VoiceChat 11B
Los escenarios potenciales de investigación y creación de prototipos incluyen:
Centros de contacto
Los agentes pueden escuchar de forma natural, gestionar interrupciones, invocar herramientas de atención al cliente y utilizar mensajes de confirmación mientras esperan la respuesta de la API.
Asistentes en el vehículo
Los conductores pueden interrumpir al asistente sin esperar a que termine una respuesta de voz completa. La sensibilidad actual al ruido de fondo implica que su implementación en vehículos requiere un trabajo de optimización adicional.
Pedidos en comercios y restaurantes
El agente de voz puede recopilar pedidos, responder a correcciones e invocar sistemas de productos o inventario.
Accesibilidad
Una rotación de turnos más natural favorece las interfaces sin manos y las aplicaciones con prioridad de voz, pero su implementación en el ámbito de la accesibilidad requiere pruebas cuidadosas con usuarios.
Agentes de voz empresariales
Las organizaciones pueden experimentar con herramientas internas e interacciones de voz autoalojadas, manteniendo el modelo dentro de su propia infraestructura.
Modelo abierto, pero con dos licencias diferentes
La afirmación de que es "código abierto" debe entenderse con mayor precisión.
El código de NeMo Speech utilizado por VoiceChat tiene la licencia Apache License 2.0.
Los materiales del modelo VoiceChat utilizan la licencia OpenMDW 1.1.
Por lo tanto, es más seguro describir VoiceChat 11B como un modelo abierto o un modelo de pesos abiertos, en lugar de asumir que la licencia del modelo es idéntica a la del software circundante con licencia Apache.
Los equipos que planeen redistribuirlo o utilizarlo comercialmente deben revisar directamente la licencia OpenMDW.
Qué deberían probar los desarrolladores antes de producción
Un plan de evaluación útil debería cubrir:
-
Rotación de turnos y manejo de interrupciones del usuario
-
Pausas en mitad de frase y señales de retroalimentación
-
Audio ruidoso, con eco y de múltiples hablantes
-
Parámetros de herramienta erróneos o faltantes
Tiempos de espera de herramientas y fallos de llamadas a API
- Conversaciones largas
- Voz descontrolada
- Alucinaciones y problemas de calidad de razonamiento
- Operaciones sensibles que requieren aprobación
- Registro de logs, límites de velocidad y escalamiento humano
Los agentes de voz con capacidad de llamar a herramientas necesitan los mismos controles de permisos que otros agentes autónomos.
Preguntas frecuentes
¿Qué es NVIDIA NemotronLabs VoiceChat 11B?
NemotronLabs VoiceChat 11B es un modelo de voz a voz en tiempo real de extremo a extremo desarrollado por NVIDIA para IA conversacional full-duplex. Combina comprensión de voz en streaming, el backbone del modelo de lenguaje Nemotron, generación de voz y un canal independiente para llamadas a herramientas.
¿Qué tan rápido es VoiceChat 11B?
NVIDIA reporta una latencia de turnos conversacionales fluidos de 448 milisegundos y una latencia de interrupción de aproximadamente 480 milisegundos en Full-Duplex-Bench 1.0.
¿Puede el usuario interrumpir a VoiceChat mientras habla?
Sí, la conversación normal admite interrupciones y superposiciones. Sin embargo, NVIDIA indica que durante la ejecución de herramientas el usuario actualmente no puede interrumpir al agente.
¿VoiceChat 11B admite llamadas a funciones?
Sí. El modelo puede emitir llamadas a herramientas a través de un canal de salida independiente, y los desarrolladores pueden definir mensajes de confirmación que se reproducen mientras las herramientas externas están en ejecución.
¿Cuánta memoria de GPU requiere VoiceChat 11B?
El contenedor en tiempo real de NVIDIA requiere una GPU con al menos 80 GB de memoria. La documentación de resolución de problemas indica que el modelo cargado utiliza aproximadamente 66 GB.
¿Existe una API alojada para VoiceChat 11B?
NVIDIA actualmente ofrece inferencia offline autoalojada y documentación optimizada para contenedores en tiempo real. La página del modelo en Hugging Face no lista actualmente proveedores de inferencia alojada.
¿VoiceChat puede clonar voces?
No. El checkpoint publicado utiliza una voz fija y no admite clonación de voz.
¿Se puede usar VoiceChat 11B en entornos de producción?
NVIDIA marca el modelo como de uso exclusivo para investigación. Los desarrolladores deben evaluar sus limitaciones en cuanto a longitud de contexto, razonamiento, uso de herramientas, audio ruidoso, repeticiones, transcripción y voz descontrolada antes de un despliegue en producción.
Herramientas relacionadas
- NVIDIA NemotronLabs VoiceChat 11B: tarjeta oficial del modelo, pesos, benchmarks, arquitectura, licencia e instrucciones de inferencia.
- NVIDIA NeMo Speech: repositorio oficial de voz que incluye la implementación de VoiceChat y ramas de despliegue.
- Guía de contenedor en tiempo real de NVIDIA VoiceChat: documentación oficial de Docker, WebSocket y despliegue de llamadas a funciones.
- NVIDIA Container Toolkit: permite que los contenedores Docker accedan a las GPU de NVIDIA.
- vLLM: motor de inferencia listado en la tarjeta del modelo NVIDIA VoiceChat.
- VoiceBench: benchmark abierto para evaluar asistentes de voz basados en LLM.
Enlaces relacionados
- Tarjeta del modelo VoiceChat 11B:
La fuente principal cubre fecha de publicación, benchmarks, datos de entrenamiento, arquitectura y el estado de uso exclusivo para investigación. - Rama GitHub de VoiceChat: código fuente oficial, instrucciones de instalación, requisitos de hardware, limitaciones y descripción del modelo.
- Requisitos previos para despliegue en tiempo real: requisitos de hardware, Linux, Docker, controladores y container toolkit.
- Guía de despliegue en tiempo real: documentación de NVIDIA sobre inicio del contenedor, health checks, WebSocket, clientes y llamadas a herramientas.
- Licencia OpenMDW 1.1: licencia que rige los materiales del modelo VoiceChat.
- Full-Duplex-Bench: benchmark para evaluar el manejo de pausas, turnos de habla y comportamiento de interrupción.
- Full-Duplex-Bench v3: benchmark centrado en interacciones de voz full-duplex con llamadas a herramientas.
Resumen
NVIDIA NemotronLabs VoiceChat 11B integra comprensión de voz, modelado de lenguaje, generación de voz, manejo de interrupciones y llamadas a herramientas en una arquitectura full-duplex unificada. NVIDIA reporta una latencia de turnos de habla de solo 448 milisegundos y posiciona al modelo en la vanguardia de los benchmarks actuales de voz full-duplex abiertos.
La característica de ingeniería más destacable es la llamada a herramientas. Un canal de salida independiente puede activar funciones externas mientras que los mensajes de confirmación evitan que la conversación caiga en silencio durante las llamadas a API.
Esta versión aún no es un servicio completamente listo para producción. El despliegue en tiempo real requiere al menos 80 GB de memoria de GPU, el checkpoint actual utiliza una voz fija, la inferencia alojada no está ampliamente disponible, y NVIDIA documenta explícitamente limitaciones significativas en sesiones largas, razonamiento, audio ruidoso y ejecución de herramientas.
VoiceChat 11B debe considerarse más como una plataforma de investigación abierta para construir y estudiar agentes de voz de baja latencia, que como una solución madura para reemplazar centros de atención al cliente o APIs de voz para consumidores en entornos de producción.



