For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/es/articles/nvidia-nemotronlabs-voicechat-11b-open-full.md.
NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de voz a voz en tiempo real de extremo a extremo, diseñado para conversaciones de vo...

NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de voz a voz en tiempo real de extremo a extremo, diseñado para conversaciones de voz naturales en dúplex completo.
A diferencia de los flujos comunes que encadenan reconocimiento automático del habla, modelos de lenguaje grandes y conversión de texto a voz, VoiceChat procesa la comprensión y generación de voz dentro de una arquitectura unificada. Su objetivo es reducir los traspasos que suelen aumentar la latencia y hacer que los asistentes de voz se sientan menos naturales.
El modelo puede escuchar mientras la conversación continúa, ceder el turno cuando el usuario interrumpe y retomar con naturalidad cuando el usuario termina de hablar. NVIDIA reporta una latencia de turnos fluidos de 448 milisegundos en Full-Duplex-Bench 1.0 y una latencia de interrupción de aproximadamente 480 milisegundos.
VoiceChat también incorpora una función especialmente relevante para agentes de voz de nivel de producción: la llamada a herramientas en tiempo real mientras la conversación de voz sigue activa. Un canal de salida separado puede emitir instrucciones de llamada a herramientas, y mensajes de confirmación predefinidos ayudan al agente a evitar silencios incómodos durante solicitudes externas a APIs.
Este lanzamiento es significativo, pero aún se encuentra en una etapa temprana. NVIDIA etiqueta el modelo como de uso exclusivo para investigación, recomienda que su despliegue requiere mucha memoria de GPU y documenta varias limitaciones en diálogos largos, entornos ruidosos, razonamiento, uso de múltiples herramientas y habla descontrolada.
Los asistentes de voz en tiempo real tradicionales suelen verse así:
Voz del usuario
↓
ASR (Reconocimiento automático del habla)
↓
Texto
↓
LLM (Modelo de lenguaje grande)
↓
Respuesta de texto
↓
TTS (Conversión de texto a voz)
↓
Voz del agente
VoiceChat integra estas capacidades en un modelo mucho más estrechamente integrado.
NVIDIA describe este sistema de 11B como una arquitectura híbrida Mamba/Transformer compuesta por:
El usuario proporciona voz a 16 kHz. Las salidas incluyen el texto del agente, la voz del agente y la transcripción del usuario, mientras que el audio del agente se genera a 22.05 kHz.
Los asistentes en semidúplex manejan la conversación básicamente como un walkie-talkie: una parte termina y luego la otra responde.
Los sistemas en dúplex completo pueden modelar continuamente a ambas partes de la conversación. Esto permite el manejo de interrupciones, pausas, intercambios y turnos de habla más naturales.
Los resultados publicados por NVIDIA de Full-Duplex-Bench 1.0 incluyen:
| Métrica | Resultado VoiceChat 11B |
|---|---|
| Turnos fluidos TOR (Tasa de ocupación del turno) | 0.82 |
| Latencia de turnos fluidos | 448 ms |
| Interrupción de usuario TOR | 1.0 |
| Latencia de interrupción de usuario | 480 ms |
| Puntuación GPT-4o de interrupción de usuario | 4.33 |
El dato de 448 milisegundos mencionado en el artículo original proviene de la evaluación de turnos fluidos. NVIDIA resume que el modelo ofrece una latencia de respuesta de aproximadamente 450 ms.
El manejo de interrupciones es una de las mayores diferencias entre una demostración de voz y un agente conversacional utilizable.
VoiceChat se entrenó directamente para el intercambio conversacional de turnos. Cuando el usuario comienza a hablar a mitad de la respuesta del modelo, el sistema puede detener su turno de voz y escuchar.
La documentación de limitaciones conocidas de NVIDIA también señala que este comportamiento no es perfecto en todos los casos. El modelo aún puede interrumpir al usuario en las pausas de sus frases, seguir hablando después de que debería detenerse, iniciar nuevos turnos sin entrada nueva, caer en bucles o manejar incorrectamente las señales de retroalimentación.
VoiceChat 11B es el primer modelo de dúplex completo de código abierto de NVIDIA compatible con llamadas a herramientas, y su diseño busca mantener una interacción de voz natural mientras se utilizan herramientas.
Los agentes de voz a menudo necesitan información que no está dentro del modelo. Por ejemplo:
¿Cuál es el estado actual de mi pedido?
El modelo puede necesitar llamar primero a una API de gestión de pedidos antes de poder responder.
VoiceChat admite mensajes de confirmación para herramientas. Los desarrolladores pueden definir frases cortas como:
Claro, déjame verificar eso por ti.
Cuando el modelo decide llamar a una herramienta, el sistema puede pronunciar una de esas frases mientras procesa la solicitud externa.
El flujo simplificado se ve así:
El usuario habla
↓
VoiceChat responde
↓
El modelo determina que necesita una herramienta
↓
El evento de llamada a herramienta se envía al cliente
↓
El cliente ejecuta la función externa
↓
El resultado de la herramienta regresa a VoiceChat
↓
VoiceChat retoma la respuesta por voz
NVIDIA recomienda un máximo de aproximadamente cinco herramientas por sesión, ya que con más herramientas disponibles el rendimiento puede degradarse.
Actualmente, el modelo tampoco puede llamar de manera fiable a múltiples herramientas al mismo tiempo.
Otras limitaciones incluyen errores de selección de herramientas, omisión de llamadas, parámetros inventados, errores al dictar los resultados de las herramientas y el uso de conocimiento interno cuando debería usarse una herramienta.
Un detalle especialmente importante: aunque VoiceChat admite la interrupción por parte del usuario en conversaciones normales, actualmente el usuario no puede interrumpir al agente durante la ejecución de una herramienta.
Los resultados reportados con el harness AU son:
| Categoría de llamada a herramienta | Puntuación |
|---|---|
| Simple | 58.5% |
| Múltiple | 62.5% |
| Paralela | 42.5% |
| Paralela múltiple | 27.5% |
| Irrelevancia | 89.6% |
| Promedio | 56.1% |
En Full-Duplex-Bench v3, NVIDIA reporta:
| Métrica | Puntuación |
|---|---|
| Selección de herramienta | 82.5% |
| Precisión de parámetros | 44.2% |
| Pass@1 | 33% |
Estas cifras indican que las llamadas a herramientas en entornos de producción aún deben protegerse con lógica de aplicación y validación de parámetros.
NVIDIA reporta que VoiceChat ocupa el segundo lugar entre los modelos de dúplex completo de código abierto tanto en VoiceBench como en Full-Duplex-Bench 1.0.
El modelo está optimizado para el equilibrio entre inteligencia general y conversación natural en tiempo real. NVIDIA advierte explícitamente que su rendimiento en conocimiento, seguimiento de instrucciones, seguridad y tareas de razonamiento puede ser inferior al del modelo de lenguaje subyacente Nemotron Nano v2.
La ficha técnica del modelo de NVIDIA enumera aproximadamente 550.000 horas de datos de audio de entrenamiento.
Estos datos mixtos
incluyen voz real y sintética, así como datos de texto para los componentes del modelo de lenguaje. Las fuentes de datos mencionadas incluyen Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, datos de voz internos de NVIDIA, voz sintética, datos de llamadas a funciones de Nemotron y datos de entrenamiento de PersonaPlex.
Los puntos de control actuales de VoiceChat no admiten clonación de voz.
Las notas del repositorio de NVIDIA indican que el punto de control publicado utiliza una voz fija. El propósito de este lanzamiento es más enfocado: interacción de voz de baja latencia, comportamiento de dúplex completo y llamadas a herramientas.
Los requisitos previos actuales de despliegue en tiempo real de NVIDIA especifican claramente:
GPU NVIDIA con al menos 80 GB de memoria de video
Las GPU compatibles documentadas para el contenedor incluyen NVIDIA A100, H100, RTX 6000 Pro y B200. La ficha técnica más amplia también lista compatibilidad con H200 y B100.
Para el contenedor optimizado en tiempo real, NVIDIA actualmente requiere x86_64, Linux, Docker, NVIDIA Container Toolkit y controladores NVIDIA compatibles.
La guía de solución de problemas señala que el modelo en sí utiliza aproximadamente 66 GB de memoria de GPU.
Aún no hay una API de inferencia gestionada madura
Hasta el 11 de agosto, la página del modelo en Hugging Face no lista proveedores de inferencia activos para este checkpoint.
En su lugar, NVIDIA ofrece dos vías principales:
El contenedor en tiempo real incluye CUDA, Triton, vLLM y la pila completa de inferencia de VoiceChat, y expone un servicio WebSocket bidireccional.
Clona la rama experimental VoiceChat de NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Crea el entorno:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Descarga el checkpoint:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /ruta/al/checkpoint
Ejecuta el ejemplo:
conda activate voicechat
export NEMO_DIR=/ruta/al/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /ruta/al/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /ruta/a/salida
NVIDIA recomienda añadir suficiente silencio al final del audio de entrada personalizado para que el modelo tenga tiempo de responder.
Descarga el repositorio del modelo:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Inicia el servicio:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Comprueba el estado de preparación:
curl 'http://localhost:9000/v1/realtime/health'
A continuación, el servidor expone un endpoint WebSocket bidireccional en la siguiente dirección:
ws://localhost:9000/v1/realtime
Un ejemplo simplificado de definición de herramienta es el siguiente:
[
{
"name": "get_weather",
"description": "Obtiene el clima actual de una ciudad",
"ack_messages": [
"De acuerdo, déjeme consultarlo."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
El campo ack_messages proporciona al sistema respuestas naturales durante la ejecución de la herramienta.
NVIDIA marca explícitamente VoiceChat 11B como solo para investigación.
La ventana de contexto de audio utilizada durante el entrenamiento del modelo no supera los dos minutos aproximadamente, por lo que los contextos de conversación más largos podrían no conservarse de forma fiable.
Los problemas conocidos incluyen errores de inferencia, alucinaciones, degradación de la calidad de voz tras múltiples turnos de conversación, repeticiones, texto ilegible, truncamiento de voz, continuaciones descontroladas, autodiálogos, bucles de aclaración, palabras faltantes en las transcripciones, cambio de idioma poco fiable y un rendimiento deficiente en entornos ruidosos o con mucha reverberación.
Los escenarios potenciales de investigación y creación de prototipos incluyen:
Los agentes pueden escuchar de forma natural, gestionar interrupciones, invocar herramientas de atención al cliente y utilizar mensajes de confirmación mientras esperan la respuesta de la API.
Los conductores pueden interrumpir al asistente sin esperar a que termine una respuesta de voz completa. La sensibilidad actual al ruido de fondo implica que su implementación en vehículos requiere un trabajo de optimización adicional.
El agente de voz puede recopilar pedidos, responder a correcciones e invocar sistemas de productos o inventario.
Una rotación de turnos más natural favorece las interfaces sin manos y las aplicaciones con prioridad de voz, pero su implementación en el ámbito de la accesibilidad requiere pruebas cuidadosas con usuarios.
Las organizaciones pueden experimentar con herramientas internas e interacciones de voz autoalojadas, manteniendo el modelo dentro de su propia infraestructura.
La afirmación de que es "código abierto" debe entenderse con mayor precisión.
El código de NeMo Speech utilizado por VoiceChat tiene la licencia Apache License 2.0.
Los materiales del modelo VoiceChat utilizan la licencia OpenMDW 1.1.
Por lo tanto, es más seguro describir VoiceChat 11B como un modelo abierto o un modelo de pesos abiertos, en lugar de asumir que la licencia del modelo es idéntica a la del software circundante con licencia Apache.
Los equipos que planeen redistribuirlo o utilizarlo comercialmente deben revisar directamente la licencia OpenMDW.
Un plan de evaluación útil debería cubrir:
Rotación de turnos y manejo de interrupciones del usuario
Pausas en mitad de frase y señales de retroalimentación
Audio ruidoso, con eco y de múltiples hablantes
Parámetros de herramienta erróneos o faltantes
Tiempos de espera de herramientas y fallos de llamadas a API
Los agentes de voz con capacidad de llamar a herramientas necesitan los mismos controles de permisos que otros agentes autónomos.
NemotronLabs VoiceChat 11B es un modelo de voz a voz en tiempo real de extremo a extremo desarrollado por NVIDIA para IA conversacional full-duplex. Combina comprensión de voz en streaming, el backbone del modelo de lenguaje Nemotron, generación de voz y un canal independiente para llamadas a herramientas.
NVIDIA reporta una latencia de turnos conversacionales fluidos de 448 milisegundos y una latencia de interrupción de aproximadamente 480 milisegundos en Full-Duplex-Bench 1.0.
Sí, la conversación normal admite interrupciones y superposiciones. Sin embargo, NVIDIA indica que durante la ejecución de herramientas el usuario actualmente no puede interrumpir al agente.
Sí. El modelo puede emitir llamadas a herramientas a través de un canal de salida independiente, y los desarrolladores pueden definir mensajes de confirmación que se reproducen mientras las herramientas externas están en ejecución.
El contenedor en tiempo real de NVIDIA requiere una GPU con al menos 80 GB de memoria. La documentación de resolución de problemas indica que el modelo cargado utiliza aproximadamente 66 GB.
NVIDIA actualmente ofrece inferencia offline autoalojada y documentación optimizada para contenedores en tiempo real. La página del modelo en Hugging Face no lista actualmente proveedores de inferencia alojada.
No. El checkpoint publicado utiliza una voz fija y no admite clonación de voz.
NVIDIA marca el modelo como de uso exclusivo para investigación. Los desarrolladores deben evaluar sus limitaciones en cuanto a longitud de contexto, razonamiento, uso de herramientas, audio ruidoso, repeticiones, transcripción y voz descontrolada antes de un despliegue en producción.
NVIDIA NemotronLabs VoiceChat 11B integra comprensión de voz, modelado de lenguaje, generación de voz, manejo de interrupciones y llamadas a herramientas en una arquitectura full-duplex unificada. NVIDIA reporta una latencia de turnos de habla de solo 448 milisegundos y posiciona al modelo en la vanguardia de los benchmarks actuales de voz full-duplex abiertos.
La característica de ingeniería más destacable es la llamada a herramientas. Un canal de salida independiente puede activar funciones externas mientras que los mensajes de confirmación evitan que la conversación caiga en silencio durante las llamadas a API.
Esta versión aún no es un servicio completamente listo para producción. El despliegue en tiempo real requiere al menos 80 GB de memoria de GPU, el checkpoint actual utiliza una voz fija, la inferencia alojada no está ampliamente disponible, y NVIDIA documenta explícitamente limitaciones significativas en sesiones largas, razonamiento, audio ruidoso y ejecución de herramientas.
VoiceChat 11B debe considerarse más como una plataforma de investigación abierta para construir y estudiar agentes de voz de baja latencia, que como una solución madura para reemplazar centros de atención al cliente o APIs de voz para consumidores en entornos de producción.
Empieza con una sola frase y obtén un sitio completo en minutos.