For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/de/articles/nvidia-nemotronlabs-voicechat-11b-open-full.md.
NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein end-to-end Echtzeit-Sprach-zu-Sprach-Modell, das für natürliche Vollduplex-Sprachd...

NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein End-to-End-Echtzeit-Sprache-zu-Sprache-Modell, das für natürliche Voll-Duplex-Sprachdialoge entwickelt wurde.
Im Gegensatz zu gängigen Pipelines, die automatische Spracherkennung, große Sprachmodelle und Text-zu-Sprache in Reihe schalten, verarbeitet VoiceChat Streaming-Sprachverständnis und Sprachgenerierung innerhalb einer einheitlichen Architektur. Ziel ist es, Übergabepunkte zu reduzieren, die typischerweise Latenz erhöhen und Sprachassistenten weniger natürlich wirken lassen.
Das Modell kann zuhören, während das Gespräch läuft, das Wort abgeben, wenn Nutzer unterbrechen, und nach dem Sprechen des Nutzers natürlich wieder aufnehmen. NVIDIA berichtet eine flüssige Turn-Taking-Latenz von 448 Millisekunden sowie eine Unterbrechungslatenz von etwa 480 Millisekunden auf Full-Duplex-Bench 1.0.
VoiceChat führt außerdem Funktionen ein, die für produktionsreife Sprachagenten besonders relevant sind: Echtzeit-Tool-Aufrufe bei gleichzeitig aktivem Sprachdialog. Ein separater Ausgabekanal kann Tool-Aufrufbefehle ausgeben, während vordefinierte Bestätigungsnachrichten dem Agenten helfen, peinliche Stillephasen während externer API-Anfragen zu vermeiden.
Diese Veröffentlichung ist bedeutsam, befindet sich jedoch noch in einem frühen Stadium. NVIDIA kennzeichnet das Modell als nur für Forschungszwecke, empfiehlt hohen GPU-Speicherbedarf für den Einsatz und dokumentiert mehrere Einschränkungen bei langen Gesprächen, lauten Umgebungen, Schlussfolgerungen, mehrfacher Tool-Nutzung und außer Kontrolle geratener Sprache.
Traditionelle Echtzeit-Sprachassistenten sehen typischerweise wie folgt aus:
Nutzerstimme
↓
ASR (Automatische Spracherkennung)
↓
Text
↓
LLM (Großes Sprachmodell)
↓
Textantwort
↓
TTS (Text-zu-Sprache)
↓
Agentenstimme
VoiceChat integriert diese Fähigkeiten in ein enger gekoppeltes Modell.
NVIDIA beschreibt dieses 11B-System als Hybrid-Mamba/Transformer-Architektur, bestehend aus:
Nutzer liefern Sprache mit 16 kHz. Die Ausgabe umfasst Agententext, Agentensprache und Nutzertranskript; Agenten-Audio wird mit 22,05 kHz erzeugt.
Halb-Duplex-Assistenten behandeln Konversationen faktisch wie Gegensprechanlagen: Eine Seite spricht, danach antwortet die andere.
Voll-Duplex-Systeme können beide Gesprächsseiten kontinuierlich modellieren. Dies ermöglicht Unterbrechungsbehandlung, Pausen, Hin-und-her-Kommunikation und natürlicheres Turn-Taking.
Die von NVIDIA veröffentlichten Full-Duplex-Bench-1.0-Ergebnisse umfassen:
| Metrik | VoiceChat-11B-Ergebnis |
|---|---|
| Flüssiges Turn-Taking TOR (Turn-Occupancy-Rate) | 0,82 |
| Flüssige Turn-Taking-Latenz | 448 ms |
| Nutzerunterbrechung TOR | 1,0 |
| Nutzerunterbrechungslatenz | 480 ms |
| Nutzerunterbrechung GPT-4o-Bewertung | 4,33 |
Die in den ursprünglichen Pressemitteilungen erwähnten 448 Millisekunden stammen aus dem Flüssig-Turn-Taking-Benchmark. NVIDIA fasst das Modell mit einer Antwortlatenz von etwa 450 ms zusammen.
Unterbrechungsbehandlung ist einer der größten Unterschiede zwischen Sprachdemos und brauchbaren Konversationsagenten.
VoiceChat
Das Modell wurde direkt auf konversationelles Turn-Taking trainiert. Wenn der Nutzer mitten in einer Modellantwort zu sprechen beginnt, kann das System seine Sprachrunde stoppen und zuhören.
Der bekannte Einschränkungsdokument von NVIDIA weist auch darauf hin, dass dieses Verhalten nicht in allen Fällen perfekt ist. Das Modell kann den Nutzer an Pausenstellen unterbrechen, nach dem Soll-Stopp weiterreden, ohne neue Eingabe neue Runden starten, in Schleifen geraten oder Feedback-Signale falsch verarbeiten.
VoiceChat 11B ist das erste Open-Source-Voll-Duplex-Modell von NVIDIA mit Tool-Aufruf-Unterstützung, das darauf ausgelegt ist, natürliche Sprachinteraktion bei Tool-Nutzung aufrechtzuerhalten.
Sprachagenten benötigen häufig Informationen, die nicht im Modell enthalten sind. Zum Beispiel:
Wie ist der aktuelle Status meiner Bestellung?
Das Modell muss möglicherweise zuerst eine Bestellverwaltungs-API aufrufen, bevor es antworten kann.
VoiceChat unterstützt Bestätigungsnachrichten für Tools. Entwickler können kurze Phrasen wie die folgende definieren:
Okay, lassen Sie mich das für Sie überprüfen.
Wenn das Modell entscheidet, ein Tool aufzurufen, kann das System während der Verarbeitung der externen Anfrage eine dieser Phrasen aussprechen.
Der vereinfachte Ablauf sieht wie folgt aus:
Nutzer spricht
↓
VoiceChat antwortet
↓
Modell stellt fest, dass ein Tool benötigt wird
↓
Tool-Aufrufereignis wird an den Client gesendet
↓
Client führt externe Funktion aus
↓
Tool-Ergebnis wird an VoiceChat zurückgegeben
↓
VoiceChat nimmt die Sprachantwort wieder auf
NVIDIA empfiehlt höchstens etwa fünf Tools pro Sitzung, da die Leistung bei mehr verfügbaren Tools abnehmen kann.
Das Modell kann derzeit auch nicht zuverlässig mehrere Tools gleichzeitig aufrufen.
Weitere Einschränkungen umfassen falsche Tool-Auswahl, übersprungene Tool-Aufrufe, erfundene Parameter, fehlerhaft wiedergegebene Tool-Ergebnisse sowie die Nutzung internen Wissens, obwohl ein Tool verwendet werden sollte.
Ein besonders wichtiges Detail: Obwohl VoiceChat Unterbrechungen durch den Nutzer in normalen Gesprächen unterstützt, kann der Nutzer den Agenten während der Tool-Ausführung derzeit nicht unterbrechen.
Die berichteten AU-Harness-Ergebnisse lauten:
| Tool-Aufruf-Kategorie | Punktzahl |
|---|---|
| Einfach | 58,5 % |
| Mehrere | 62,5 % |
| Parallel | 42,5 % |
| Parallel mehrere | 27,5 % |
| Irrelevanz | 89,6 % |
| Durchschnitt | 56,1 % |
Auf Full-Duplex-Bench v3 berichtet NVIDIA:
| Metrik | Punktzahl |
|---|---|
| Tool-Auswahl | 82,5 % |
| Parameter-Genauigkeit | 44,2 % |
| Pass@1 | 33 % |
Diese Zahlen deuten darauf hin, dass Tool-Aufrufe in der Produktion weiterhin durch Anwendungslogik und Parameterprüfungen abgesichert werden sollten.
NVIDIA berichtet, dass VoiceChat auf VoiceBench und Full-Duplex-Bench 1.0 auf Platz zwei unter den Open-Source-Voll-Duplex-Modellen liegt.
Das Modell ist auf den Kompromiss zwischen allgemeiner Intelligenz und natürlicher Echtzeit-Konversation optimiert. NVIDIA warnt ausdrücklich davor, dass es bei Wissen, Befehlsbefolgung, Sicherheit und Schlussfolgerungsaufgaben möglicherweise schlechter abschneidet als das zugrunde liegende Nemotron-Nano-v2-Sprachmodell.
Das Modellkarten-Dokument von NVIDIA listet etwa 550.000 Stunden Audiotrainingsdaten auf.
Diese gemischten Daten
umfassen sowohl echte als auch synthetische Sprache sowie Textdaten für die Sprachmodellkomponenten. Genannte Datenquellen sind unter anderem Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, NVIDIA-interne Sprachdaten, synthetische Sprache, Nemotron-Funktionsaufrufdaten und PersonaPlex-Trainingsdaten.
Die aktuellen VoiceChat-Checkpoints unterstützen keine Stimmklonierung.
Das NVIDIA-Repository gibt an, dass die veröffentlichten Checkpoints eine feste Stimme verwenden. Der Fokus dieser Veröffentlichung liegt enger: geringe Latenz, Voll-Duplex-Konversationsverhalten und Tool-bewusste Sprachinteraktion.
Die aktuellen Voraussetzungen für Echtzeit-Bereitstellung von NVIDIA lauten explizit:
NVIDIA-GPU mit mindestens 80 GB Grafikkartenspeicher
Die dokumentierten, vom Container unterstützten GPUs umfassen NVIDIA A100, H100, RTX 6000 Pro und B200. Die breitere Modellkarte listet zusätzlich H200- und B100-Kompatibilität auf.
Für optimierte Echtzeit-Container verlangt NVIDIA derzeit x86_64, Linux, Docker, das NVIDIA-Container-Toolkit und kompatible NVIDIA-Treiber.
Der Fehlerbehebungsleitfaden weist darauf hin, dass das Modell selbst etwa 66 GB GPU-Speicher belegt.
Noch keine ausgereifte gehostete Inferenz-API
Stand 11. August sind auf der Hugging-Face-Modellseite keine aktiven Inferenz-Anbieter für diesen Checkpoint aufgeführt.
Stattdessen bietet NVIDIA zwei Hauptpfade an:
Der Echtzeit-Container bündelt CUDA, Triton, vLLM und den vollständigen VoiceChat-Inferenz-Stack und stellt einen bidirektionalen WebSocket-Dienst bereit.
Klonen Sie den experimentellen VoiceChat-Zweig von NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Beschreibe deine Idee einmal, und We0 AI erstellt eine Showcase-Website, Seiten und ein CMS und hilft nach dem Launch bei Kunden und Traffic.
Eine komplette Projektgeneration zur kostenlosen Registrierung
Am besten geeignet, um einen vollständigen Generierungsablauf auszuprobieren und schnell einen ersten Projektentwurf zu sehen.
Umgebung erstellen:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Checkpoint herunterladen:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
Beispiel ausführen:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA empfiehlt, am Ende des benutzerdefinierten Eingabe-Audios ausreichend Stille hinzuzufügen, damit das Modell Zeit zum Antworten hat.
Modell-Repository herunterladen:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Dienst starten:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Bereitschaft prüfen:
curl 'http://localhost:9000/v1/realtime/health'
Anschließend stellt der Server einen bidirektionalen WebSocket-Endpunkt unter folgender Adresse bereit:
ws://localhost:9000/v1/realtime
Ein vereinfachtes Beispiel für eine Tool-Definition:
[
{
"name": "get_weather",
"description": "Ruft das aktuelle Wetter für eine Stadt ab",
"ack_messages": [
"Gut, ich schaue das für Sie nach."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
Das Feld ack_messages liefert dem System während der Tool-Ausführung natürliche Antwortinhalte.
NVIDIA kennzeichnet VoiceChat 11B ausdrücklich als nur für Forschungszwecke.
Das Modell wurde mit einem Audio-Kontextfenster von höchstens etwa zwei Minuten trainiert; längere Gesprächskontexte können daher möglicherweise nicht zuverlässig beibehalten werden.
Bekannte Probleme umfassen Inferenzfehler, Halluzinationen, nachlassende Sprachqualität nach mehreren Gesprächsrunden, Wiederholungen, verstümmelten Text, abgebrochene Sprache, unkontrolliertes Weitersprechen, Selbstgespräche, Klärungsschleifen, fehlende Wörter in Transkriptionen, unzuverlässigen Sprachwechsel sowie schlechte Leistung in lauten oder stark hallenden Umgebungen.
Mögliche Forschungs- und Prototypenszenarien umfassen:
Agenten können natürlich zuhören, Unterbrechungen verarbeiten, Kundenservice-Tools aufrufen und während der API-Antwort Bestätigungsmeldungen verwenden.
Fahrer können den Assistenten unterbrechen, ohne das Ende einer vollständigen Sprachantwort abzuwarten. Die aktuelle Empfindlichkeit gegenüber Hintergrundgeräuschen bedeutet, dass ein Fahrzeugeinsatz zusätzliche Optimierungsarbeit erfordert.
Sprachagenten können Bestellungen aufnehmen, auf Korrekturen reagieren und Waren- oder Inventarsysteme aufrufen.
Natürlichere Gesprächswechsel unterstützen freihändige Schnittstellen und sprachgesteuerte Anwendungen, doch Barrierefreiheitsbereitstellungen erfordern sorgfältige Benutzertests.
Organisationen können mit internen Tools und selbst gehosteten Sprachinteraktionen experimentieren, während das Modell innerhalb der eigenen Infrastruktur bleibt.
Der Begriff „Open Source“ muss präziser verstanden werden.
Der von VoiceChat verwendete NeMo-Speech-Code ist unter der Apache-Lizenz 2.0 lizenziert.
Die Modellmaterialien von VoiceChat sind unter der OpenMDW 1.1-Lizenz lizenziert.
Daher ist es zutreffender, VoiceChat 11B als offenes Modell oder Modell mit offenen Gewichten zu beschreiben, anstatt anzunehmen, dass die Modelllizenz identisch mit der Apache-lizenzierten umgebenden Software ist.
Teams, die eine Weiterverbreitung oder kommerzielle Nutzung planen, sollten die OpenMDW-Lizenz direkt prüfen.
Ein sinnvoller Evaluierungsplan sollte abdecken:
Gesprächswechsel und Verarbeitung von Benutzerunterbrechungen
Satzmittige Pausen und Bestätigungssignale
Laute, hallende und Mehrsprachler-Audio
Fehlende oder fehlerhafte Tool-Parameter
Tool-Timeout und API-Aufruffehler
Sprachagenten, die Tools aufrufen können, benötigen dieselben Berechtigungskontrollen wie andere autonome Agenten.
NemotronLabs VoiceChat 11B ist ein von NVIDIA entwickeltes Echtzeit-Sprach-zu-Sprach-Modell (End-to-End) für duplexe Konversations-KI. Es kombiniert Streaming-Sprachanalyse, das Nemotron-Sprachmodell als Rückgrat, Sprachsynthese sowie einen separaten Kanal für Tool-Aufrufe.
NVIDIA gibt für das Modell eine Serverlatenz von 448 ms bei flüssiger Turn-Taking-Konversation und etwa 480 ms Unterbrechungslatenz an, gemessen auf dem Full-Duplex-Bench 1.0.
Ja, während normaler Unterhaltungen werden Interjektionen und Unterbrechungen unterstützt. Allerdings gibt NVIDIA an, dass Benutzer den Agenten während der Ausführung von Tools derzeit nicht unterbrechen können.
Ja. Das Modell kann über einen separaten Ausgabekanal Tool-Aufrufe ausgeben. Entwickler können Bestätigungsnachrichten definieren, die während der Ausführung externer Tools gesprochen werden.
Der Echtzeit-Container von NVIDIA erfordert eine GPU mit mindestens 80 GB Videospeicher. Die Fehlerbehebungsdokumentation gibt an, dass das geladene Modell etwa 66 GB belegt.
NVIDIA bietet derzeit Dokumentation für selbst-gehostete Offline-Inferenz und optimierte Echtzeit-Container an. Die Hugging-Face-Modellseite listet derzeit keine gehosteten Inferenzanbieter auf.
Nein. Die veröffentlichten Checkpoints verwenden eine feste Stimme und unterstützen kein Stimmklonen.
NVIDIA kennzeichnet das Modell als forschungsnutzung. Entwickler sollten vor dem Produktionseinsatz seine Einschränkungen bei Kontextlänge, Reasoning, Tool-Nutzung, verrauschtem Audio, Wiederholungen, Transkription und unkontrollierter Sprache bewerten.
Primärquelle, die Veröffentlichungsdatum, Benchmarks, Trainingsdaten, Architektur und den Status „nur für Forschung" abdeckt.
NVIDIA NemotronLabs VoiceChat 11B vereint Sprachanalyse, Sprachmodellierung, Sprachsynthese, Unterbrechungsverarbeitung und Tool-Aufruffähigkeiten in einer einheitlichen vollduplexen Architektur. NVIDIA gibt eine Serverlatenz von nur 448 ms an und positioniert das Modell an der Spitze der derzeit offenen vollduplexen Sprachbenchmarks.
Das bemerkenswerteste technische Merkmal ist die Tool-Aufruffunktion. Ein separater Ausgabekanal kann externe Funktionen auslösen, während Bestätigungsnachrichten verhindern, dass die Unterhaltung während API-Aufrufen verstummt.
Diese Version ist noch kein vollständiger, produktionsreifer Dienst. Die Echtzeitbereitstellung erfordert mindestens 80 GB GPU-Videospeicher, aktuelle Checkpoints verwenden feste Stimmen, gehostete Inferenz ist noch nicht weit verbreitet verfügbar, und NVIDIA dokumentiert ausdrücklich erhebliche Einschränkungen bei längeren Sitzungen, Reasoning, verrauschtem Audio und der Tool-Ausführung.
VoiceChat 11B ist daher besser als offene Forschungsplattform für den Aufbau und die Untersuchung von Echtzeit-Sprachagenten mit niedriger Latenz zu betrachten, denn als ausgereifte Lösung, die in der Produktion Callcenter oder kommerzielle Sprach-APIs ersetzt.
Starte mit einem Satz und erhalte in wenigen Minuten eine vollständige Website.