For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/nvidia-nemotronlabs-voicechat-11b-open-full.md.
NVIDIA 发布 NemotronLabs VoiceChat 11B:这是一款开放的端到端全双工语音模型,可在实时对话中处理用户打断、自然恢复,并通过双向 WebSocket 调用外部工具。

NVIDIA 发布了 NemotronLabs VoiceChat 11B,一款端到端实时语音到语音模型,专为自然的全双工语音对话而设计。
与将自动语音识别、大语言模型和文本转语音串联起来的常见流水线不同,VoiceChat 在统一的架构内处理流式语音理解和语音生成。其目标是减少通常会增加延迟、使语音助手感觉不够自然的交接环节。
该模型可以在对话进行时聆听,在用户打断时让出话语权,并在用户说完后自然恢复。NVIDIA 报告在 Full-Duplex-Bench 1.0 上的平滑轮流说话延迟为 448 毫秒,打断延迟约为 480 毫秒。
VoiceChat 还引入了对生产级语音代理尤为相关的功能:在语音对话保持活跃的同时进行实时工具调用。一个单独的输出通道可以发出工具调用指令,而预定义的确认消息帮助代理在外部 API 请求期间避免尴尬的静默停顿。
此次发布意义重大,但仍处于早期阶段。NVIDIA 将该模型标注为仅限研究用途,建议部署时需要大量 GPU 内存,并记录了在长对话、嘈杂环境、推理、多工具使用和失控语音方面的若干限制。
传统的实时语音助手通常如下所示:
用户语音
↓
ASR(自动语音识别)
↓
文本
↓
LLM(大语言模型)
↓
文本回复
↓
TTS(文本转语音)
↓
代理语音
VoiceChat 将这些能力整合到一个更加紧密集成的模型中。
NVIDIA 将这款 11B 系统描述为混合 Mamba/Transformer 架构,由以下部分组成:
用户以 16 kHz 提供语音。输出包括代理文本、代理语音和用户转录文本,其中代理音频以 22.05 kHz 生成。
半双工助手实际上像对讲机一样处理对话:一方说完,另一方再回应。
全双工系统可以持续建模对话的双方。这使得打断处理、停顿、来回交流以及更自然的轮流说话成为可能。
NVIDIA 发布的 Full-Duplex-Bench 1.0 结果包括:
| 指标 | VoiceChat 11B 结果 |
|---|---|
| 平滑轮流说话 TOR(轮流占用率) | 0.82 |
| 平滑轮流说话延迟 | 448 毫秒 |
| 用户打断 TOR | 1.0 |
| 用户打断延迟 | 480 毫秒 |
| 用户打断 GPT-4o 评分 | 4.33 |
原始新闻文章中提到的 448 毫秒数据来自平滑轮流说话基准测试。NVIDIA 将模型概括为提供约 450 毫秒的响应延迟。
打断处理是语音演示与可用对话代理之间最大的区别之一。
VoiceChat
该模型直接针对对话式轮流发言进行了训练。当用户在模型回复中途开始说话时,系统可以停止其语音轮次并倾听。
NVIDIA 的已知限制文档也指出,该行为并非在所有情况下都完美。模型仍可能在用户句中停顿处打断用户、在应停止后继续说话、在没有新输入的情况下发起新轮次、陷入循环,或错误处理反馈信号。
VoiceChat 11B 是 NVIDIA 首款支持工具调用的开源全双工模型,其设计旨在使用工具时保持自然的语音交互。
语音代理经常需要模型内部不包含的信息。例如:
我订单的当前状态是什么?
模型可能需要先调用订单管理 API,然后才能回答。
VoiceChat 支持工具的确认消息。开发人员可以定义诸如以下的简短短语:
好的,让我为您查一下。
当模型决定调用工具时,系统可以在处理外部请求期间说出其中一条短语。
简化的流程如下所示:
用户说话
↓
VoiceChat 回应
↓
模型确定需要工具
↓
工具调用事件发送至客户端
↓
客户端执行外部功能
↓
工具结果返回给 VoiceChat
↓
VoiceChat 恢复语音回答
NVIDIA 建议每次会话最多约五个工具,因为可用工具更多时性能可能会下降。
该模型目前还无法可靠地同时调用多个工具。
其他限制包括工具选择错误、跳过工具调用、虚构参数、错误口述工具结果,以及在应使用工具时却依靠内部知识作答。
一个特别重要的细节:尽管 VoiceChat 支持在正常对话中由用户打断,但目前用户无法在工具执行期间打断代理。
报告的 AU Harness 结果为:
| 工具调用类别 | 得分 |
|---|---|
| 简单 | 58.5% |
| 多个 | 62.5% |
| 并行 | 42.5% |
| 并行多个 | 27.5% |
| 无关性 | 89.6% |
| 平均 | 56.1% |
在 Full-Duplex-Bench v3 上,NVIDIA 报告:
| 指标 | 得分 |
|---|---|
| 工具选择 | 82.5% |
| 参数准确性 | 44.2% |
| Pass@1 | 33% |
这些数字表明,生产环境中的工具调用仍应由应用程序逻辑和参数验证加以保护。
NVIDIA 报告称,VoiceChat 在 VoiceBench 和 Full-Duplex-Bench 1.0 上均位列开源全双工模型第二。
该模型针对通用智能与自然实时对话之间的权衡进行了优化。NVIDIA 明确警告,在知识、指令遵循、安全性和推理任务上,其表现可能不如底层的 Nemotron Nano v2 语言模型。
NVIDIA 的模型卡列出了约55 万小时的音频训练数据。
该混合数据
包括真实语音和合成语音,以及用于语言模型组件的文本数据。命名的数据源包括Fisher、LibriVox、LibriTTS、HiFi-TTS、VCTK、PromptTTS、UltraChat、NVIDIA内部语音数据、合成语音、Nemotron函数调用数据和PersonaPlex训练数据。
当前的VoiceChat检查点不支持语音克隆。
NVIDIA的仓库说明发布的检查点使用一个固定语音。此次发布的目的更加聚焦:低延迟、全双工会话行为和工具感知的语音交互。
NVIDIA当前的实时部署前提条件明确要求:
至少80 GB显存的NVIDIA GPU
文档中记录的容器支持的GPU包括NVIDIA A100、H100、RTX 6000 Pro和B200。更广泛的模型卡还列出了H200和B100兼容性。
对于优化的实时容器,NVIDIA目前要求x86_64、Linux、Docker、NVIDIA容器工具包和兼容的NVIDIA驱动程序。
故障排除指南指出,模型本身使用约66 GB的GPU内存。
截至8月11日,Hugging Face模型页面未列出该检查点的活跃推理提供商。
相反,NVIDIA提供两条主要路径:
实时容器打包了CUDA、Triton、vLLM和完整的VoiceChat推理栈,并暴露了双向WebSocket服务。
克隆NVIDIA的实验性VoiceChat分支:
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
创建环境:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
下载检查点:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
运行示例:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA建议在自定义输入音频末尾添加足够的静音,以便模型有时间响应。
下载模型仓库:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
启动服务:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
检查就绪状态:
curl 'http://localhost:9000/v1/realtime/health'
随后服务器会在以下地址暴露一个双向 WebSocket 端点:
ws://localhost:9000/v1/realtime
简化的工具定义示例如下:
[
{
"name": "get_weather",
"description": "获取某个城市的当前天气",
"ack_messages": [
"好的,让我为您查一下。"
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
ack_messages 字段为系统在工具执行期间提供了自然的回应内容。
NVIDIA 明确将 VoiceChat 11B 标记为仅供研究使用。
该模型训练时的音频上下文窗口不超过约两分钟,因此较长的对话上下文可能无法被可靠保留。
已知问题包括推理错误、幻觉、多轮对话后语音质量下降、重复、乱码文本、语音截断、失控式续说、自我对话、澄清循环、转录中缺失词语、语言切换不可靠,以及在嘈杂或高混响环境中表现不佳。
潜在的研究和原型场景包括:
智能体可以自然地聆听、处理插话、调用客服工具,并在等待 API 返回时使用确认消息。
驾驶员无需等待完整的语音回复结束即可打断助手。当前对背景噪音的敏感度意味着车载部署需要额外的优化工作。
语音智能体可以收集订单、响应更正,并调用商品或库存系统。
更自然的对话轮换有助于免提界面和语音优先应用,但无障碍部署需要仔细的用户测试。
组织可以在内部工具和自托管语音交互方面进行试验,同时将模型保留在自己基础设施之内。
“开源”这一说法需要更精确地理解。
VoiceChat 使用的 NeMo Speech 代码 采用 Apache License 2.0 许可证。
VoiceChat 模型材料 使用 OpenMDW 1.1 许可证。
因此,将 VoiceChat 11B 描述为开放模型或开放权重模型更为稳妥,而非假设模型许可证与其周围采用 Apache 许可的软件完全相同。
计划进行再分发或商业使用的团队应直接审阅 OpenMDW 许可证。
一份有用的评估计划应涵盖:
对话轮换和用户插话处理
句中停顿和回馈信号
嘈杂、回声和多说话人音频
错误或缺失的工具参数
工具超时和API调用失败
长对话
失控的语音
幻觉和推理质量问题
敏感操作需审批
日志记录、速率限制和人工升级
能够调用工具的语音代理需要与其他自主代理相同的权限控制。
NemotronLabs VoiceChat 11B是NVIDIA推出的端到端实时语音到语音模型,用于全双工对话式AI。它结合了流式语音理解、Nemotron语言模型骨干、语音生成以及独立的工具调用通道。
NVIDIA报告其在Full-Duplex-Bench 1.0上实现了448毫秒的平滑轮流对话延迟和约480毫秒的打断延迟。
可以,正常对话支持插入和打断处理。然而,NVIDIA表示在工具执行期间用户目前无法打断代理。
支持。该模型可以通过独立的输出通道发出工具调用,开发者可以定义在外部工具运行期间播报的确认消息。
NVIDIA的实时容器需要至少80 GB显存的GPU。故障排除文档指出加载后的模型大约使用66 GB。
NVIDIA目前提供自托管离线推理和优化的实时容器文档。Hugging Face模型页面目前未列出托管推理提供商。
不可以。发布的检查点使用固定声音,不支持声音克隆。
NVIDIA将该模型标记为仅限研究使用。开发者应在生产部署前评估其在上下文长度、推理、工具使用、嘈杂音频、重复、转录和失控语音方面的局限性。
主要来源涵盖发布日期、基准测试、训练数据、架构及仅供研究用途的状态说明。
NVIDIA NemotronLabs VoiceChat 11B 在统一的全双工架构中融合了语音理解、语言建模、语音生成、打断处理及工具调用能力。NVIDIA 报告其轮换说话延迟仅为 448 毫秒,并将该模型定位在当前开放全双工语音基准测试的领先位置。
最值得关注的工程特性是工具调用。独立的输出通道可触发外部功能,同时确认消息可避免对话在 API 调用期间陷入沉默。
该版本尚非可直接投入生产的完整服务。实时部署至少需要 80 GB 的 GPU 显存,当前检查点使用固定语音,托管推理尚未广泛提供,且 NVIDIA 明确记录了在较长会话、推理、嘈杂音频及工具执行方面的显著局限。
VoiceChat 11B 更适合被视为用于构建和研究低延迟语音智能体的开放研究平台,而非用于替代生产环境中的客服中心或消费级语音 API 的成熟方案。
从一句话开始,几分钟内拿到完整网站。