소개
NVIDIA가 NemotronLabs VoiceChat 11B를 공개했습니다. 자연스러운 전이중 음성 대화를 위해 설계된 엔드투엔드 실시간 음성-음성 모델입니다.
자동 음성 인식, 대규모 언어 모델, 텍스트 음성 변환을 직렬로 연결하는 일반적인 파이프라인과 달리, VoiceChat은 통합된 아키텍처 내에서 스트리밍 음성 이해와 음성 생성을 처리합니다. 목표는 지연 시간을 늘리고 음성 어시스턴트를 덜 자연스럽게 만드는 핸드오프 단계를 줄이는 것입니다.
이 모델은 대화가 진행되는 동안 듣고, 사용자가 끼어들면 발언권을 양보하며, 사용자가 말을 마치면 자연스럽게 다시 응답합니다. NVIDIA는 Full-Duplex-Bench 1.0에서 부드러운 턴테이킹 지연 시간 448밀리초, 인터럽트 지연 시간 약 480밀리초를 보고했습니다.
VoiceChat은 또한 프로덕션급 음성 에이전트에 특히 중요한 기능을 도입했습니다: 음성 대화가 활성 상태를 유지하는 동안 실시간 도구 호출입니다. 별도의 출력 채널이 도구 호출 지시문을 내보낼 수 있으며, 사전 정의된 확인 메시지를 통해 에이전트가 외부 API 요청 중 어색한 침묵을 피할 수 있습니다.
이번 출시는 의미가 크지만 아직 초기 단계입니다. NVIDIA는 이 모델을 연구용으로만 표시했으며, 배포에 상당한 GPU 메모리가 필요하다고 권장하고 긴 대화, 소음 환경, 추론, 다중 도구 사용, 통제 불능 음성과 관련된 여러 제한 사항을 문서화했습니다.
통합 음성-음성 아키텍처
기존의 실시간 음성 어시스턴트는 일반적으로 다음과 같습니다:
사용자 음성
↓
ASR(자동 음성 인식)
↓
텍스트
↓
LLM(대규모 언어 모델)
↓
텍스트 응답
↓
TTS(텍스트 음성 변환)
↓
에이전트 음성
VoiceChat은 이러한 기능을 훨씬 더 긴밀하게 통합된 모델로 결합합니다.
NVIDIA는 이 11B 시스템을 하이브리드 Mamba/Transformer 아키텍처로 설명하며, 다음 구성 요소로 이루어져 있습니다:
- Fast Conformer 음성 인코더
- Nemotron Nano v2 9B 언어 모델 백본
- NVIDIA TTS 디코더 및 오디오 코덱
- 도구 호출 스크립트용 별도 채널
사용자는 16kHz로 음성을 제공합니다. 출력에는 에이전트 텍스트, 에이전트 음성, 사용자 전사 텍스트가 포함되며, 에이전트 오디오는 22.05kHz로 생성됩니다.
전이중은 대화가 겹칠 수 있음을 의미
반이중 어시스턴트는 사실상 워키토키처럼 대화를 처리합니다: 한쪽이 말을 마치면 다른 쪽이 응답합니다.
전이중 시스템은 대화의 양쪽을 지속적으로 모델링할 수 있습니다. 이를 통해 인터럽트 처리, 일시 정지, 주고받는 교류, 더 자연스러운 턴테이킹이 가능해집니다.
NVIDIA가 발표한 Full-Duplex-Bench 1.0 결과는 다음과 같습니다:
| 지표 | VoiceChat 11B 결과 |
|---|---|
| 부드러운 턴테이킹 TOR(턴 점유율) | 0.82 |
| 부드러운 턴테이킹 지연 시간 | 448밀리초 |
| 사용자 인터럽트 TOR | 1.0 |
| 사용자 인터럽트 지연 시간 | 480밀리초 |
| 사용자 인터럽트 GPT-4o 점수 | 4.33 |
원문 뉴스 기사에서 언급된 448밀리초 수치는 부드러운 턴테이킹 벤치마크에서 나온 것입니다. NVIDIA는 이 모델이 약 450밀리초의 응답 지연 시간을 제공한다고 요약합니다.
VoiceChat은 사용자가 끼어들면 발언권을 양보하도록 설계
인터럽트 처리는 음성 데모와 실제 사용 가능한 대화 에이전트를 구분 짓는 가장 큰 차이점 중 하나입니다.
VoiceChat
이 모델은 대화형 턴테이킹에 직접 훈련되었습니다. 사용자가 모델 응답 도중에 말을 시작하면 시스템은 음성 발언을 중단하고 듣기만 할 수 있습니다.
NVIDIA의 알려진 제한 사항 문서에 따르면 이 동작이 모든 상황에서 완벽하지는 않습니다. 모델은 여전히 사용자 문장의 일시 정지 지점에서 사용자를 방해하거나, 중단해야 할 시점 이후에도 계속 말하거나, 새로운 입력 없이 새 턴을 시작하거나, 루프에 빠지거나, 피드백 신호를 잘못 처리할 수 있습니다.
실시간 도구 호출이 가장 흥미로운 엔지니어링 기능
VoiceChat 11B는 NVIDIA의 첫 번째 오픈소스 전이중 도구 호출 지원 모델로, 도구를 사용하는 동안 자연스러운 음성 상호작용을 유지하도록 설계되었습니다.
음성 에이전트는 종종 모델 내부에 포함되지 않은 정보가 필요합니다. 예를 들어:
내 주문의 현재 상태는 무엇인가요?
모델은 답변하기 전에 먼저 주문 관리 API를 호출해야 할 수 있습니다.
VoiceChat은 도구에 대한 확인 메시지를 지원합니다. 개발자는 다음과 같은 짧은 문구를 정의할 수 있습니다:
알겠습니다. 잠시만 확인해 드릴게요.
모델이 도구 호출을 결정하면 시스템은 외부 요청을 처리하는 동안 이 문구 중 하나를 말할 수 있습니다.
단순화된 흐름은 다음과 같습니다:
사용자 발화
↓
VoiceChat 응답
↓
모델이 도구 필요성을 판단
↓
도구 호출 이벤트가 클라이언트로 전송
↓
클라이언트가 외부 기능 실행
↓
도구 결과가 VoiceChat으로 반환
↓
VoiceChat이 음성 응답 재개
중요한 도구 호출 제한 사항
NVIDIA는 세션당 최대 약 5개의 도구를 권장합니다. 사용 가능한 도구가 많아지면 성능이 저하될 수 있기 때문입니다.
현재 모델은 여러 도구를 동시에 안정적으로 호출할 수 없습니다.
또한 도구 선택 오류, 도구 호출 건너뛰기, 허위 매개변수 생성, 도구 결과를 잘못 구술하거나 도구를 사용해야 할 때 내부 지식에 의존하는 등의 제한 사항이 있습니다.
특히 중요한 세부 사항: VoiceChat은 일반 대화에서 사용자 인터럽트를 지원하지만 현재 사용자는 도구 실행 중에는 에이전트를 인터럽트할 수 없습니다.
도구 호출 벤치마크 결과
보고된 AU Harness 결과는 다음과 같습니다:
| 도구 호출 범주 | 점수 |
|---|---|
| 단순 | 58.5% |
| 다중 | 62.5% |
| 병렬 | 42.5% |
| 병렬 다중 | 27.5% |
| 무관성 | 89.6% |
| 평균 | 56.1% |
Full-Duplex-Bench v3에서 NVIDIA는 다음을 보고했습니다:
| 지표 | 점수 |
|---|---|
| 도구 선택 | 82.5% |
| 매개변수 정확도 | 44.2% |
| Pass@1 | 33% |
이 수치는 프로덕션 환경에서 도구 호출이 여전히 애플리케이션 로직과 매개변수 검증으로 보호되어야 함을 시사합니다.
VoiceChat은 오픈소스 전이중 모델 중 상위권
NVIDIA는 VoiceChat이 VoiceBench와 Full-Duplex-Bench 1.0 모두에서 오픈소스 전이중 모델 중 2위를 차지했다고 보고합니다.
이 모델은 범용 지능과 자연스러운 실시간 대화 사이의 균형에 최적화되어 있습니다. NVIDIA는 지식, 지시 따르기, 안전성, 추론 작업에서 기반이 되는 Nemotron Nano v2 언어 모델보다 성능이 낮을 수 있다고 명시적으로 경고합니다.
이 모델은 약 55만 시간의 오디오로 훈련
NVIDIA의 모델 카드에는 약 55만 시간의 오디오 훈련 데이터가 기재되어 있습니다.
이 혼합 데이터
에는 실제 음성과 합성 음성, 그리고 언어 모델 구성 요소를 위한 텍스트 데이터가 포함됩니다. 명명된 데이터 출처로는 Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, NVIDIA 내부 음성 데이터, 합성 음성, Nemotron 함수 호출 데이터 및 PersonaPlex 훈련 데이터가 있습니다.
VoiceChat은 고정 음성을 사용
현재 VoiceChat 체크포인트는 음성 복제를 지원하지 않습니다.
NVIDIA의 저장소 설명에 따르면 공개된 체크포인트는 고정 음성을 사용합니다. 이번 출시의 목적은 더욱 집중되어 있습니다: 저지연, 전이중 대화 동작 및 도구 인식 음성 상호작용입니다.
하드웨어 요구 사항이 상당히 높음
NVIDIA의 현재 실시간 배포 사전 요구 사항은 명시적으로 다음과 같습니다:
최소 80GB VRAM의 NVIDIA GPU
문서화된 컨테이너 지원 GPU에는 NVIDIA A100, H100, RTX 6000 Pro 및 B200이 포함됩니다. 더 광범위한 모델 카드에는 H200 및 B100 호환성도 나열되어 있습니다.
최적화된 실시간 컨테이너의 경우 NVIDIA는 현재 x86_64, Linux, Docker, NVIDIA 컨테이너 툴킷 및 호환 NVIDIA 드라이버를 요구합니다.
문제 해결 가이드에 따르면 모델 자체는 약 66GB의 GPU 메모리를 사용합니다.
아직 성숙된 호스팅 추론 API는 없음
8월 11일 기준, Hugging Face 모델 페이지에는 이 체크포인트에 대한 활성 추론 제공업체가 나열되어 있지 않습니다.
대신 NVIDIA는 두 가지 주요 경로를 제공합니다:
- 오프라인 추론
- Hugging Face 체크포인트에서 수행
- 대화형 스트리밍
- 최적화된 NVIDIA 컨테이너를 통한 방식
실시간 컨테이너는 CUDA, Triton, vLLM 및 전체 VoiceChat 추론 스택을 패키징하며, 양방향 WebSocket 서비스를 노출합니다.
오프라인 추론 실행 방법
NVIDIA의 실험적 VoiceChat 브랜치를 클론합니다:
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
환경을 생성합니다:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
체크포인트를 다운로드합니다:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
예제를 실행합니다:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA는 모델이 응답할 시간을 확보할 수 있도록 사용자 지정 입력 오디오 끝에 충분한 무음을 추가할 것을 권장합니다.
실시간 컨테이너 배포 방법
모델 저장소를 다운로드합니다:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
서비스를 시작합니다:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
준비 상태를 확인합니다:
curl 'http://localhost:9000/v1/realtime/health'
그러면 서버는 다음 주소에서 양방향 WebSocket 엔드포인트를 노출합니다:
ws://localhost:9000/v1/realtime
간단한 도구 정의 예시
단순화된 도구 정의 예시는 다음과 같습니다:
[
{
"name": "get_weather",
"description": "특정 도시의 현재 날씨를 가져옵니다",
"ack_messages": [
"알겠습니다. 확인해 드리겠습니다."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
ack_messages 필드는 도구 실행 중 시스템에 자연스러운 응답 내용을 제공합니다.
연구 목적으로만 사용, 프로덕션 팀은 주의 필요
NVIDIA는 VoiceChat 11B를 명시적으로 연구 목적으로만 사용하도록 표시했습니다.
이 모델은 약 2분을 초과하지 않는 오디오 컨텍스트 창으로 학습되었으므로, 더 긴 대화 컨텍스트는 안정적으로 유지되지 않을 수 있습니다.
알려진 문제로는 추론 오류, 환각, 다중 턴 대화 후 음성 품질 저하, 반복, 깨진 텍스트, 음성 잘림, 통제 불능의 연속 발화, 자기 대화, 확인 루프, 전사에서 누락된 단어, 불안정한 언어 전환, 그리고 시끄럽거나 잔향이 심한 환경에서의 성능 저하가 있습니다.
VoiceChat 11B의 잠재적 사용 사례
잠재적인 연구 및 프로토타입 시나리오는 다음과 같습니다:
컨택 센터
에이전트는 자연스럽게 듣고, 끼어들기를 처리하고, 고객 서비스 도구를 호출하고, API 응답을 기다리는 동안 확인 메시지를 사용할 수 있습니다.
차량 내 어시스턴트
운전자는 전체 음성 응답이 끝날 때까지 기다릴 필요 없이 어시스턴트를 방해할 수 있습니다. 현재 배경 소음에 대한 민감도는 차량 내 배포에 추가 최적화 작업이 필요함을 의미합니다.
소매 및 식당 주문
음성 에이전트는 주문을 수집하고, 수정 사항에 응답하며, 상품 또는 재고 시스템을 호출할 수 있습니다.
접근성 지원
더 자연스러운 대화 턴 전환은 핸즈프리 인터페이스와 음성 우선 애플리케이션에 도움이 되지만, 접근성 배포에는 신중한 사용자 테스트가 필요합니다.
기업용 음성 에이전트
조직은 내부 도구와 자체 호스팅 음성 상호작용을 실험하면서 모델을 자체 인프라 내에 유지할 수 있습니다.
오픈 모델이지만 두 가지 다른 라이선스
"오픈소스"라는 표현은 더 정확하게 이해할 필요가 있습니다.
VoiceChat이 사용하는 NeMo Speech 코드는 Apache License 2.0으로 라이선스가 부여됩니다.
VoiceChat 모델 자료는 OpenMDW 1.1 라이선스를 사용합니다.
따라서 VoiceChat 11B를 주변의 Apache 라이선스 소프트웨어와 동일한 라이선스를 가정하기보다는 오픈 모델 또는 오픈 가중치 모델로 설명하는 것이 더 안전합니다.
재배포 또는 상업적 사용을 계획하는 팀은 OpenMDW 라이선스를 직접 검토해야 합니다.
프로덕션 전 개발자가 테스트해야 할 사항
유용한 평가 계획은 다음을 포함해야 합니다:
-
대화 턴 전환 및 사용자 끼어들기 처리
-
문장 중간 멈춤 및 피드백 신호
-
시끄러운 환경, 메아리, 다중 화자 오디오
-
잘못되었거나 누락된 도구 매개변수
도구 타임아웃 및 API 호출 실패
- 긴 대화
- 통제 불능 음성
- 환각 및 추론 품질 문제
- 민감한 작업은 승인 필요
- 로그 기록, 속도 제한 및 수동 에스컬레이션
도구를 호출할 수 있는 음성 에이전트는 다른 자율 에이전트와 동일한 권한 제어가 필요합니다.
자주 묻는 질문
NVIDIA NemotronLabs VoiceChat 11B란 무엇인가요?
NemotronLabs VoiceChat 11B는 NVIDIA가 출시한 엔드투엔드 실시간 음성-대-음성 모델로, 전이중 대화형 AI를 위해 설계되었습니다. 스트리밍 음성 이해, Nemotron 언어 모델 백본, 음성 생성 및 독립적인 도구 호출 채널을 결합합니다.
VoiceChat 11B의 속도는 얼마나 빠른가요?
NVIDIA는 Full-Duplex-Bench 1.0에서 448ms의 원활한 턴테이킹 지연 시간과 약 480ms의 인터럽트 지연 시간을 달성했다고 보고합니다.
사용자가 VoiceChat이 말하는 도중에 끼어들 수 있나요?
네, 일반 대화에서는 삽입 및 인터럽트 처리가 지원됩니다. 그러나 NVIDIA는 도구 실행 중에는 사용자가 현재 에이전트를 방해할 수 없다고 밝혔습니다.
VoiceChat 11B는 함수 호출을 지원하나요?
지원합니다. 이 모델은 독립적인 출력 채널을 통해 도구 호출을 발행할 수 있으며, 개발자는 외부 도구 실행 중에 안내되는 확인 메시지를 정의할 수 있습니다.
VoiceChat 11B에는 얼마나 많은 GPU 메모리가 필요한가요?
NVIDIA의 실시간 컨테이너는 최소 80GB VRAM의 GPU가 필요합니다. 문제 해결 문서에 따르면 로드된 모델은 약 66GB를 사용합니다.
호스팅된 VoiceChat 11B API가 있나요?
NVIDIA는 현재 자체 호스팅 오프라인 추론 및 최적화된 실시간 컨테이너 문서를 제공합니다. Hugging Face 모델 페이지에는 현재 호스팅 추론 제공업체가 나열되어 있지 않습니다.
VoiceChat은 음성을 복제할 수 있나요?
아니요. 출시된 체크포인트는 고정 음성을 사용하며 음성 복제를 지원하지 않습니다.
VoiceChat 11B를 프로덕션 환경에서 사용할 수 있나요?
NVIDIA는 이 모델을 연구 전용으로 표시합니다. 개발자는 프로덕션 배포 전에 컨텍스트 길이, 추론, 도구 사용, 소음이 많은 오디오, 반복, 전사 및 통제 불능 음성과 관련된 한계를 평가해야 합니다.
관련 도구
- NVIDIA NemotronLabs VoiceChat 11B: 공식 모델 카드, 가중치, 벤치마크, 아키텍처, 라이선스 및 추론 지침.
- NVIDIA NeMo Speech: VoiceChat 구현 및 배포 브랜치가 포함된 공식 음성 저장소.
- NVIDIA VoiceChat 실시간 컨테이너 가이드: 공식 Docker, WebSocket 및 함수 호출 배포 지침.
- NVIDIA 컨테이너 툴킷: Docker 컨테이너가 NVIDIA GPU에 액세스할 수 있도록 지원.
- vLLM: NVIDIA VoiceChat 모델 카드에 나열된 추론 엔진.
- VoiceBench: LLM 기반 음성 어시스턴트를 평가하기 위한 오픈 벤치마크.
관련 링크
- VoiceChat 11B 모델 카드: 출시일, 벤치마크, 학습 데이터, 아키텍처 및 연구 전용 상태에 대한 주요 출처.
- VoiceChat GitHub 브랜치: 공식 소스 코드, 설치 지침, 하드웨어 요구 사항, 한계 및 모델 설명.
- 실시간 배포 사전 요구 사항: 하드웨어, Linux, Docker, 드라이버 및 컨테이너 툴킷 요구 사항.
- 실시간 배포 가이드: NVIDIA의 컨테이너 시작, 상태 확인, WebSocket, 클라이언트 및 도구 호출 문서.
- OpenMDW 1.1 라이선스: VoiceChat 모델 자료를 관할하는 라이선스.
- Full-Duplex-Bench: 일시 중지 처리, 턴테이킹 및 인터럽트 동작을 평가하기 위한 벤치마크.
- Full-Duplex-Bench v3: 도구 호출이 포함된 전이중 음성 상호작용에 중점을 둔 벤치마크.
요약
NVIDIA NemotronLabs VoiceChat 11B는 통합된 전이중 아키텍처에서 음성 이해, 언어 모델링, 음성 생성, 인터럽트 처리 및 도구 호출 기능을 결합합니다. NVIDIA는 턴테이킹 지연 시간이 448ms에 불과하다고 보고하며, 이 모델을 현재 오픈 전이중 음성 벤치마크의 선두 위치에 두고 있습니다.
가장 주목할 만한 엔지니어링 기능은 도구 호출입니다. 독립적인 출력 채널이 외부 기능을 트리거할 수 있으며, 확인 메시지를 통해 API 호출 중 대화가 침묵에 빠지는 것을 방지할 수 있습니다.
이 버전은 아직 프로덕션에 바로 투입할 수 있는 완전한 서비스가 아닙니다. 실시간 배포에는 최소 80GB의 GPU VRAM이 필요하며, 현재 체크포인트는 고정 음성을 사용하고, 호스팅 추론은 아직 널리 제공되지 않으며, NVIDIA는 긴 세션, 추론, 소음이 많은 오디오 및 도구 실행과 관련된 상당한 한계를 명시적으로 문서화했습니다.
VoiceChat 11B는 프로덕션 환경의 콜센터나 소비자용 음성 API를 대체할 성숙한 솔루션보다는, 저지연 음성 에이전트를 구축하고 연구하기 위한 오픈 연구 플랫폼으로 보는 것이 더 적절합니다.



