서론
Tencent Hunyuan이 Hy ASR 3.0 프리뷰를 출시했습니다. 이는 Hy3 언어 이해 능력을 기반으로 구축된 새로운 실시간 음성 인식 모델입니다.
이 모델은 자동 음성 인식(ASR)이 고립된 음향 디코딩을 넘어서도록 하는 것을 목표로 합니다.
기존 ASR 시스템은 주로 다음과 같은 질문에 답합니다:
이 오디오와 가장 잘 매칭되는 단어 시퀀스는 무엇인가?
Hy ASR 3.0은 두 번째 질문을 추가합니다:
맥락을 고려할 때, 어떤 전사(transcription)가 가장 의미 있는가?
이 차이는 오디오에 다음과 같은 상황이 포함될 때 중요합니다:
- 동음이의어
- 지역 억양
- 방언
- 중영 혼용 발화
- 제품명 및 인명
- 배경 소음
- 속삭임 또는 낮은 음량의 발화
- 긴 문장 또는 의미적 의존성이 강한 표현
Tencent는 이 모델이 고정밀 음향 시스템과 Hy3의 맥락 모델링 및 의미 추론 능력을 결합한다고 밝혔습니다. 목표는 사용자의 발화를 창의적으로 재작성하는 것이 아니라, 오디오 자체에 모호성이 있을 때 언어적 맥락을 활용하여 더 합리적인 전사 결과를 선택하는 것입니다.
Tencent는 공개 평가 세트 통합 결과 표준 중국어 단어 오류율 3.34%, 영어 2.62%, 광둥어 3.12% 를 보고했습니다.
Hy ASR 3.0 프리뷰는 현재 Tencent Cloud 실시간 WebSocket 엔진으로 문서가 제공되며, Tencent Yuanbao 어시스턴트에 통합되었습니다. WorkBuddy 및 기타 Tencent 제품에도 점진적으로 통합되고 있습니다.
공개 프리뷰는 사용 가능하지만, 더 넓은 릴리스 발표에서 설명된 최종 제품 형태에는 아직 도달하지 않았습니다. 현재 API 제한은 프로덕션 통합을 계획하는 팀에게 주목할 만한 사항입니다.
공개된 벤치마크 결과
Tencent는 여러 공개 음성 데이터 세트에서 Hy ASR 3.0 프리뷰를 평가하고 다른 ASR 시스템과 비교했습니다.
회사가 보고한 통합 단어 오류율은 다음과 같습니다:
| 언어 또는 언어 변형 | Hy ASR 3.0 프리뷰 WER |
|---|---|
| 표준 중국어 | 3.34% |
| 영어 | 2.62% |
| 광둥어 | 3.12% |
WER이 낮을수록 좋습니다.

차트 주석에 따르면 통합 평가에는 다음 데이터 세트가 사용되었습니다:
- WenetSpeechMeeting
- WenetSpeechNet
- FLEURS 중국어
- LibriSpeech clean
- LibriSpeech other
- FLEURS 영어
- MLS 영어
- FLEURS 광둥어
- Common Voice 광둥어
통합 데이터는 광범위한 비교에 유용하지만, 중요한 차이점을 가릴 수도 있습니다.
모델은 시나리오에 따라 성능이 다를 수 있습니다:
- 낭독 음성과 자발적 대화
- 근거리 마이크와 원거리 마이크
- 깨끗한 녹음실 오디오와 거리 소음
- 짧은 명령과 연속 토론
- 모국어 화자와 액센트가 있는 음성
- 공식 표준 중국어와 코드 스위칭
따라서 프로덕션 팀은 자체 오디오로 테스트해야 합니다.
단일 헤드라인 WER 수치만으로 ASR 모델을 선택해서는 안 됩니다.
단어 오류율이 측정하는 것
단어 오류율은 일반적으로 다음과 같이 정의됩니다:
WER = (대체 + 삭제 + 삽입) / 참조 단어 수
세 가지 오류 유형은 다음과 같습니다:
- 대체: 모델이 잘못된 단어를 출력함
- 삭제: 전사 텍스트에서 말한 단어가 누락됨
- 삽입: 전사 텍스트에 말하지 않은 단어가 포함됨
일반적으로 WER이 낮을수록 전사가 더 정확함을 의미합니다.
그러나 WER은 실제 시나리오의 모든 실패 사례를 포괄하지는 못합니다.
두 가지 단어 오류 사례를 고려해 봅시다:
"Ship the order tomorrow"
→ "Ship the order today"
그리고:
"The color is navy blue"
→ "The colour is navy blue"
둘 다 유사한 오류 수를 생성할 수 있지만, 첫 번째는 비즈니스 행동을 변경할 수 있는 반면 두 번째는 비즈니스에 아무런 영향을 미치지 않을 수 있습니다.
고객 서비스, 의료, 금융, 제조 및 명령 인터페이스와 같은 분야에서 팀은 의미적 영향과 WER을 함께 평가해야 합니다.
Tencent 내부 시나리오 평가
Tencent는 또한 네 가지 실제 범주를 포괄하는 내부 평가 세트 결과를 발표했습니다:
- 일반 음성 인식
- 방언 인식
- 맥락 이해
- 고소음 및 속삭임과 같은 복잡한 음향 조건
보고된 결과는 다음과 같습니다:
| 내부 평가 범주 | Hy ASR 3.0 프리뷰 WER |
|---|---|
| 일반 인식 | 4.95% |
| 방언 인식 | 9.31% |
| 맥락 평가 | 4.76% |
| 복잡한 음향 조건 | 6.36% |

Tencent는 Hy ASR 3.0 Preview가 네 가지 내부 범주 모두에서 비교 시스템 중 가장 낮은 WER을 달성했다고 밝혔습니다.
이러한 결과는 회사가 보고한 제품 증거로서 유용하지만, 내부 테스트 세트는 중립적인 공개 벤치마크가 아닙니다.
도입 전에 조직은 다음을 질문해야 합니다:
- 테스트에 포함된 억양 및 방언 지역은 무엇인가?
- 오디오의 소음 수준은 어떠한가?
- 구두점은 어떻게 정규화되었는가?
- 숫자와 영어 용어는 점수 계산 전에 표준화되었는가?
- 비교 시스템에 핫워드 또는 맥락이 구성되었는가?
- 얼마나 많은 발화 샘플이 사용되었는가?
- 테스트에 조직이 실제로 사용하는 마이크와 채널이 포함되었는가?
네 가지 사용자 중심 개선 사항
Tencent는 실제 개선 사항을 네 가지 영역으로 정리했습니다.
- 더 정확한 일반 인식
이 모델은 다음 시나리오의 인식 능력을 향상시키도록 설계되었습니다:
- 표준 중국어
- 영어
- 광둥어
- 지역 방언
- 중영 혼용 발화
- 다양한 화자 및 억양
Tencent는 또한 이 모델이 긴 발화에서 누적 오류를 줄인다고 밝혔습니다.
이 주장은 모델의 기본 능력을 설명합니다. 현재 Tencent Cloud Preview는 단일 공개 API 입력을 60초로 제한하므로, 회의나 녹음을 처리하는 애플리케이션은 현재 세그먼트로 나누어야 합니다.
오디오를 분할하고 세그먼트 전체의 맥락을 직접 관리해야 합니다.
잘못된 분할은 이 모델이 해결하려는 문제를 다시 도입할 수 있습니다.
예를 들어, 임의의 60초 경계에서 오디오를 절단하면 다음이 끊길 수 있습니다:
- 전체 이름
- 제품 코드
- 의미가 지연되는 문장
- 중영 혼합 구문
- 화자의 자기 수정
따라서 분할 로직은 가능한 한 문장 경계와 발화 활동 경계를 보존해야 합니다.
- 더 나은 컨텍스트 및 의도 인식
음성에는 많은 모호한 소리가 포함되어 있습니다.
중국어에는 동음이의어가 많습니다. 영어에는 발음이 유사한 단어와 이름이 있습니다. 방언 발음으로 인해 여러 후보 전사 텍스트가 음향적으로 모두 그럴듯하게 보일 수 있습니다.
기존 디코더는 국소적으로 확률이 가장 높은 단어를 선택할 수 있습니다.
컨텍스트 인식 기능을 갖춘 시스템은 전체 발화를 평가할 수 있습니다.
예를 들어, 사용자가 두 개의 서로 다른 동음이의어로 전사될 수 있는 문구를 말할 수 있습니다. 주변에 금융, 게임, 의료 또는 여행과 관련된 주제어가 있으면 어떤 의미가 더 가능성이 높은지 힌트를 줄 수 있습니다.
예상되는 처리 흐름은 다음과 같이 단순화할 수 있습니다:
오디오 특징
→ 후보 단어
→ 문장 컨텍스트
→ 의미 일관성 검사
→ 최종 전사 텍스트
이는 모델이 인간과 동일한 방식으로 음성을 진정으로 이해할 수 있다는 것을 의미하지는 않습니다.
오히려 언어 구성 요소가 더 넓은 컨텍스트 창과 의미 확률을 활용하여 전사 결정을 개선한다는 의미입니다.
컨텍스트 인식 ASR 시스템은 또한 새로운 위험을 가져옵니다: 의미적 과잉 수정.
모델은 때때로 흔하지 않지만 발음이 정확한 문구를 겉보기에 더 자연스러운 흔한 문구로 대체할 수 있습니다.
따라서 프로덕션 환경 평가에는 다음이 포함되어야 합니다:
- 희귀한 사람 이름.
- 의도적으로 특이한 표현.
- 신제품 용어.
- 도메인 약어.
- 모순되거나 예상치 못한 문장.
목표는 컨텍스트를 활용하되 음성에 존재하지 않았던 내용을凭空으로 만들어 내지 않는 것입니다.
- 전문 용어에 더 쉽게 적응
출시 자료에서는 핫워드 강화가 다음에 적용된다고 강조합니다:
- 브랜드 이름.
- 제품 이름.
- 사람 이름.
- 업계 용어.
- 약어.
- 내부 용어.
일반 모델이 특정 희귀 단어의 출현 빈도를 충분히 학습하지 못한 경우, 핫워드는 중요한 가치를 제공할 수 있습니다.
예시는 다음과 같습니다:
전문 의약품 이름
공장 기계 모델 번호
고객 계정 코드
새로 출시된 브랜드
기술 약어
텐센트 클라우드 일반 ASR 제품에는 이미 핫워드 목록 API와 hotword_id 매개변수가 있습니다.
그러나 현재 Hy ASR 3.0 미리보기 버전 문서에는 핫워드 강화가 이 미리보기 엔진에는 아직 제공되지 않는다고 명시되어 있습니다.
따라서 공개 제품 홍보와 실제 접근 가능한 API 상태를 구분해야 합니다:
| 기능 | 모델 출시 설명 | 현재 미리보기 API 상태 |
|---|---|---|
| 핫워드 강화 | 지원되는 기능으로 설명됨 | 곧 제공 예정으로 표시됨 |
| 컨텍스트 입력 | 주요 기능으로 설명됨 | 곧 제공 예정으로 표시됨 |
| 내부 컨텍스트 언어 모델링 | 핵심 모델 특성 | 모델 동작을 통해 사용 가능 |
텐센트 클라우드가 공식 API 문서에서 지원을 확인하기 전까지, 기업은 외부 컨텍스트 주입이나 핫워드 목록에 의존하는 출시 계획을 수립해서는 안 됩니다.
- 어려운 음향 조건에서 더 안정적인 인식
텐센트는 이 모델이 다음 상황에 맞게 최적화되었다고 밝혔습니다:
- 높은 배경 소음.
- 속삭임.
- 작은 목소리로 말하기.
- 다양한 녹음 환경.
- 여러 억양.
- 긴 꼬리 음향 조건.
소음 견고성은 중요합니다. 실제 음성은 깨끗한 실험실 녹음처럼 나오는 경우가 거의 없기 때문입니다.
고객 서비스 마이크는 키보드 소리와 옆 동료의 목소리를 포착할 수 있습니다.
모바일 어시스턴트는 교통 소음, 바람 소리, 음악 소리 또는 다른 사람의 말소리를 들을 수 있습니다.
회의 애플리케이션은 멀리 떨어진 노트북 마이크에서 압축된 오디오를 수신할 수 있습니다.
모델은 견고성을 향상시킬 수 있지만, 캡처되지 않은 정보를 복원할 수는 없습니다.
팀은 여전히 다음을 사용해야 합니다:
- 적절한 마이크.
- 반향 제거.
- 게인 제어.
- 지원되는 경우 음성 활동 감지.
- 합리적인 오디오 압축.
- 채널 모니터링.
- 재시도 또는 명확화 절차.
ASR 품질은 모델 속성일 뿐만 아니라 시스템 속성입니다.
아키텍처: Hy3 + 음성 인코더
텐센트는 Huyuan Hy ASR 3.0 Preview가 세 가지 주요 구성 요소를 결합한다고 밝혔습니다:
- Hy3 기반 MoE 언어 모델 베이스.
- 자체 개발한 비지도 음성 인코더.
- 공동 사전 학습 및 다단계 사후 학습.

Hy3를 언어 베이스로
Hy3는 언어 이해 구성 요소를 제공합니다.
그 역할은 다음과 같습니다:
- 문장 컨텍스트 모델링.
- 모호한 후보 항목 해석.
- 혼합 언어 구조 이해.
- 의미 관계 활용.
- 출력 일관성 향상.
텐센트는 이 아키텍처를 성능과 효율성의 균형을 맞추는 전문가 혼합(MoE) 설계로 설명합니다.
공개 ASR 문서에는 Hy ASR 3.0 Preview의 전체 매개변수 수, 활성 매개변수 수, 지연 시간 프로필 또는 전체 추론 아키텍처가 공개되지 않았습니다.
비지도 음성 인코더
음성 인코더는 원시 오디오를 언어 모델이 처리할 수 있는 음향 표현으로 변환합니다.
텐센트는 이 인코더가 수천만 시간의 레이블 없는 음성으로 학습되었다고 밝혔습니다.
비지도 또는 자기 지도 오디오 학습은 가치가 있습니다. 이 규모의 음성 데이터를 수동으로 전사하는 것은 비용이 엄청나게 높기 때문입니다.
인코더는 원시 오디오에서 반복적으로 나타나는 구조를 학습할 수 있습니다. 예를 들어:
- 음성 패턴.
- 화자 차이.
- 억양 차이.
- 배경 조건.
- 타이밍 및 운율.
이 표현의 품질은 이후의 모든 단계에 영향을 미칩니다.
인코더 단계에서 두 음성이 혼동되면 언어 모델은 올바른 단어를 복원하기 위해 컨텍스트에 더 많이 의존해야 합니다.
음성과 언어의 공동 사전 학습
텐센트는 음성 인코더와 언어 모델이 다음을 포함하는 대규모 다중 소스 음성 데이터 세트로 공동 학습되었다고 밝혔습니다:
- 방언.
- 억양.
- 음향 환경.
- 다양한 화자 그룹.
- 컨텍스트 언어 패턴.
- 공동
훈련은 음향 인식과 언어 이해 사이의 격차를 줄이는 것을 목표로 합니다.
음성 인식을 다음과 같이 보는 대신:
오디오 모델 완료
→ 언어 모델이 이후에 전사 텍스트 정리
Hy ASR 3.0은 더 통합된 프로세스로 제시됩니다:
음성 표현과 언어 모델링
→ 훈련이 협력적으로 작동
→ 컨텍스트화된 전사 결과 출력
인코더, 디코더, 언어 모델 및 강화 학습 단계 사이의 정확한 내부 경계는 완전히 공개되지 않았습니다.
## SFT 및 다단계 강화 학습
텐센트는 다음을 포함하는 지도 미세 조정 방식을 설명합니다:
- 일반 전사.
- 임의 컨텍스트 작업.
- 전문 용어.
- 다양한 음향 환경.
- 다양한 화자 그룹.
- 10대 방언 권역.
- 20개 이상의 소규모 방언 영역.
또한 이 회사는 다단계 강화 학습을 사용했다고 보고했습니다:
- 일반 전사 정확도.
- 컨텍스트 동작.
- 복잡한 긴 꼬리 사례.
- 대체 및 삭제 오류 감소.
현재 전체 보상 설계, 데이터 배합, 훈련 연산량 또는 절제 실험 결과를 제공하는 공개 기술 논문은 없습니다.
따라서 아키텍처 주장은 재현 가능한 연구 사양이 아닌 제품 수준의 기술 설명으로 간주되어야 합니다.
## 현재 텐센트 클라우드 엔진이 지원하는 언어 및 방언
텐센트 클라우드 문서는 현재 `Hy-ASR-3.0-preview` 엔진이 다음을 지원한다고 설명합니다:
- 표준 중국어.
- 영어.
- 20가지 중국어 방언 또는 지역 변이체.
문서에 나열된 방언 목록은 다음과 같습니다:
| 번호 | 방언 또는 지역 변이체 |
|-|-|
| 1 | 광둥어 |
| 2 | 둥베이어 |
| 3 | 허난어 |
| 4 | 산시 방언 |
| 5 | 청두어 |
| 6 | 충칭어 |
| 7 | 우한어 |
| 8 | 구이양어 |
| 9 | 칭다오어 |
| 10 | 지난어 |
| 11 | 창사어 |
| 12 | 허페이어 |
| 13 | 허베이 방언 |
| 14 | 쿤밍어 |
| 15 | 란저우어 |
| 16 | 인촨어 |
| 17 | 난창어 |
| 18 | 베이징어 |
| 19 | 쓰촨어 |
| 20 | 톈진어 |
상용 ASR 문서의 방언 라벨은 광범위한 제품 범주입니다.
각 범주 내의 실제 음성은 도시, 연령, 사회적 배경, 코드 스위칭, 어휘, 화자에 따라 달라집니다.
특정 방언을 지원한다는 것은 해당 지역의 모든 화자에게 동일한 정확도를 보장한다는 의미로 이해되어서는 안 됩니다.
## 현재 프리뷰 버전 사용 가능 여부
텐센트 클라우드는 **2026년 8월 4일**에 Hy ASR 3.0 프리뷰 버전 엔진을 실시간 WebSocket 제품에 추가했습니다.
이 공공 서비스는 현재 내부 테스트 또는 프리뷰 버전으로 설명됩니다.
| 항목 | 현재 문서화된 상태 |
|-|-|
| 제품 유형 | 실시간 음성 인식 |
| 접속 방식 | 텐센트 클라우드 WebSocket API |
| 엔진 이름 | `Hy-ASR-3.0-preview` |
| 오디오 길이 | 입력당 60초 이하 |
| 오디오 형식 | 16kHz 모노 PCM |
| 포함 동시 접속 | 20채널 동시 접속 |
| 표준 중국어 | 지원 |
| 영어 | 지원 |
| 20개 방언 | 지원 |
| 화자 분리 | 프리뷰 버전에서 미지원 |
| VAD 파라미터 지원 | 프리뷰 버전에서 미지원으로 기재 |
| 단어 대체 | 프리뷰 버전에서 미지원 |
노이즈 임계값 파라미터 | 프리뷰 버전에서 미지원 |
| 외부 컨텍스트 입력 | 곧 출시 예정 |
| 웨이크 워드 강화 | 곧 출시 예정 |
일반 WebSocket API 참조에는 VAD 및 웨이크 워드 ID를 포함한 다른 엔진들이 사용하는 파라미터가 포함되어 있습니다.
Hy ASR 3.0은 엔진 전용 프리뷰 버전 설명을 우선합니다.
공유 API 모드에 나타나는 파라미터가 프리뷰 버전 엔진에서 현재 구현되어 있음을 보장하지는 않습니다.
## 텐센트 클라우드 통합 기본 프로세스
공식 설정은 세 가지 주요 단계로 구성됩니다.
## 1단계: 텐센트 클라우드 음성 인식 서비스 활성화
텐센트 클라우드 음성 인식 서비스를 열고 계정 활성화 절차를 완료합니다.
공식 빠른 시작 문서는 다음 위치에 있습니다:
```Plaintext
https://cloud.tencent.com/document/product/1093/54362
후불 과금을 활성화하기 전에 먼저 과금 안내를 확인하시기 바랍니다.
텐센트 클라우드는 신규 계정의 경우 후불 과금이 기본적으로 비활성화되어 있으며 수동으로 활성화해야 한다고 밝히고 있습니다.
2단계: API 자격 증명 생성
다음을 생성 또는 획득합니다:
AppIDSecretIDSecretKey
이 자격 증명은 WebSocket 연결 요청에 서명하는 데 사용됩니다.
키 관리자 또는 보호된 환경 변수에 저장하시기 바랍니다.
장기 유효 자격 증명을 다음 위치에 두지 마십시오:
- 프런트엔드 JavaScript 코드
- 모바일 앱 소스 코드
- 공개 코드 저장소
- 공유 문서
- 클라이언트에 노출되는 URL
브라우저 또는 모바일 제품의 경우 신뢰할 수 있는 백엔드에서 서명된 연결 정보를 생성하시기 바랍니다.
3단계: 실시간 WebSocket 엔드포인트 연결
텐센트 클라우드 문서에 기록된 엔드포인트 형식은 다음과 같습니다:
wss://asr.cloud.tencent.com/asr/v2/?{request_parameters}
``를 텐센트 클라우드 AppID로 교체합니다.
요청에는 다음과 같은 서명 파라미터가 포함됩니다:
secretidtimestampexpirednoncevoice_idengine_model_type
Hy ASR 3.0 프리뷰 버전의 경우 다음을 설정합니다:
engine_model_type=Hy-ASR-3.0-preview
각 WebSocket 연결에는 고유한 voice_id가 필요합니다.
연결이 종료되거나 실패하면 기존 voice_id는 무효화되며 새 voice_id를 생성해야 합니다.
4단계: 호환 가능한 오디오 준비
현재 프리뷰 버전의 요구 사항:
샘플링 레이트: 16kHz
채널: 모노
형식: PCM
최대 입력 길이: 60초
원본 파일뿐만 아니라 전체 오디오 체인을 테스트하시기 바랍니다.
마이크 SDK, 브라우저 미디어 API, 전화 시스템, 회의 플랫폼은 오디오가 서버에 도달하기 전에 리샘플링 또는 압축할 수 있습니다.
5단계: 오디오 스트리밍 및 증분 결과 읽기
이 서비스는 오디오 전송 중에 텍스트를 반환하는 실시간 전사를 지원합니다.
애플리케이션은 다음을 처리해야 합니다:
- 부분 결과
- 최종 결과
- 연결 오류
- 인증 실패
- 타임아웃
- 재연결
- 오디오 길이 제한
- 중복 또는 수정된 텍스트
각 부분 인식 결과가 최종 결과라고 가정하지 마십시오.
실시간 ASR 인터페이스는 더 많은 컨텍스트를 확보한 후 이전 단어나 문장을 수정할 수 있습니다.
사용자 인터페이스는 임시 텍스트와 확정 텍스트를 구분해야 합니다.
6단계: 출시 전 테스트
다음을 포함하는 대표적인 평가 세트를 구축합니다:
- 실제 고객 오디오
- 일반적인 억양
- 방언
- 중영 혼용
- 인명 및 제품 용어
노이즈.
- 낮은 목소리.
- 낮은 품질의 마이크.
- 짧은 명령.
- 완전한 문장.
인식 품질과 시스템 동작을 동시에 측정합니다.
프리뷰 엔진 가격
텐센트 클라우드는 Hy ASR 3.0 프리뷰 버전을 대모델 2.0 실시간 음성 인식 엔진으로 분류합니다.
현재 과금 페이지에는 다음이 기재되어 있습니다:
| 과금 옵션 | 현재 표시 가격 |
|---|---|
| 선불 60시간 패키지 | 총 60위안, 즉 1.00위안/시간 |
| 선불 1,000시간 패키지 | 총 950위안, 즉 0.95위안/시간 |
| 선불 10,000시간 패키지 | 총 9,000위안, 즉 0.90위안/시간 |
| 선불 100,000시간 패키지 | 총 88,000위안, 즉 0.88위안/시간 |
| 선불 300,000시간 패키지 | 총 255,000위안, 즉 0.85위안/시간 |
| 후불 | 1.00위안/시간, 일 단위 결제 |
텐센트의 현재 과금표에 따르면 대모델 2.0 인식에는 무료 오디오 할당량이 없습니다.
포함된 20채널 동시 접속은 동시 접속 할당량이지 무료 인식 시간이 아닙니다.
가격은 변동될 수 있습니다. 상업적 견적을 발행하거나 장기 예산을 추정하기 전에 실시간 과금 페이지를 확인하시기 바랍니다.
비용 예시
현재 표시 가격 기준 후불 1.00위안/시간으로 계산:
100시간 성공 인식
× 1.00위안/시간
= 100위안
프로덕션 예산에는 다음도 포함되어야 합니다:
- 오디오 전처리.
- 네트워크 전송.
- 백엔드 서버.
- 저장.
- 모니터링.
- 수동 수정.
- 재시도 트래픽.
- 다운스트림 언어 모델 처리.
ASR 비용은 전체 전사 시스템의 일부일 뿐입니다.
위안바오 및 제품 통합
텐센트는 위안바오가 이 모델 개발에 참여했으며 이 모델을 통합한 최초의 텐센트 제품이라고 밝혔습니다.
사용자는 위안바오의 음성 입력을 통해 이 기능을 체험할 수 있으며, 이 모델은 다음을 개선하도록 설계되었습니다:
- 방언 인식.
- 컨텍스트 오류 수정.
- 어려운 음향 조건에서의 인식.
텐센트는 WorkBuddy 등 다른 제품도 점진적으로 통합하고 있다고 밝혔습니다.
소비자 제품의 통합 방식은 텐센트 클라우드 프리뷰 버전 공개 API와 다를 수 있습니다.
예를 들어, 위안바오는 내부 서비스, 제품별 컨텍스트, 또는 아직 외부 개발자에게 공개되지 않은 배포 구성을 사용할 수 있습니다.
위안바오의 경험이 공개 API 파라미터와 일대일로 대응한다고 가정해서는 안 됩니다.
적용 시나리오
Hy ASR 3.0 프리뷰 버전은 짧은 시간, 낮은 지연 시간의 음성 상호작용에 적합합니다.
지능형 고객 서비스
잠재적 용도:
- 상담원 실시간 전사.
- 음성 봇 명령 인식.
- 통화 회의록 생성.
- 의도 추출.
- 품질 검사 보조.
프리뷰 버전은 현재 화자 분리 기능이 부족하여, 별도의 채널 또는 화자 분리 구성 요소가 없는 한 다자 통화 전사가 제한될 수 있습니다.
실시간 자막
이 엔진은 다음 시나리오의 짧은 실시간 자막을 지원할 수 있습니다:
- 라이브 비디오.
- 오디오 룸.
- 내부 회의.
- 음성 메시지.
- 접근성 인터페이스.
애플리케이션은 부분 결과 안정성과 구두점 동작을 테스트해야 합니다.
음성 검색
컨텍스트 인식 인식은 다음을 포함하는 검색을 개선할 수 있습니다:
- 긴 문장의 자연어 질문.
- 제품 이름.
- 중영 혼용 발화.
- 지역별 발음.
프리뷰 버전에서 핫워드 주입이 열리기 전까지는 희귀
용어는 여전히 후처리 또는 별도의 오류 수정 계층이 필요할 수 있습니다.
음성 명령 및 어시스턴트
엔진은 음성 명령을 텍스트로 변환하여 다음에 사용할 수 있습니다:
- AI 어시스턴트.
- 엔터프라이즈 에이전트.
지능형 기기 제어.
- 워크플로 명령.
명령 시스템은 단지 어떤 전사 결과의 신뢰도가 높아 보인다는 이유만으로 고영향 작업을 실행해서는 안 된다.
파괴적이거나 금전적인 작업의 경우, 파싱된 의도를 확인하고 사용자의 명시적 승인을 요구해야 한다.
내용 이해
짧은 오디오 클립은 다음 흐름에 투입되기 전에 전사할 수 있다:
- 요약 생성.
- 분류.
- 검색 색인.
- 콘텐츠 검토.
- 지식 추출.
다운스트림의 각 AI 처리 단계 품질은 전사 결과에 달려 있다.
정책이 허용하는 경우, 원본 오디오 또는 신뢰도 증거를 저장하여 불확실한 출력을 검토할 수 있게 한다.
현재 한계
미리보기 상태
이 제품은 여전히 미리보기 또는 내부 베타 버전으로 표시되어 있다.
인터페이스, 가격, 제한 사항 및 지원 기능은 변경될 수 있다.
60초 입력 제한
현재 공개 API는 긴 녹음의 배치 전사를 직접 대체할 수 없다.
긴 오디오는 분할 처리가 필요하며, 애플리케이션 수준의 컨텍스트 레이어가 필요할 수 있다.
PCM 입력만 지원
미리보기 버전은 현재 16kHz 모노 PCM을 요구한다.
많은 프로덕션 환경에서 MP3, AAC, Opus 또는 전화 코덱을 사용하므로 변환이 필요하다.
화자 분리 미지원
현재 엔진 전용 문서에는 화자 분리를 지원하지 않는다고 명시되어 있다.
다중 화자 전사는 별도의 오디오 채널이나 다른 화자 분리 서비스가 필요할 수 있다.
컨텍스트 및 핫워드 기능 아직 공개되지 않음
공식 문서에 따르면, 발표된 기능은 아직 사용 가능한 미리보기 API 기능으로 공개되지 않았다.
회사가 보고한 벤치마크 데이터
벤치마크 차트는 텐센트에서 제공되었다.
일치된 조건에서의 독립적 평가는 비교의 신뢰성을 높일 것이다.
완전한 기술 논문 없음
텐센트는 Hy ASR 3.0 미리보기 버전의 아키텍처와 훈련 과정에 대해 높은 수준의 설명을 제공했지만, 완전히 재현 가능한 세부 사항은 아직 공개하지 않았다.
컨텍스트로 인한 과잉 보정 가능성
언어 인식 디코더는 흔하지 않지만 실제로 정확하게 말한 내용을 무시하고 흔한 문장을 선호할 수 있다.
테스트에는 희귀하고 예상치 못한 문구가 반드시 포함되어야 한다.
실용 평가 체크리스트
- 도메인 테스트셋 구축
소수의 깨끗한 데모 샘플이 아닌, 최소 수백 개의 대표적인 발화를 포함해야 한다.
- 원본 참조 텍스트 유지
명확한 정규화 전략을 사용하여 인간이 검증한 참조 전사를 생성한다.
다음 사항을 어떻게 처리할지 결정한다:
- 구두점.
- 숫자.
- 영어 대소문자.
- 채움말.
- 반복 내용.
- 번체 중국어 및 간체 중국어.
- 여러 지표 측정
다음을 사용한다:
- 단어 오류율 또는 문자 오류율.
- 이름 정확도.
- 숫자 정확도.
- 의미 오류율.
- 지연 시간.
- 부분 결과 수정률.
- 실패율.
- 방언을 별도로 테스트
모든 방언 사용자를 하나의 평균으로 합치지 않는다.
지역 및 녹음 조건별로 결과를 나누어 보고한다.
- 컨텍스트 모호성 테스트
음향적으로 유사하지만 문장 컨텍스트가 올바른 전사 결과를 바꾸는 쌍 샘플을 생성한다.
- 희귀 용어 테스트
제품 이름과
지금은 용어를 먼저 처리하고, 텐센트가 핫워드 지원을 개방한 후 반복 테스트한다.
- 소음 및 속삭임 시나리오 테스트
디지털 방식으로 단순히 중첩된 소음이 아닌 실제 환경 녹음을 사용한다.
- 분할 경계 테스트
60초 분할 구현이 중요한 문장을 끊지 않고 중복 텍스트를 생성하지 않는지 확인한다.
- 엔드투엔드 지연 시간 측정
다음 단계를 포함한다:
수집
+ 업로드
+ 인식
+ 결과 확정
+ 다운스트림 처리
- 개인정보 및 규정 준수 요구사항 검토
음성 녹음에는 개인 또는 민감한 정보가 포함될 수 있다.
배포 전에 데이터 보존, 접근 권한, 암호화, 사용자 동의 및 삭제 정책을 명확히 해야 한다.
Hy ASR 3.0 미리보기 버전과 기존 ASR 파이프라인 비교
| 영역 | 기존 파이프라인 | Hy ASR 3.0 방향 |
|---|---|---|
| 주요 관심사 | 음향에서 텍스트로의 정확도 | 음향 인식 + 컨텍스트 언어 모델링 |
| 혼동되기 쉬운 동음이의어 | 주로 국소 확률 판단에 의존 | 더 넓은 문장 컨텍스트 사용 |
| 방언 | 독립 모델 또는 제한적 커버리지 | 20개 방언을 지원하는 단일 문서화 혼합 엔진 |
| 전문 용어 | 외부 핫워드 또는 맞춤 모델 | 핫워드 기능 발표됨, 미리보기 지원은 추후 개방 예정 |
| 복잡한 음성 | 음향 모델 + 후처리 | 음성-언어 공동 훈련 + 사후 훈련 |
| 출력 | 전사 텍스트 | 더 일관된 컨텍스트의 전사 텍스트 |
| 주요 위험 | 음향 대체 및 누락 | 음향 오류 + 가능한 의미적 과잉 보정 |
새로운 접근 방식은 기존 ASR 엔지니어링의 필요성을 없애지 않는다.
동일한 엔드투엔드 시스템에 더 강력한 언어 레이어를 추가하는 것이다.
자주 묻는 질문
Hy ASR 3.0 미리보기 버전이란 무엇인가?
Hy ASR 3.0 미리보기 버전은 텐센트 혼위안이 Hy3 언어 기반과 자체 개발 음성 인코더를 기반으로 출시한 실시간 음성 인식 모델이다. 설계 목표는 음향 인식과 컨텍스트 언어 이해를 결합하는 것이다.
Hy ASR 3.0은 어떤 언어와 방언을 지원하는가?
텐센트 클라우드 문서에 따르면 중국어 표준어, 영어 및 광둥어, 둥베이화, 허난화, 산시화, 청두화, 충칭화, 우한화 등 20개 중국어 방언 또는 지역 변형을 지원한다. 화자와 지역에 따라 정확도가 다를 수 있다.
공개된 WER(단어 오류율)은 얼마인가?
텐센트는 공개 벤치마크를 집계한 WER 결과를 발표했다: 표준어 3.34%, 영어 2.62%, 광둥어 3.12%. 이는 회사가 여러 데이터셋을 종합하여 보고한 결과이며, 독립적으로 재현된 통일 테스트 결과는 아니다.
Hy ASR 3.0으로 긴 녹음을 전사할 수 있는가?
현재 공개 미리보기 버전은 입력당 최대 60초 오디오를 허용한다. 더 긴 녹음은 분할 처리가 필요하며, 애플리케이션은 각 분할 사이에 효과적인 컨텍스트를 유지해야 한다.
현재 API가 핫워드와 맞춤 컨텍스트를 지원하는가?
2026년 8월 4일자 텐센트 클라우드 미리보기 문서에 따르면, 현재는 지원되지 않는다. 발표 자료에는 이러한 기능이 설명되어 있지만, 공식 API 페이지에는 컨텍스트 입력 및 핫워드 강화 기능이 추후 개방될 것이라고 명시되어 있다.
어떤 오디오 형식을 지원하는가?
현재 Hy ASR 3.0 미리보기 문서는 16kHz 모노 PCM 입력을 지정한다. MP3, AAC, Opus 또는 기타 형식을 사용하는 애플리케이션은 호출 전에 오디오 변환을 수행해야 한다.
이 엔진으로 전송한다.
개발자는 Hy ASR 3.0을 어떻게 호출하는가?
개발자는 텐센트 클라우드의 실시간 음성 인식 WebSocket API를 사용하고 engine_model_type을 Hy-ASR-3.0-preview로 설정한다. 연결은 텐센트 클라우드 자격 증명으로 서명해야 한다.
Hy ASR 3.0은 무료인가?
텐센트 클라우드의 현재 요금 페이지에는 대형 모델 2.0 인식에 대한 무료 오디오 할당량이 나열되어 있지 않다. 페이지에는 선불 패키지가 60시간 기준 시간당 1위안, 후불도 시간당 1위안이며 20회 동시 연결이 포함된다고 표시되어 있다.
관련 도구
- 텐센트 클라우드 혼위안 ASR 미리보기: Hy ASR 3.0 미리보기 버전의 공식 기능, 제한 사항, 방언 및 빠른 연동 문서.
- 텐센트 클라우드 실시간 ASR WebSocket API: 공식 엔드포인트, 인증 파라미터, 엔진 선택 및 응답 문서.
- 텐센트 클라우드 API Explorer: 텐센트 공식 API 확인 및 SDK 요청 예시 생성 도구.
- 텐센트 클라우드 Python SDK: 텐센트 클라우드 API 및 자격 증명 관리를 위한 공식 Python SDK.
- FFmpeg: 입력 오디오를 호환 가능한 샘플링 레이트와 채널 레이아웃으로 변환하는 데 사용할 수 있는 오픈소스 오디오/비디오 툴킷.
- Websocat: 개발 중 스트리밍 엔드포인트 테스트에 적합한 커맨드라인 WebSocket 클라이언트.
관련 링크
com/document/product/1093/135476): 현재 공식 상태, 지원되는 방언, 제한 사항 및 기본 설정.
- 실시간 음성 인식 API: WebSocket 엔드포인트 형식 및 요청 파라미터 참조.
- 1분 서버 API 빠른 시작:腾讯云 공식 서비스 활성화 및 자격 증명 가이드.
- 腾讯云 ASR 요금: 현재 선불, 후불, 동시성 및 무료 할당량 정보.
- 腾讯云 ASR 제품 업데이트: 공식 릴리스 로그로, Hy ASR 3.0 미리보기 엔진이 2026년 8월 4일에 추가되었음을 표시.
- 腾讯云 핫워드 API: 공식 일반 ASR 핫워드 목록 API, Hy ASR 3.0 미리보기 버전 지원은 아직 '출시 예정'으로 표시됨.
- 腾讯混元: 공식 혼위안 모델 및 제품 포털.
요약
腾讯混元의 Hy ASR 3.0 미리보기 버전은 음성 인코더와 Hy3의 언어 모델 기능을 결합하여 표준 중국어, 영어, 방언, 혼합 언어, 소음 환경 및 문맥 관련 전사 성능을 개선합니다.
腾讯은 집계된 공개 데이터 세트에서 표준 중국어 WER 3.34%, 영어 2.62%, 광둥어 3.12%를 보고했으며, 내부 시나리오 테스트에서도 선도적인 결과를 달성했다고 밝혔습니다. 이러한 수치는 기대를 갖게 하지만, 각 기관의 자체 오디오에서 검증이 필요합니다.
현재腾讯云 미리보기 버전은 전체 출시 비전보다 범위가 더 제한적입니다.
실시간 WebSocket 인식, 16kHz 모노 PCM, 최대 60초 오디오 입력을 지원합니다. 외부 컨텍스트 주입, 핫워드 강화, 화자 분리 및 기타 여러 기능은 이 엔진에서 아직 사용할 수 없습니다.
핵심 변화는 음성 인식이 더 이상 소리를 듣지 않는 것이 아니라, 언어 모델이 이제 소리가 가장 의미할 가능성이 높은 내용을 판단하는 데 도움을 준다는 점입니다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.



