腾讯混元发布了 Hy ASR 3.0 预览版,这是一款基于 Hy3 语言理解能力构建的新型实时语音识别模型。该模型旨在提升识别准确率,尤其适用于多种语言和方言场景,并充分利用上下文信息来增强语音识别的表现。

腾讯混元发布了 Hy ASR 3.0 预览版,这是一款基于 Hy3 语言理解能力构建的新型实时语音识别模型。
该模型旨在推动自动语音识别超越孤立的声学解码。
传统 ASR 系统主要回答这样一个问题:
哪一串词与这段音频最匹配?
Hy ASR 3.0 增加了第二个问题:
在上下文中,哪种转写最有意义?
当音频包含以下情况时,这一区别至关重要:
腾讯表示,该模型将高精度声学系统与 Hy3 的上下文建模和语义推理能力相结合。其目标不是创造性改写用户所说的内容,而是在音频本身存在歧义时,利用语言上下文选择更合理的转写结果。
腾讯报告称,在聚合公开评测集上,普通话词错误率为 3.34%,英语为 2.62%,粤语为 3.12%。
Hy ASR 3.0 预览版现已作为腾讯云实时 WebSocket 引擎提供文档支持,并已集成到腾讯元宝助手中。WorkBuddy 及其他腾讯产品正在逐步接入中。
公开预览版虽已可用,但尚未达到更广泛发布公告中所描述的最终产品形态。其当前的 API 限制对于计划进行生产集成的团队而言值得关注。
腾讯在多个公开语音数据集上对 Hy ASR 3.0 预览版进行了评估,并与其他 ASR 系统进行了比较。
该公司报告的聚合词错误率如下:
| 语言或语音变体 | Hy ASR 3.0 预览版 WER |
|---|---|
| 普通话 | 3.34% |
| 英语 | 2.62% |
| 粤语 | 3.12% |
WER 越低越好。

图表注释表明,聚合评估使用了以下数据集:
聚合数据有助于进行宽泛比较,但也可能掩盖重要的差异。
模型在不同场景下表现可能有所不同:
因此,生产团队应使用自己的音频进行测试。
而不是仅从单一标题的WER数字来选择ASR模型。
词错误率通常定义为:
WER =(替换 + 删除 + 插入)/ 参考词数
三种错误类型分别是:
较低的WER通常表示转写更准确。
然而,WER并不能覆盖所有实际场景中的失败情况。
考虑两个单字错误:
“Ship the order tomorrow”
→ “Ship the order today”
以及:
“The color is navy blue”
→ “The colour is navy blue”
两者可能产生相似的错误计数,但第一个可能改变业务行动,而第二个可能对业务没有任何影响。
对于客户服务、医疗健康、金融、制造和命令接口等领域,团队应同时评估语义影响和WER。
腾讯还公布了涵盖四个实际类别的内部评估集结果:
报告的结果如下:
| 内部评估类别 | Hy ASR 3.0 Preview WER |
|---|---|
| 通用识别 | 4.95% |
| 方言识别 | 9.31% |
| 上下文评估 | 4.76% |
| 复杂声学条件 | 6.36% |

腾讯表示,Hy ASR 3.0 Preview在所有四个内部类别的对比系统中均实现了最低的WER。
这些结果作为公司报告的产品证据是有用的,但内部测试集并不是中立的公共基准。
在采用之前,组织应该问:
腾讯将实际改进归纳为四个领域。
该模型旨在提升以下场景的识别能力:
腾讯还表示,该模型减少了较长话语中的累积错误。
这一说法描述了模型的底层能力。当前腾讯云Preview仍将单次公共API输入限制在60秒内,因此处理会议或录音的应用程序目前必须进行分段。
音频并自行管理跨片段上下文。
分段不佳可能重新引入该模型本应解决的问题。
例如,在任意60秒边界处切割音频可能会切断:
因此,分段逻辑应尽可能保留句子边界和语音活动边界。
语音中包含许多含混不清的声音。
普通话中有大量同音字。英语中有发音相似的单词和名字。方言发音可能使多个候选转写文本在声学上都看似合理。
传统解码器可能选择局部最大概率的词。
具备上下文感知能力的系统可以评估完整的话语。
例如,用户可能说出一个可被转写为两个不同同音字的短语。附近涉及金融、游戏、医疗或旅行的话题词可以提示哪种含义更有可能。
预期的处理流程可简化为:
音频特征
→ 候选词
→ 句子上下文
→ 语义一致性检查
→ 最终转写文本
这并不意味着模型能以与人类相同的方式真正理解语音。
而是指语言组件利用更宽的上下文窗口和语义概率来改进转写决策。
上下文感知的ASR系统也带来了新的风险:语义过度修正。
模型有时可能会将一个不常见但发音正确的短语替换为一个看似更通顺的常见短语。
因此,生产环境评估应包含:
目标是利用上下文而不凭空编造从未出现的语音内容。
发布材料中强调了热词增强,适用于:
当通用模型对某个罕见词的出现频率不够高时,热词可以发挥重要价值。
示例包括:
专有药品名称
工厂机器型号
客户账号代码
新推出的品牌
技术缩写
腾讯云通用ASR产品已有热词列表API和hotword_id参数。
然而,当前Hy ASR 3.0预览版文档明确说明热词增强尚未对该预览引擎开放。
因此,应将公开产品宣传与实际可访问的API状态区分开来:
| 能力 | 模型发布说明 | 当前预览API状态 |
|---|---|---|
| 热词增强 | 被描述为已支持的能力 | 列为即将推出 |
| 上下文输入 | 被描述为主要能力 | 列为即将推出 |
| 内部上下文语言建模 | 核心模型特性 | 通过模型行为可用 |
在腾讯云在正式API文档中确认支持之前,企业不应制定依赖外部上下文注入或热词列表的发布计划。
在困难声学条件下更稳定的识别
腾讯表示该模型针对以下情况进行了优化:
噪声鲁棒性很重要,因为真实的语音很少像干净的实验室录音那样出现。
客服麦克风可能捕捉到键盘声和旁边同事的声音。
移动助手可能听到交通噪声、风声、音乐声或他人说话声。
会议应用可能接收到来自远处笔记本电脑麦克风的压缩音频。
模型可以提高鲁棒性,但无法恢复从未被捕获的信息。
团队仍应使用:
ASR质量是一个系统属性,而不仅仅是模型属性。
腾讯表示,混元Hy ASR 3.0 Preview结合了三大组件:

Hy3提供语言理解组件。
其作用包括:
腾讯将该架构描述为一种平衡能力与效率的专家混合(MoE)设计。
公开的ASR文档未披露Hy ASR 3.0 Preview的完整参数量、激活参数量、延迟概况或完整推理架构。
语音编码器将原始音频转换为语言模型可以处理的声学表示。
腾讯表示,该编码器使用了数千万小时的未标注语音进行训练。
无监督或自监督音频训练很有价值,因为手动转写如此规模的语音数据成本高得令人望而却步。
编码器可以从原始音频中学习重复出现的结构,例如:
这种表示的质量会影响后续所有环节。
如果在编码器阶段两个声音被混淆,语言模型就必须更多地依赖上下文来恢复正确的词语。
腾讯表示,语音编码器和语言模型使用覆盖以下内容的大规模多源语音数据集进行了联合训练:
训练旨在缩小声学识别与语言理解之间的差距。
而不是将语音识别视为:
音频模型完成
→ 语言模型随后清理转录文本
Hy ASR 3.0 被呈现为一个更加集成的过程:
语音表示与语言建模
→ 训练协同工作
→ 输出一个上下文化的转录结果
编码器、解码器、语言模型和强化学习阶段之间的确切内部边界尚未完全公开。
## SFT 与多阶段强化学习
腾讯描述了一种监督微调方案,涵盖:
- 通用转录。
- 任意上下文任务。
- 专业术语。
- 不同声学环境。
- 多样化的说话人群。
- 十大方言区。
- 20多个较小的方言区域。
该公司还报告使用了多阶段强化学习,用于:
- 通用转录准确性。
- 上下文行为。
- 复杂的长尾案例。
- 减少替换和删除错误。
目前没有公开技术论文提供完整的奖励设计、数据配比、训练算力或消融实验结果。
因此,架构声明应被视为产品层面的技术描述,而非可复现的研究规范。
## 当前腾讯云引擎支持的语言和方言
腾讯云文档将当前的 `Hy-ASR-3.0-preview` 引擎描述为支持:
- 普通话。
- 英语。
- 20种中文方言或地域变体。
文档列出的方言列表如下:
| 序号 | 方言或地域变体 |
|-|-|
| 1 | 粤语 |
| 2 | 东北话 |
| 3 | 河南话 |
| 4 | 陕西方言 |
| 5 | 成都话 |
| 6 | 重庆话 |
| 7 | 武汉话 |
| 8 | 贵阳话 |
| 9 | 青岛话 |
| 10 | 济南话 |
| 11 | 长沙话 |
| 12 | 合肥话 |
| 13 | 河北方言 |
| 14 | 昆明话 |
| 15 | 兰州话 |
| 16 | 银川话 |
| 17 | 南昌话 |
| 18 | 北京话 |
| 19 | 四川话 |
| 20 | 天津话 |
商业ASR文档中的方言标签是宽泛的产品类别。
每一类中的真实语音会因城市、年龄、社会背景、语码转换、词汇和说话人而异。
声称支持某种方言不应被理解为对该地区每位说话人都具有相同的准确率。
## 当前预览版可用性
腾讯云于**2026年8月4日**将 Hy ASR 3.0 预览版引擎添加到实时 WebSocket 产品中。
该公共服务目前被描述为内部测试或预览版本。
| 项目 | 当前文档化状态 |
|-|-|
| 产品类型 | 实时语音识别 |
| 接入方式 | 腾讯云 WebSocket API |
| 引擎名称 | `Hy-ASR-3.0-preview` |
| 音频时长 | 每次输入不超过60秒 |
| 音频格式 | 16 kHz 单声道 PCM |
| 包含并发 | 20路并发 |
| 普通话 | 支持 |
| 英语 | 支持 |
| 20种方言 | 支持 |
| 说话人分离 | 预览版不支持 |
| VAD参数支持 | 预览版列为不支持 |
| 词语替换 | 预览版不支持 |
噪声阈值参数 | 预览版不支持 |
| 外部上下文输入 | 即将推出 |
| 唤醒词增强 | 即将推出 |
通用 WebSocket API 参考包含其他引擎使用的参数,包括 VAD 和唤醒词 ID。
Hy ASR 3.0 以引擎专属的预览版说明为准。
共享 API 模式中出现的参数并不保证预览版引擎当前已实现该参数。
## 腾讯云集成基本流程
官方设置分为三个主要阶段。
## 步骤 1:开通腾讯云语音识别服务
打开腾讯云语音识别服务并完成账户开通流程。
官方快速入门文档位于:
```Plaintext
https://cloud.tencent.com/document/product/1093/54362
在启用后付费计费前请先查看计费说明。
腾讯云指出,新账户默认禁用后付费计费,需要手动开启。
创建或获取:
AppIDSecretIDSecretKey这些凭证用于对 WebSocket 连接请求进行签名。
请将其存储在密钥管理器或受保护的环境变量中。
请勿将长期有效的凭证放置在:
对于浏览器或移动端产品,请在可信的后端创建签名后的连接信息。
腾讯云文档中记录的端点格式为:
wss://asr.cloud.tencent.com/asr/v2/?{request_parameters}
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
将 `` 替换为腾讯云 AppID。
请求包含签名参数,例如:
secretidtimestampexpirednoncevoice_idengine_model_type对于 Hy ASR 3.0 预览版,请设置:
engine_model_type=Hy-ASR-3.0-preview
每个 WebSocket 连接需要唯一的 voice_id。
如果连接结束或失败,旧的 voice_id 将失效,需要生成新的 voice_id。
当前预览版要求:
采样率:16 kHz
声道:单声道
格式:PCM
最大输入时长:60 秒
请测试完整的音频链路,而不仅仅是原始文件。
麦克风 SDK、浏览器媒体 API、电话系统和会议平台可能会在音频到达服务器之前对其进行重采样或压缩。
该服务支持实时转写,在音频传输过程中即可返回文本。
应用程序应处理:
不要假设每个部分识别结果都是最终结果。
实时 ASR 接口可能会在获得更多上下文后修订之前的词句。
用户界面应区分临时文本和已确认文本。
构建具有代表性的评估集,包含:
噪音。
同时衡量识别质量和系统行为。
腾讯云将 Hy ASR 3.0 预览版归类为大模型 2.0 实时语音识别引擎。
当前计费页面列出:
| 计费选项 | 当前标价 |
|---|---|
| 预付费 60 小时套餐 | 总计 60 元,即 1.00 元/小时 |
| 预付费 1,000 小时套餐 | 总计 950 元,即 0.95 元/小时 |
| 预付费 10,000 小时套餐 | 总计 9,000 元,即 0.90 元/小时 |
| 预付费 100,000 小时套餐 | 总计 88,000 元,即 0.88 元/小时 |
| 预付费 300,000 小时套餐 | 总计 255,000 元,即 0.85 元/小时 |
| 后付费 | 1.00 元/小时,按日结算 |
腾讯当前的计费表显示,大模型 2.0 识别没有免费音频额度。
包含的 20 路并发是并发配额,而非免费识别时长。
价格可能变动。在发布商业报价或估算长期预算前,请查看实时计费页面。
按当前标价的后付费 1.00 元/小时计算:
100 小时成功识别
× 1.00 元/小时
= 100 元
生产预算还应包括:
ASR 费用只是完整转写系统的一部分。
腾讯表示,元宝参与了该模型的开发,并且是首个集成该模型的腾讯产品。
用户可以通过元宝中的语音输入体验该功能,该模型旨在改进:
腾讯表示,WorkBuddy 等其他产品正在逐步接入。
消费级产品的集成方式可能与腾讯云预览版公开 API 有所不同。
例如,元宝可能使用内部服务、产品特定上下文或尚未向外部开发者开放的部署配置。
不应假设元宝中的体验与公开 API 参数一一对应。
Hy ASR 3.0 预览版定位于短时、低延迟的语音交互。
潜在用途包括:
预览版目前缺乏说话人分离功能,这可能会限制多方通话的转写,除非有其他组件进行声道或说话人分离。
该引擎可支持以下场景的短时实时字幕:
应用应测试部分结果稳定性和标点行为。
上下文感知识别可改善涉及以下内容的搜索:
在预览版开放热词注入之前,罕见
目录术语可能仍需要后处理或单独的错误修正层。
引擎可以将口语指令转换为文本,用于:
命令系统绝不应仅仅因为某个转写结果看起来置信度很高就执行高影响操作。
对于破坏性或财务类操作,应确认解析出的意图并要求用户明确批准。
短音频片段可以在送入以下流程之前进行转写:
下游每一步AI处理的质量都取决于转写结果。
在政策允许的情况下,存储原始音频或置信度证据,以便不确定的输出可以被审查。
该产品仍标记为预览版或内部测试版。
界面、定价、限制和支持的功能可能发生变化。
当前公共API不能直接替代长录音的批量转写。
长音频需要分段处理,并可能需要应用层面的上下文层。
预览版目前要求16 kHz单声道PCM。
许多生产环境使用MP3、AAC、Opus或电话编解码器,需要进行转换。
当前引擎专属文档说明不支持说话人分离。
多说话人转写可能需要单独的音频通道或其他说话人分离服务。
根据官方文档,已公布的能力尚未作为可用的预览API功能公开。
基准图表来自腾讯。
在匹配条件下进行独立评估将增强比较的可信度。
腾讯对Hy ASR 3.0预览版的架构和训练过程进行了高层级描述,但尚未发布完整可复现的细节。
语言感知解码器可能更倾向于选择常见句子,而忽略不常见但实际正确说出的内容。
测试中必须包含罕见和出人意料的短语。
至少包含数百条具有代表性的话语,而非少量干净的演示样本。
使用明确的规范化策略创建人工核验的参考转写。
决定如何处理:
使用:
不要将所有方言说话人合并为一个平均值。
按地区和录音条件分别报告结果。
创建声学内容相似但句子上下文改变正确转写结果的成对样本。
评估产品名称和
现在先处理术语,待腾讯开放热词支持后重复测试。
使用真实环境录音,而非仅使用数字方式叠加的噪声。
确认 60 秒的分段实现不会切断重要语句,也不会产生重复文本。
包括以下环节:
采集
+ 上传
+ 识别
+ 结果定稿
+ 下游处理
语音录音可能包含个人或敏感信息。
在部署前,应明确数据保留、访问权限、加密、用户同意及删除策略。
| 领域 | 传统流水线 | Hy ASR 3.0 方向 |
|---|---|---|
| 主要关注点 | 声学到文本的准确率 | 声学识别加上下文语言建模 |
| 易混淆同音词 | 通常依赖局部概率判断 | 使用更广泛的句子上下文 |
| 方言 | 独立模型或覆盖有限 | 单一文档化混合引擎,支持 20 种方言 |
| 专业词汇 | 外部热词或自定义模型 | 已宣布热词能力;预览版支持待开放 |
| 复杂语音 | 声学模型加后处理 | 语音语言联合训练加后期训练 |
| 输出 | 转写文本 | 上下文更连贯的转写文本 |
| 主要风险 | 声学替换与漏字 | 声学错误加可能的语义过度修正 |
新方法并不消除传统 ASR 工程的需求。
它是在同一个端到端系统上增加了更强的语言层。
Hy ASR 3.0 预览版是腾讯混元基于 Hy3 语言基座和自研语音编码器推出的实时语音识别模型。其设计目标是将声学识别与上下文语言理解相结合。
腾讯云文档显示支持中文普通话、英语以及 20 种中文方言或地域变体,包括粤语、东北话、河南话、陕西话、成都话、重庆话、武汉话等。不同说话人和地区的准确率可能有所差异。
腾讯公布聚合公共基准测试的 WER 结果为:普通话 3.34%,英语 2.62%,粤语 3.12%。这些是公司基于多个数据集汇总报告的结果,并非独立复现的统一测试结果。
当前公开预览版每次输入最多接受 60 秒音频。更长的录音需要分段处理,且应用需在各分段之间保留有效上下文。
根据腾讯云 2026 年 8 月 4 日的预览版文档,目前尚不支持。发布材料中描述了这些能力,但官方 API 页面显示上下文输入和热词增强功能将在后续开放。
当前 Hy ASR 3.0 预览版文档指定支持 16 kHz 单声道 PCM 输入。使用 MP3、AAC、Opus 或其他格式的应用必须在调用前进行音频转换。
将其发送到此引擎。
开发者使用腾讯云的实时语音识别 WebSocket API,并将 engine_model_type 设置为 Hy-ASR-3.0-preview。连接必须使用腾讯云凭证进行签名。
腾讯云当前的计费页面未列出大模型 2.0 识别的免费音频配额。页面显示预付费套餐起价为 60 小时 1 元人民币/小时,后付费为 1 元人民币/小时,同时包含 20 路并发。
腾讯混元的 Hy ASR 3.0 预览版将语音编码器与 Hy3 的语言模型能力相结合,以改善普通话、英语、方言、混合语言、嘈杂环境和上下文相关的转写效果。
腾讯报告称,在聚合公开数据集上,普通话的 WER 为 3.34%,英语为 2.62%,粤语为 3.12%,同时在其内部场景测试中取得了领先结果。这些数字令人期待,但仍需在各机构自身的音频上进行验证。
当前的腾讯云预览版比完整的发布愿景范围更窄。
它支持实时WebSocket识别、16 kHz单声道PCM,以及最长60秒的音频输入。外部上下文注入、热词增强、说话人分离及其他若干功能在该引擎上尚不可用。
关键变化并非语音识别不再聆听声音,而在于语言模型如今协助判断声音最可能表达的含义。
从一句话开始,几分钟内拿到完整网站。