はじめに
腾讯混元は Hy ASR 3.0 プレビュー版 を公開しました。これは Hy3 の言語理解能力に基づいて構築された、新しいリアルタイム音声認識モデルです。
このモデルは、自動音声認識を孤立した音響デコードの枠を超えて前進させることを目的としています。
従来のASRシステムは、主に次の問いに答えていました:
この音声に最もマッチする単語列はどれか?
Hy ASR 3.0 は、2つ目の問いを追加します:
文脈において、どの書き起こしが最も意味を成すか?
この違いは、音声に以下の要素が含まれる場合に極めて重要になります:
- 同音異義語。
- 地域特有のアクセント。
- 方言。
- 中日英の混在発話。
- 製品名や人名。
- 背景ノイズ。
- ささやき声や小声での発話。
- 長文や意味的な依存関係が強い表現。
腾讯によると、このモデルは高精度な音響システムと Hy3 の文脈モデリングおよび意味推論能力を組み合わせています。その目標は、ユーザーが話した内容を創造的に言い換えることではなく、音声自体に曖昧さがある場合に、言語的文脈を利用してより合理的な書き起こし結果を選択することです。
腾讯の報告によると、公開評価セットの集合結果では、普通話の語彙誤り率は3.34%、英語は2.62%、広東語は3.12% です。
Hy ASR 3.0 プレビュー版は、現在、腾讯クラウドのリアルタイム WebSocket エンジンとしてドキュメントが提供されており、腾讯元宝アシスタントにも統合されています。WorkBuddy やその他の腾讯製品にも段階的に組み込まれています。
公開プレビュー版は利用可能ですが、より広範なリリース発表で説明されている最終的な製品形態にはまだ達していません。現在のAPI制限は、本番統合を計画しているチームにとって注目すべき点です。
発表された公開ベンチマーク結果
腾讯は、複数の公開音声データセットで Hy ASR 3.0 プレビュー版を評価し、他のASRシステムと比較しました。
同社が報告した集合語彙誤り率は以下の通りです:
| 言語または音声変種 | Hy ASR 3.0 プレビュー版 WER |
|---|---|
| 普通話 | 3.34% |
| 英語 | 2.62% |
| 広東語 | 3.12% |
WER は低いほど良好です。

グラフの注記によると、集合評価では以下のデータセットが使用されました:
- WenetSpeechMeeting。
- WenetSpeechNet。
- FLEURS 中国語。
- LibriSpeech clean。
- LibriSpeech other。
- FLEURS 英語。
- MLS 英語。
- FLEURS 広東語。
- Common Voice 広東語。
集合データは大まかな比較には役立ちますが、重要な差異を隠す可能性もあります。
モデルの性能はシナリオによって異なる場合があります:
- 読み上げ音声と自発的な会話。
- 近距離マイクと遠距離マイク。
- クリーンな録音室音声と街頭ノイズ。
- 短い指示と継続的な議論。
- ネイティブスピーカーとアクセントのある音声。
- 正式な普通話とコードスイッチング。
したがって、本番チームは自社の音声を使用してテストする必要があります。
単一の見出しのWER数値だけでASRモデルを選択するのではなく。
語彙誤り率が測定するもの
語彙誤り率は通常、次のように定義されます:
WER =(置換 + 削除 + 挿入)/ 参照語数
3つのエラータイプは以下の通りです:
- 置換: モデルが誤った単語を出力した。
- 削除: 書き起こしテキストで発話された単語が欠落した。
- 挿入: 書き起こしテキストに発話されていない単語が含まれた。
WERが低いほど、通常は書き起こしが正確であることを示します。
しかし、WERは実際のシナリオにおけるすべての失敗を網羅しているわけではありません。
次の2つの単語エラーを考えてみましょう:
「Ship the order tomorrow」
→ 「Ship the order today」
および:
「The color is navy blue」
→ 「The colour is navy blue」
両者は同様のエラーカウントを生む可能性がありますが、前者はビジネスアクションを変える可能性がある一方、後者はビジネスに何の影響も与えない可能性があります。
カスタマーサービス、医療健康、金融、製造、コマンドインターフェースなどの分野では、チームは意味的影響とWERの両方を評価する必要があります。
腾讯社内シナリオ評価
腾讯はまた、4つの実際のカテゴリをカバーする社内評価セットの結果を公開しました:
- 汎用音声認識。
- 方言認識。
- 文脈理解。
- 高ノイズやささやき声などの複雑な音響条件。
報告された結果は以下の通りです:
| 社内評価カテゴリ | Hy ASR 3.0 Preview WER |
|---|---|
| 汎用認識 | 4.95% |
| 方言認識 | 9.31% |
| 文脈評価 | 4.76% |
| 複雑な音響条件 | 6.36% |

腾讯によると、Hy ASR 3.0 Preview は、4つの社内カテゴリすべてにおいて、比較対象システムの中で最低のWERを達成しました。
これらの結果は、同社が報告する製品の証拠として有用ですが、社内テストセットは中立的な公開ベンチマークではありません。
採用前に、組織は以下の点を確認すべきです:
- テストにはどのアクセントや方言地域が含まれているか?
- 音声のノイズレベルはどの程度か?
- 句読点はどのように正規化されているか?
- 数字や英語の用語はスコアリング前に標準化されているか?
- 比較対象システムにはホットワードや文脈が設定されているか?
- 使用された発話サンプル数はいくつか?
- テストには組織が実際に使用するマイクやチャネルが含まれているか?
ユーザー向けの4つの改善点
腾讯は実際の改善点を4つの領域にまとめています。
- より正確な汎用認識
このモデルは、以下のシナリオでの認識能力向上を目的としています:
- 標準的な普通話。
- 英語。
- 広東語。
- 地域方言。
- 中英混在発話。
- 異なる話者やアクセント。
腾讯はまた、このモデルが長い発話における累積エラーを低減することも述べています。
この主張はモデルの基盤となる能力を説明しています。現在の腾讯クラウドPreviewは、単一のパブリックAPI入力が60秒以内に制限されているため、会議や録音を処理するアプリケーションは現在、セグメント化する必要があります。
音声を分割し、セグメント間の文脈を自ら管理します。
分割が不適切だと、このモデルが解決すべき問題を再導入する可能性があります。
例えば、任意の60秒境界で音声を切断すると、以下が途切れる可能性があります:
- 個人のフルネーム。
- 製品コード。
- 意味が後から明らかになる文。
- 中英混合フレーズ。
- 話者の自己修正。
したがって、セグメンテーションロジックは可能な限り文の境界と音声活動の境界を保持する必要があります。
- より良いコンテキストと意図の認識
音声には多くの曖昧な音が含まれています。
中国語標準語には大量の同音異義語があります。英語には発音が似ている単語や名前があります。方言の発音により、複数の候補書き起こしテキストが音響的にすべてもっともらしく見えることがあります。
従来のデコーダーは局所的な最大確率の単語を選択する可能性があります。
コンテキスト認識機能を備えたシステムは、発話全体を評価できます。
例えば、ユーザーが2つの異なる同音字に書き起こせるフレーズを発話する可能性があります。周辺に金融、ゲーム、医療、旅行に関連するトピックの単語があれば、どちらの意味がより可能性が高いかを示すことができます。
想定される処理フローは次のように簡略化できます:
音声特徴
→ 候補単語
→ 文のコンテキスト
→ 意味的一貫性チェック
→ 最終書き起こしテキスト
これは、モデルが人間と同じ方法で音声を真に理解できることを意味するものではありません。
むしろ、言語コンポーネントがより広いコンテキストウィンドウと意味的確率を利用して書き起こしの決定を改善することを意味します。
コンテキスト認識型ASRシステムは新たなリスクももたらします:意味の過剰修正。
モデルは、珍しいが発音が正しいフレーズを、より自然に見える一般的なフレーズに置き換えてしまうことがあります。
したがって、本番環境での評価には以下を含める必要があります:
- 珍しい人名。
- 意図的に通常とは異なる表現。
- 新製品の用語。
- 分野固有の略語。
- 矛盾している、または驚くべき文。
目標は、コンテキストを活用しながら、音声に存在しなかった内容を空想して作り出さないことです。
- 専門用語へのより容易な適応
リリース資料では、ホットワード拡張が以下の用途に強調されています:
- ブランド名。
- 製品名。
- 人名。
- 業界用語。
- 略語。
- 社内用語。
汎用モデルがある珍しい単語の出現頻度を十分に学習していない場合、ホットワードは重要な価値を発揮します。
例には以下が含まれます:
専用医薬品名
工場の機械型番
顧客アカウントコード
新しく発売されたブランド
技術略語
Tencent Cloudの汎用ASR製品には、すでにホットワードリストAPIとhotword_idパラメータがあります。
ただし、現在のHy ASR 3.0プレビュー版ドキュメントでは、ホットワード拡張はこのプレビューエンジンではまだ利用できないと明記されています。
したがって、公開製品宣伝と実際にアクセス可能なAPIステータスを区別する必要があります:
| 能力 | モデルリリースノート | 現在のプレビューAPIステータス |
|---|---|---|
| ホットワード拡張 | サポートされている機能として記載 | 近日公開予定と記載 |
| コンテキスト入力 | 主要機能として記載 | 近日公開予定と記載 |
| 内部コンテキスト言語モデリング | コアモデル機能 | モデル動作を通じて利用可能 |
Tencent Cloudが正式なAPIドキュメントでサポートを確認するまで、企業は外部コンテキスト注入やホットワードリストに依存したリリース計画を策定すべきではありません。
4.
困難な音響条件下でのより安定した認識
Tencentは、このモデルが以下の状況向けに最適化されていると述べています:
- 高いバックグラウンドノイズ。
- ささやき声。
- 小さな声での会話。
- 異なる録音環境。
- 多様なアクセント。
- 長い末尾の音響条件。
ノイズロバスト性は重要です。なぜなら、実際の音声がクリーンな実験室録音のように現れることはほとんどないからです。
カスタマーサービス用マイクは、キーボード音や隣の同僚の声を拾う可能性があります。
モバイルアシスタントは、交通騒音、風切り音、音楽、または他の人の話し声を聞き取る可能性があります。
会議アプリケーションは、離れた場所にあるラップトップのマイクから圧縮された音声を受信する可能性があります。
モデルはロバスト性を向上させることはできますが、キャプチャされなかった情報を復元することはできません。
チームは引き続き以下を使用すべきです:
- 適切なマイク。
- エコーキャンセレーション。
- ゲインコントロール。
- サポートされている場合の音声活動検出。
- 合理的な音声圧縮。
- チャンネルモニタリング。
- リトライまたは明確化フロー。
ASR品質はモデル属性だけでなく、システム全体の属性です。
アーキテクチャ:Hy3プラス音声エンコーダー
Tencentは、混元Hy ASR 3.0プレビューが3つの主要コンポーネントを組み合わせていると述べています:
- Hy3ベースのMoE言語モデル基盤。
- 自社開発の教師なし音声エンコーダー。
- 共同事前学習と多段階ポストトレーニング。

Hy3の言語基盤としての役割
Hy3は言語理解コンポーネントを提供します。
その役割には以下が含まれます:
- 文のコンテキストをモデリングする。
- 曖昧な候補を解析する。
- 混合言語構造を理解する。
- 意味的関係を活用する。
- 出力の一貫性を向上させる。
Tencentは、このアーキテクチャを能力と効率のバランスを取る専門家混合(MoE)設計と説明しています。
公開されているASRドキュメントでは、Hy ASR 3.0プレビューの完全なパラメータ数、アクティブパラメータ数、遅延プロファイル、または完全な推論アーキテクチャは開示されていません。
教師なし音声エンコーダー
音声エンコーダーは、生の音声を言語モデルが処理できる音響表現に変換します。
Tencentは、このエンコーダーが数千万時間のラベルなし音声を使用してトレーニングされたと述べています。
教師なしまたは自己教師ありの音声トレーニングは、この規模の音声データに手動で書き起こしを行うにはコストが法外に高いため、価値があります。
エンコーダーは生の音声から繰り返し現れる構造を学習できます。例えば:
- 音声パターン。
- 話者間の差異。
- アクセントの違い。
- 背景条件。
- タイミングと韻律。
この表現の品質は、後続のすべての段階に影響します。
エンコーダー段階で2つの音が混同された場合、言語モデルは正しい単語を復元するためにより多くコンテキストに依存する必要があります。
音声と言語の共同事前学習
Tencentは、音声エンコーダーと言語モデルが以下をカバーする大規模なマルチソース音声データセットを使用して共同トレーニングされたと述べています:
- 方言。
- アクセント。
- 音響環境。
- 多様な話者集団。
- コンテキスト言語パターン。
- 共同
トレーニングは、音響認識と言語理解の間のギャップを縮小することを目的としています。
音声認識が次のように扱われるのではなく:
音声モデルが完了する
→ 言語モデルが後から書き起こしテキストをクリーンアップする
Hy ASR 3.0はより統合されたプロセスとして提示されています:
音声表現と言語モデリング
→ トレーニングが協調して機能する
→ コンテキスト化された書き起こし結果を出力する
エンコーダー、デコーダー、言語モデル、強化学習段階の間の正確な内部境界は完全には公開されていません。
## SFTと多段階強化学習
Tencentは、以下をカバーする教師ありファインチューニングスキームを説明しています:
- 汎用書き起こし。
- 任意のコンテキストタスク。
- 専門用語。
- さまざまな音響環境。
- 多様な話者集団。
- 十大方言区。
- 20以上の小規模な方言地域。
同社はまた、以下のための多段階強化学習を使用したと報告しています:
- 汎用書き起こし精度。
- コンテキスト動作。
- 複雑なロングテールケース。
- 置換エラーと削除エラーの削減。
現在、完全な報酬設計、データ配分、トレーニング計算リソース、またはアブレーション実験の結果を提供する公開技術論文はありません。
したがって、アーキテクチャの記述は、再現可能な研究仕様ではなく、製品レベルの技術説明として見なされるべきです。
## 現在のTencent Cloudエンジンがサポートする言語と方言
Tencent Cloudのドキュメントでは、現在の`Hy-ASR-3.0-preview`エンジンが以下をサポートすると説明されています:
- 中国語標準語。
- 英語。
- 20の中国方言または地域変種。
ドキュメントに記載されている方言リストは以下のとおりです:
| 番号 | 方言または地域変種 |
|-|-|
| 1 | 広東語 |
| 2 | 東北話 |
| 3 | 河南話 |
| 4 | 陝西方言 |
| 5 | 成都話 |
| 6 | 重慶話 |
| 7 | 武漢話 |
| 8 | 貴陽話 |
| 9 | 青島話 |
| 10 | 済南話 |
| 11 | 長沙話 |
| 12 | 合肥話 |
| 13 | 河北方言 |
| 14 | 昆明話 |
| 15 | 蘭州話 |
| 16 | 銀川話 |
| 17 | 南昌話 |
| 18 | 北京話 |
| 19 | 四川話 |
| 20 | 天津話 |
商用ASRドキュメントにおける方言ラベルは、大まかな製品カテゴリーです。
各类における実際の音声は、都市、年齢、社会的背景、コードスイッチング、語彙、話者によって異なる。
特定の方言をサポートすると主張しても、その地域のすべての話者に対して同じ精度が保証されるわけではない。
## 現在のプレビュー版の利用可能性
Tencent Cloudは**2026年8月4日**に、Hy ASR 3.0プレビュー版エンジンをリアルタイムWebSocket製品に追加した。
このパブリックサービスは現在、社内テスト版またはプレビュー版として説明されている。
| 項目 | 現在の文書化ステータス |
|-|-|
| 製品タイプ | リアルタイム音声認識 |
| 接続方法 | Tencent Cloud WebSocket API |
| エンジン名 | `Hy-ASR-3.0-preview` |
| 音声時間 | 各入力は60秒以内 |
| 音声形式 | 16 kHzモノラルPCM |
| 含まれる並列接続数 | 20並列接続 |
| 普通話 | 対応 |
| 英語 | 対応 |
| 20種類の方言 | 対応 |
| 話者分離 | プレビュー版では非対応 |
| VADパラメータ対応 | プレビュー版では非対応 |
| 単語置換 | プレビュー版では非対応 |
ノイズ閾値パラメータ | プレビュー版では非対応 |
| 外部コンテキスト入力 | 近日公開予定 |
| ウェイクワード強化 | 近日公開予定 |
汎用WebSocket APIリファレンスには、VADやウェイクワードIDなど、他のエンジンで使用されるパラメータが含まれている。
Hy ASR 3.0は、エンジン固有のプレビュー版仕様に従う。
共有APIモードに登場するパラメータがあっても、プレビュー版エンジンがそのパラメータを現在実装していることは保証されない。
## Tencent Cloud統合の基本フロー
公式設定は主に3つの段階に分かれている。
## ステップ1:Tencent Cloud音声認識サービスの開通
Tencent Cloud音声認識サービスを開き、アカウント開通プロセスを完了する。
公式クイックスタートドキュメントは以下にある:
```Plaintext
https://cloud.tencent.com/document/product/1093/54362
従量課金を有効にする前に、課金説明を確認すること。
Tencent Cloudは、新規アカウントでは従量課金がデフォルトで無効になっており、手動で有効化する必要があると指摘している。
ステップ2:API認証情報の作成
以下を作成または取得する:
AppIDSecretIDSecretKey
これらの認証情報は、WebSocket接続リクエストの署名に使用される。
鍵管理サービスまたは保護された環境変数に保管すること。
長期有効な認証情報を以下の場所に置かないこと:
- フロントエンドのJavaScriptコード
- モバイルアプリのソースコード
- 公開コードリポジトリ
- 共有ドキュメント
- クライアントが参照可能なURL
ブラウザまたはモバイル製品の場合は、信頼できるバックエンドで署名済み接続情報を作成すること。
ステップ3:リアルタイムWebSocketエンドポイントへの接続
Tencent Cloudのドキュメントに記載されているエンドポイント形式は以下の通り:
wss://asr.cloud.tencent.com/asr/v2/?{request_parameters}
`` をTencent CloudのAppIDに置き換える。
リクエストには以下のような署名パラメータが含まれる:
secretidtimestampexpirednoncevoice_idengine_model_type
Hy ASR 3.0プレビュー版では、以下を設定する:
engine_model_type=Hy-ASR-3.0-preview
各WebSocket接続には一意の voice_id が必要である。
接続が終了または失敗した場合、古い voice_id は無効となり、新しい voice_id を生成する必要がある。
ステップ4:互換性のある音声の準備
現在のプレビュー版の要件:
サンプルレート:16 kHz
チャンネル:モノラル
形式:PCM
最大入力時間:60秒
生のファイルだけでなく、音声の完全なパイプラインをテストすること。
マイクSDK、ブラウザのMedia API、電話システム、会議プラットフォームは、音声がサーバーに到達する前にリサンプリングや圧縮を行う可能性がある。
ステップ5:音声のストリーミング送信と増分結果の読み取り
このサービスはリアルタイム文字起こしをサポートしており、音声の送信中にテキストを返すことができる。
アプリケーションは以下を処理する必要がある:
- 部分結果
- 最終結果
- 接続エラー
- 認証失敗
- タイムアウト
- 再接続
- 音声時間制限
- 重複または修正されたテキスト
各部分認識結果が最終結果であると想定しないこと。
リアルタイムASR APIは、より多くのコンテキストが得られた後に以前の単語やフレーズを修正する場合がある。
ユーザーインターフェースは、一時的なテキストと確定済みテキストを区別する必要がある。
ステップ6:リリース前のテスト
以下を含む代表的な評価セットを構築する:
- 実際の顧客音声
- 一般的なアクセント
- 方言
- 中英混合
- 人名・製品用語
ノイズ
- 小さな声での会話
- 低品質マイク
- 短い指示
- 完全な文
認識品質とシステム動作の両方を測定する。
プレビュー版エンジンの料金
Tencent CloudはHy ASR 3.0プレビュー版を大規模モデル2.0リアルタイム音声認識エンジンとして分類している。
現在の課金ページには以下が記載されている:
| 課金オプション | 現在の価格 |
|---|---|
| 前払い60時間パック | 合計60元、つまり1.00元/時間 |
| 前払い1,000時間パック | 合計950元、つまり0.95元/時間 |
| 前払い10,000時間パック | 合計9,000元、つまり0.90元/時間 |
| 前払い100,000時間パック | 合計88,000元、つまり0.88元/時間 |
| 前払い300,000時間パック | 合計255,000元、つまり0.85元/時間 |
| 従量課金 | 1.00元/時間、日次決済 |
Tencentの現在の課金表では、大規模モデル2.0の認識に無料の音声枠はない。
含まれる20並列接続は並列クォータであり、無料認識時間ではない。
価格は変動する可能性がある。商用見積もりや長期予算の見積もりを出す前に、リアルタイムの課金ページを確認すること。
コスト例
現在の価格である従量課金1.00元/時間で計算:
100時間の成功した認識
× 1.00元/時間
= 100元
本番環境の予算には以下も含めるべきである:
- 音声前処理
- ネットワーク転送
- バックエンドサーバー
- ストレージ
- モニタリング
- 手動修正
- 再試行トラフィック
- 下流の言語モデル処理
ASR費用は、完全な文字起こしシステムの一部にすぎない。
元宝(Yuanbao)と製品統合
Tencentは、元宝がこのモデルの開発に参加し、このモデルを統合した最初のTencent製品であると述べている。
ユーザーは元宝の音声入力でこの機能を体験できる。このモデルは以下を改善することを目的としている:
- 方言認識
- コンテキスト誤り訂正
- 困難な音響条件下での認識
Tencentは、WorkBuddyなどの他の製品も段階的に統合していると述べている。
消費者向け製品の統合方法は、Tencent Cloudのプレビュー版公開APIとは異なる場合がある。
例えば、元宝は内部サービス、製品固有のコンテキスト、または外部開発者にはまだ公開されていないデプロイ構成を使用している可能性がある。
元宝での体験が公開APIのパラメータと一対一で対応していると想定すべきではない。
適用シーン
Hy ASR 3.0プレビュー版は、短時間・低遅延の音声対話向けに位置づけられている。
スマートカスタマーサービス
潜在的な用途は以下の通り:
- エージェントのリアルタイム文字起こし
- 音声ボットの指示認識
- 通話議事録の生成
- 意図抽出
- 品質管理支援
プレビュー版には現在、話者分離機能がないため、他のコンポーネントがチャンネルまたは話者の分離を行わない限り、複数話者の通話文字起こしには制約がある可能性がある。
リアルタイム字幕
このエンジンは、以下のシーンの短時間リアルタイム字幕をサポートできる:
- ライブ動画
- 音声ルーム
- 社内会議
- 音声メッセージ
- アクセシビリティ対応インターフェース
アプリケーションは、部分結果の安定性と句読点の動作をテストする必要がある。
音声検索
コンテキストを考慮した認識は、以下を含む検索を改善できる:
- 長文の自然言語による質問
- 製品名
- 中英混在発話
- 地域的な発音
プレビュー版でホットワード注入が解放されるまで、希少な
カタログ用語は、後処理またはエラー修正レイヤーが別途必要になる場合がある。
音声コマンドとアシスタント
エンジンは、以下に使用するために話し言葉の指示をテキストに変換できる:
- AIアシスタント
- エンタープライズAIエージェント
智能デバイス制御。
- ワークフローコマンド。
コマンドシステムは、転写結果の信頼度が高く見えるという理由だけで、影響の大きい操作を実行すべきではありません。
破壊的または金銭的な操作については、解析された意図を確認し、ユーザーの明示的な承認を求める必要があります。
内容理解
短い音声クリップは、以下のフローに送る前に転写できます:
- 要約生成。
- 分類。
- 検索インデックス。
- コンテンツモデレーション。
- 知識抽出。
下流の各AI処理の品質は、転写結果に依存します。
ポリシーで許可されている場合は、不確実な出力を監査できるよう、元の音声または信頼度の証拠を保存してください。
現在の制限事項
プレビュー状態
この製品は、まだプレビュー版または内部ベータ版としてマークされています。
インターフェース、価格設定、制限、サポートされる機能は変更される可能性があります。
60秒の入力制限
現在のパブリックAPIは、長時間録音のバッチ転写を直接置き換えることはできません。
長い音声はセグメントに分割して処理する必要があり、アプリケーション層でのコンテキスト層が必要になる場合があります。
PCM入力のみサポート
プレビュー版では現在、16kHzモノラルPCMが必要です。
多くの本番環境ではMP3、AAC、Opus、または電話コーデックが使用されており、変換が必要です。
話者分離は未サポート
現在のエンジン専用ドキュメントには、話者分離はサポートされていないと記載されています。
複数話者の転写には、個別の音声チャンネルまたは他の話者分離サービスが必要になる場合があります。
コンテキストとホットワード機能はまだ公開されていません
公式ドキュメントによると、発表された機能は、利用可能なプレビューAPI機能としてまだ公開されていません。
会社が報告したベンチマークデータ
ベンチマークのグラフはテンセントからのものです。
一致する条件での独立した評価は、比較の信頼性を高めます。
完全な技術論文はありません
テンセントはHy ASR 3.0プレビュー版のアーキテクチャとトレーニングプロセスについて高水準の説明を行っていますが、完全に再現可能な詳細はまだ公開していません。
コンテキストによる過剰修正の可能性
言語認識デコーダーは、一般的な文を優先し、珍しいが実際に正しく話された内容を見落とす可能性があります。
テストには、珍しい予期しないフレーズを含める必要があります。
実用的な評価チェックリスト
- ドメインのテストセットを構築する
少数のクリーンなデモサンプルではなく、少なくとも数百の発話の代表的なセットを含めます。
- 元の参照テキストを保持する
明確な正規化戦略を使用して、人間が検証した参照転写を作成します。
以下の処理方法を決定します:
- 句読点。
- 数字。
- 英語の大文字小文字。
- フィラーワード。
- 繰り返しコンテンツ。
- 繁体字中国語と簡体字中国語。
- 複数の指標を測定する
以下を使用します:
- ワードエラー率または文字エラー率。
- 名前の正確性。
- 数字の正確性。
- 意味エラー率。
- 遅延。
- 部分結果の修正率。
- 失敗率。
- 方言を個別にテストする
すべての方言話者を1つの平均値にまとめないでください。
地域と録音条件ごとに結果を個別に報告します。
- コンテキストの曖昧さをテストする
音響的コンテンツは類似しているが、文脈によって正しい転写結果が変わるペアサンプルを作成します。
- 稀な用語をテストする
製品名と
今は用語を先に処理し、テンセントがホットワードサポートを公開したらテストを繰り返します。
- ノイズとささやき声のシナリオをテストする
デジタル的に重ねたノイズだけでなく、実際の環境録音を使用します。
- セグメント境界をテストする
60秒のセグメント化の実装が、重要な文を切断したり、重複したテキストを生成したりしないことを確認します。
- エンドツーエンドの遅延を測定する
以下の要素を含めます:
収集
+ アップロード
+ 認識
+ 結果の確定
+ 下流処理
- プライバシーとコンプライアンス要件をレビューする
音声録音には、個人情報や機密情報が含まれる場合があります。
デプロイ前に、データ保持、アクセス権限、暗号化、ユーザーの同意、削除ポリシーを明確にする必要があります。
Hy ASR 3.0 プレビュー版と従来のASRパイプラインの比較
| 領域 | 従来のパイプライン | Hy ASR 3.0 の方向性 |
|---|---|---|
| 主な焦点 | 音声からテキストへの正確性 | 音響認識にコンテキスト言語モデリングを追加 |
| 紛らわしい同音語 | 通常、局所的な確率に依存 | より広い文脈を使用 |
| 方言 | 独立したモデルまたは限定的なカバレッジ | 20の方言をサポートする単一の文書化されたハイブリッドエンジン |
| 専門用語 | 外部ホットワードまたはカスタムモデル | ホットワード機能は発表済み、プレビュー版でのサポートは未公開 |
| 複雑な音声 | 音響モデルに後処理を追加 | 音声と言語の共同トレーニングに後期トレーニングを追加 |
| 出力 | 転写テキスト | コンテキスト的により一貫性のある転写テキスト |
| 主なリスク | 音響的な置換と欠落 | 音響エラーに加えて、可能性のある意味的な過剰修正 |
新しいアプローチは、従来のASRエンジニアリングの必要性を排除するものではありません。
同じエンドツーエンドシステム上に、より強力な言語層を追加するものです。
よくある質問
Hy ASR 3.0 プレビュー版とは何ですか?
Hy ASR 3.0 プレビュー版は、テンセント混元がHy3言語基盤と自社開発の音声エンコーダーに基づいて提供するリアルタイム音声認識モデルです。その設計目標は、音響認識とコンテキスト言語理解を組み合わせることです。
Hy ASR 3.0 はどの言語と方言をサポートしていますか?
テンセントクラウドのドキュメントによると、中国語の標準語、英語、および広東語、東北話、河南話、陝西話、成都話、重慶話、武漢話などを含む20の中国語方言または地域変種をサポートしています。話者や地域によって正確性は異なる場合があります。
公表されているWER(ワードエラー率)はどのくらいですか?
テンセントが集計した公開ベンチマークのWER結果は、標準語3.34%、英語2.62%、広東語3.12%です。これらは、同社が複数のデータセットをまとめて報告した結果であり、独立して再現された統一テストの結果ではありません。
Hy ASR 3.0 は長い録音を転写できますか?
現在のパブリックプレビュー版では、1回の入力につき最大60秒の音声を受け付けます。より長い録音はセグメントに分割して処理する必要があり、アプリケーションは各セグメント間で有効なコンテキストを維持する必要があります。
現在のAPIはホットワードとカスタムコンテキストをサポートしていますか?
テンセントクラウドの2026年8月4日のプレビュー版ドキュメントによると、現在はサポートされていません。発表資料ではこれらの機能が説明されていますが、公式APIページでは、コンテキスト入力とホットワード拡張機能は後日公開される予定です。
サポートされている音声形式は何ですか?
現在のHy ASR 3.0プレビュー版のドキュメントでは、16kHzモノラルPCM入力が指定されています。MP3、AAC、Opus、または他の形式を使用するアプリケーションは、呼び出し前に音声変換を実行する必要があります。
このエンジンに送信してください。
開発者はどのようにHy ASR 3.0を呼び出すのですか?
開発者はテンセントクラウドのリアルタイム音声認識WebSocket APIを使用し、engine_model_typeをHy-ASR-3.0-previewに設定します。接続はテンセントクラウドの認証情報を使用して署名する必要があります。
Hy ASR 3.0 は無料ですか?
テンセントクラウドの現在の課金ページには、大規模モデル2.0認識の無料音声クォータは記載されていません。ページには、前払いプランが60時間で1元/時間から、後払いが1元/時間であり、20の同時接続が含まれると表示されています。
関連ツール
- テンセントクラウド混元ASRプレビュー:Hy ASR 3.0プレビュー版の公式機能、制限、方言、クイックアクセスドキュメント。
- テンセントクラウドリアルタイムASR WebSocket API:公式エンドポイント、認証パラメータ、エンジン選択、レスポンスドキュメント。
- テンセントクラウドAPI Explorer:APIを確認し、SDKリクエストサンプルを生成するためのテンセント公式インターフェース。
- テンセントクラウドPython SDK:テンセントクラウドAPIと認証情報管理用の公式Python SDK。
- FFmpeg:入力音声を互換性のあるサンプルレートとチャンネルレイアウトに変換するために使用できるオープンソースの音声・ビデオツールキット。
- Websocat:開発中にストリーミングエンドポイントをテストするのに適したコマンドラインWebSocketクライアント。
関連リンク
- [混元ASRプレビュードキュメント](https://cloud.tencent.
com/document/product/1093/135476):現在の公式ステータス、対応方言、制限、基本設定。
- リアルタイム音声認識API:WebSocketエンドポイント形式とリクエストパラメータのリファレンス。
- 1分間サーバーAPIクイックスタート:Tencent Cloud公式のサービス開通および認証情報ガイド。
- Tencent Cloud ASR課金:現在の前払い、後払い、同時実行数、無料枠の情報。
- Tencent Cloud ASR製品アップデート:公式リリースログ。Hy ASR 3.0プレビューエンジンが2026年8月4日に追加されたことを表示。
- Tencent CloudホットワードAPI:公式の汎用ASRホットワードリストAPI。Hy ASR 3.0プレビュー版のサポートは「近日公開」と表示。
- Tencent Hunyuan:公式のHunyuanモデルおよび製品ポータル。
まとめ
Tencent HunyuanのHy ASR 3.0プレビュー版は、音声エンコーダーとHy3の言語モデル能力を組み合わせ、標準中国語、英語、方言、混合言語、騒がしい環境、文脈に依存した転写を改善します。
Tencentは、公開データセットの集合において、標準中国語のWERが3.34%、英語が2.62%、広東語が3.12%であり、社内のシナリオテストでもトップクラスの結果を達成したと報告しています。これらの数値は期待が持てますが、各組織自身の音声データでの検証が依然として必要です。
現在のTencent Cloudプレビュー版は、完全なリリースビジョンよりも範囲が狭いものです。
リアルタイムWebSocket認識、16kHzモノラルPCM、最大60秒の音声入力をサポートしています。外部コンテキスト注入、ホットワード拡張、話者分離、その他いくつかの機能は、このエンジンではまだ利用できません。
重要な変化は、音声認識が音を聞かなくなったことではなく、言語モデルが音声が最も表現している可能性の高い意味を判断するのを支援するようになったことです。
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。



