テンセント・ハンユアンは新世代の音声認識モデル「Hy ASR3.0 Preview」を正式リリースし、音声認識技術が「単語ごとの変換」から「文脈の理解」へと進化する新しい段階を示しました。このモデルは最新の大規模言語モデル「Hy3」に基づいて構築され、高精度な音声認識と深い意味理解の能力を統合しており、コア的な目標はAIが単にすべての文字を聞き取るだけでなく、あなたが話していることを本当に理解できるようにすることです。

image.png

10の地方話地域をカバーし、長時間音声の場面で優位性を発揮

識別範囲において、Hy ASR3.0 Preview は標準中国語を必要とせず、広東語、呉語など10の大規模地方話地域と20以上の二級小地域をカバーしています。オープンソースの評価データによると、このモデルの多言語単語誤り率(WER)は約3%に抑えられており、中国語標準語では3.34%、英語では2.62%、広東語では3.12%であり、全体的な正確度は業界の限界に近づいています。

Hy3の言語理解能力を組み合わせることで、モデルは文脈に応じてユーザーの意図を正確に捉え、曖昧さを自動的に解消し、同音語のスマートな訂正を行うことができます。会議記録やインタビューなどの長時間音声のような難しい転写シーンでは、「まず理解してから転写する」というアプローチの利点が特に顕著です。従来の単語ごとの音声入力では同音語による曖昧さに困るケースが多いですが、Hy ASR3.0は文脈論理に基づいて正しい単語を選択することができます。

MoE構造を基盤に、数千万時間のデータを用いた統合訓練

技術的には、効率と性能を両立するMoE構造が採用されており、ベースモデルはHy3にアップグレードされています。ハンユアンチームは独自に非監督型の音声エンコーダーを開発し、数千万時間分の非監督音声データを使って複雑な音声から高品質な音響表現を抽出しました。エンコーダーは「よく聞くこと」を担当し、Hy3は「正確に理解すること」を担当します。

データ戦略において、チームは音声エンコーダーと大規模言語モデルを統合してトレーニングを行い、数千万時間分の多様な音声データを導入し、複数の段階での能力注入により、モデルに文脈感知、複雑なシナリオへの適応、地方話認識の能力を持たせました。後処理の段階では、一般的な認識、文脈理解、複雑なシナリオのロバスト性をカバーする高品質なSFT計画を構築し、文脈、専門用語、異なる音響環境および多様な人の声をカバーし、複雑な末尾のシナリオに対して段階的な強化学習を導入して継続的に最適化を行っています。