本日、騰訊混元は新世代の音声認識モデル「Hy ASR3.0 preview」を正式にリリースしました。このモデルは、大規模言語モデル「Hy3」の深い意味理解能力と高精度な音声認識を初めて統合し、音声認識が「単語ごとの転記・個別最適化」から「文脈の理解・場面の対応・ワンクリック出力」へと飛躍的に進化させました。
公式によると、新モデルは多角的な評価で優れた性能を示しています。オープンソースの評価データセットでは、中国語標準語、英語、広東語の文字誤り率(WER)はそれぞれ3.34%、2.62%、3.12%と低く、全体で3%前後となっています。自社の評価データセットは、一般的な認識だけでなく、10種類以上の地方言、文脈の意味理解、専門用語の認識および高騒音や囁きなどの複雑な音響環境にも対応しており、WERも業界の先端水準を維持しています。

技術的には、Hy ASR3.0 previewの能力向上は全フローの最適化によるものです。構造上は効率と性能を両立するMoE構造を採用し、基盤モデルはHy3の大規模モデルにアップグレードされています。さらに独自開発の非教師付き音声Encoderを搭載し、数千万時間分の音声データで訓練することで、音響特徴抽出能力を向上させています。事前学習段階では、音声Encoderと大規模言語モデルを統合してトレーニングを行い、多数の地方言、口調、音響環境の大量データをカバーし、多段階の能力注入によって地方言認識や文脈感知などの特性を強化しています。後処理の段階では、20以上の地方言小地域をカバーするSFTデータセットを構築し、多段階の強化学習を組み合わせて、複雑な状況での誤認識や見逃しの問題を特定的に解決しています。
