7月31日、アリババ・チュンイーは音声認識大モデル「Qwen-Audio-3.0-ASR-Flash」を正式にリリースし、「長時間の音声でも単語を失わず、業界用語を教える必要がない」という特徴を備え、すでにアリババクラウドの百煉プラットフォームで呼び出し可能となっています。

新しいモデルは5つの側面でアップグレードされています:

1. 長時間の音声文脈記憶機能。転写時に前文の意味を参照できるため、数時間の会議において名前や技術的概念が一貫して保持され、「断片」現象がなくなります。

2. 内蔵された多業界用語データベースにより、医療シーンでの専門用語の検出率は95.36%、ITプログラミングでは91.87%と高い精度を実現し、人工的な設定なしでも正確に冷門用語を認識できます。

3. カテゴリー別ホットワードカスタマイズ。企業固有の語彙が即座に効果を発揮し、多くのシナリオで検出率が99%を超え、ホットワードが増えても誤って起動することはありません。

4. 音声の調整機能が統合されており、ワンクリックで口癖の除去、重複のクリーンアップ、自己修正の処理、意味の再構成が可能です。出力の読みやすさは「ASR+大規模モデルによる調整」の2段階の方法とほぼ同じです。

5. 一つのモデルで30種類以上の言語をカバーしており、7種類の言語の平均的な意味間違い率は17.09%であり、AzureやGeminiなどの同業他社モデルより優れており、国際会議や海外向けカスタマーサービスのシナリオに適しています。

同時にリリースされた「Qwen-Audio-3.0-ASR-Streaming」はリアルタイムシナリオ向けで、理論的な文字出力遅延は300ミリ秒、中国語の工業シーンにおける誤字率は7.80%、英語では11.52%と業界をリードしています。このシリーズは以前にArtificial Analysisの評価で1.7%の誤字率で世界第1位を獲得し、会議の要約、リアルタイム字幕、教育録画、スマートカスタマーサービスなどに広く応用されています。