千問が本日、Qwen-Audio-3.1シリーズの音声大規模モデルを正式リリースしました。今回のアップデートでは、音声認識、音声合成、リアルタイム音声インタラクションの3つの主要モデルが全面的に進化し、新たに音声創作モデルであるQwen-Audio-3.1-TTS-Nextと音声理解モデルであるQwen-Audio-3.1-ASR-Nextが登場しました。5つの新モデルが同時に登場し、「理解—生成—インタラクション—創作」をカバーする完全な音声能力スタックを構築しました。さらに使用のハードルを下げるために、Qwen-Audioの全音声モデルの価格が引き下げられ、そのうちTTSは約70%、Realtimeは約85%、ASRは95%の価格低下となっています。

5つのモデル同時発表、ASR価格は95%も下落
Qwen-Audio-3.1-ASRは次世代の音声認識モデルで、オリジナルの転写と修正機能を追加し、自動的にイントネーションや重複表現を取り除き、文脈を再構成することができます。役割別転写機能により、「誰がいつ何を言ったか」を正確に記録でき、会議やインタビューの明確な構造化された記録を提供します。このモデルは30種類の言語と16種類の中国方言をサポートし、業界用語と階層ごとの熱門語の認識にも対応しています。また低遅延のストリーミング認識をサポートしており、最初の文字の反応時間は約160ミリ秒です。性能面では、KeSpeechおよびWSYueの11のサブセットでの平均文字誤り率(CER)は4.55%、中国方言内のテストデータセットでの平均CERは10.38%、ASTでの平均文意一致率は82.10%です。
次のアーキテクチャに基づくASR-Nextでは、処理対象が「音声中の文章」から「完全なオーディオ情報」へと拡張され、人物の感情、環境音、機械音を理解し、音声説明、イベントの位置特定、オーディオ質問・推論を実現します。役割別ASR評価では、Flash-NextとFlashバージョンがそれぞれ5項目と3項目で最優秀となり、以前のFun-ASR級連システムを全面的に上回りました。
音声合成では、Qwen-Audio-3.1-TTSは多言語および方言の合成をサポートし、同じ音色が異なる言語間で自然に移行できるようにし、指示によって感情、速度、表現方法を制御できます。次世代のTTS-Nextでは、テキスト、タイムスタンプ、参照オーディオを統一して人声、効果音、環境音を生成し、一度の作業で完全なオーディオコンテンツを作成できます。また48kHz出力と細粒度タイムスタンプ制御をサポートし、ポッドキャスト、オーディオブック、映画、ゲームなどのニーズに対応します。

聞き取るだけでなく、創造する。音声はAIの自然なインターフェースになる
リアルタイムインタラクションモデルのQwen-Audio-3.1-Realtimeは、フルディュアル構造を採用しており、同時に話と聞くことができ、いつでも途中で割り込むことができます。また、識別された文章から感情とコミュニケーション意図の理解に進化しました。ユーザーのイントネーションが低下していることを検知すると、語速を遅くし、表現を調整します。これに加え、複数言語のリアルタイム切替をサポートし、会話中にAPI、知識ベース、業務システムツールを呼び出してタスクを完了します。マルチティーチャー蒸留構造を基盤に、低遅延を保ちながら事実の信頼性とセキュリティ境界を強化しています。
現在、Qwen-Audio-3.1-Realtimeは、Qoderや千問オフィスなどのエージェント、QwenNote、A2、Eva、千問AIメガネ、レッキーAIメガネなどのスマートハードウェアと統合されています。これらのシナリオでは、ユーザーが常にコンピュータやスマートフォンを開かずに、直接音声でタスクを開始でき、リアルタイムの会話の中で条件を追加したり、要望を変更したり、実行状況を確認したりできます。千問によると、Qwen-Audio 3.1のアップグレードは単なるポイント的な指標の最適化ではなく、5つの技術経路を通じて進められており、「聞こえる」「創造できる」「会話できる」音声が、人、コンテンツ、AIをつなぐ自然なインターフェースになるようにしています。
VIP会員