テクノロジーメディア TestingCatalog は、マイクロソフトが初めてのネイティブリアルタイム音声モデル MAI Realtime をテストしていると報じています。このモデルは16の言語、2つのボイススタイルをサポートし、会話中に発音と聴取を同時に実行でき、自動的に言語を識別し、途中で言語を切り替えることができます。これはユーザーがAIが話し終わるのを待つ必要がないことを意味し、会話体験が人間同士のやり取りに限りなく近づくことになります。

image.png

MAI Realtime は双方向、フルデュープルックスのインタラクション方式を採用しており、従来の「ユーザーが話してからモデルが答える」というラウンドごとの交代方式を打ち破っています。システムはエンドポイント検出技術によって、話し始め、中断、終了を識別します。ユーザーが途中で話を挟んでも、モデルは即座に出力を調整し、同期して聞くと応答することができるようにしています。これはマイクロソフトのMAI音声モデルファミリーが単方向から双方向へ進化する重要な一歩です。これまでにリリースされたMAI-Voice-2やMAI-Transcribe-1.5は、それぞれ音声合成または音声認識の単方向タスクのみを実行できました。

2種類のボイススタイルはより自然ですが、今すぐ歌うことはできません

言語カバーにおいて、MAI Realtime は中国語、英語、日本語、韓国語、フランス語、ドイツ語、アラビア語など16の言語をサポートしています。ユーザーは対話言語を指定するか、自動検出機能を有効にして、モデルが対話中に自動的に言語を識別し、切り替えることができます。ボイススタイルに関しては、テストバージョンにはVictoriaとGrantの2つのボイスが提供されており、現在のCopilotのボイスモードよりも自然であるとされています。