マイクロソフトは、最も高速で正確で、最も安価なAI音声認識モデルとしてMAI-Transcribe-2を発表しました。価格については、このモデルのリリース期間中に1時間あたり0.10ドル(約0.67元人民元)の料金が適用され、この特典は2026年末まで続きます。

image.png

精度と速度ともにトップクラス、GPT-Transcribeの10倍速い

性能面では、FLEURSテストセットにおいて、MAI-Transcribe-2は強制言語指定モードと自動言語推定モードの両方で平均単語誤り率が5.2%でした。同じテストで、Gemini 3.1 Proの結果は5.3%と5.8%、GPT-Transcribeは10.4%と10.6%、Whisper v3-Largeは22.8%と23.5%でした。

スピードに関しては、マイクロソフトはArtificial Analysisの評価を引用し、MAI-Transcribe-2はGPT-Transcribeの10倍、Scribe v2の7倍、Gemini 3.5 Transcribeの5倍速いと述べています。

話者分離と単語ごとのタイムスタンプをサポート、60言語に対応

機能面では、MAI-Transcribe-2は話者分離機能を追加し、録音内での異なる発言者を区別し、それぞれの発言を対応する話者に割り当てることができます。単語ごとのタイムスタンプにより、各単語の正確な位置を示すことができ、オーディオ検索やナビゲーション、編集、字幕の同期に役立ちます。

スタイル面では、モデルにはカスタマイズ可能な転記スタイルが提供されます。verbatimモードでは、トーンや口ミスを保持し、規制や分析作業に適しています。cleanモードでは、トーンや口ミスを削除し、より読みやすい字幕、ノート、公開テキストを生成します。さらにキーワードバイアス、自動言語識別、言語切り替え、ノイズ環境下での転記もサポートしています。モデルは60言語をカバーしており、自然に混在した言語の会話を扱うことが可能で、ユーザーは事前に言語を指定する必要はありません。モデルは録音された言語を自動的に検出します。

現在、開発者はMicrosoft Foundry、MAI Playground、OpenRouterでこのモデルを呼び出しまたは試用できます。