xAIは新世代の音声認識モデルであるGrok Voice Think Fast2.0をリリースし、音声インテリジェントエージェントを開発する開発者向けに公開しました。このモデルは、知能レベル、転写精度、会話能力、ツール呼び出し効率において向上しています。このモデルの料金は、1分あたり0.08ドルで、xAIは既存のプロンプトを変更する必要がなく、Think Fast2.0は多くのアプリケーションでパフォーマンスの向上をもたらすと述べています。

Artificial Analysisの音声認識ベンチマークテストにおいて、Grok Voice Think Fast2.0の総合得点は82.9%となり、前バージョンのThink Fast1.0の75.7%を上回り、GPT-Realtime-2.1の79.1%やGemini3.1Flashの69.5%にも勝っています。そのうち、エージェント機能評価は56.5%で、Think Fast1.0の52.1%、GPT-Realtime-2.1の45.7%、Gemini3.1Flashの37.7%を上回っています。また、モデルの最初の音声再生時間は1.25秒から0.70秒へと短縮され、応答速度がさらに向上しました。

QQ20260730-105746.jpg

音声転記に関しては、xAIは24種類の言語の大量の音声セグメントをテストしました。公式データによると、Deepgram Nova3やElevenLabs Scribe v2と比較して、Think Fast2.0の転記精度は約1.5〜2倍向上しており、前世代モデルと比較して約1.4倍の精度向上となっています。背景ノイズや電話圧縮などの複雑な環境では、両者の違いは約10倍にまで広がるとされています。

技術面では、Think Fast2.0は音声並列推論をサポートし、待機時間を短縮することで複雑なタスク処理効率を向上させます。前世代モデルと比較して、推論マーカー使用量の中間値は0.4回に低下し、これにより通常はエージェントが最初の文を返信する前にツール呼び出しが行われます。同時に、強化学習によってモデルの会話戦略が最適化され、より短い回答、一度に一つの問題を処理し、不要な情報の出力を減らす傾向を持つようになり、複雑なワークフローへのサポートが向上しています。

xAIは今回のアップグレードは、実際の業務シナリオにおける音声エージェントの信頼性向上に主に焦点を当てていると述べています。現在、Grok VoiceはStarlinkの電話サービスでA/Bテストが行われており、売上転換率とカスタマーサービスの効率が向上しています。

計画によれば、2026年8月5日には、grok-voice-latestの別名が自動的にgrok-voice-think-fast-1.0からgrok-voice-think-fast-2.0に切り替えられます。旧バージョンを引き続き使用したい開発者は、1.0バージョンの識別子を事前にロックする必要があります。他のユーザーは追加操作は必要ありません。

AIエージェントがカスタマーサービス、販売、オフィスなど実際のシナリオに徐々に入っていく中、低遅延、高精度、マルチツール協働の音声モデルは、次の段階のスマートインタラクションの重要な基盤となるでしょう。