グーグルは最近、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingをリリースしました。新たに近似リアルタイムの推論や音声と思考の同時処理、バックグラウンドでのツールおよびAPI呼び出し機能が追加されました。現在、これらのモデルは順次Gemini APIやGoogle AI Studioなどの開発者プラットフォームに登場しており、それぞれSearch Live、Gemini EnterpriseおよびGoogle Workspace、Gemini Liveなどのシナリオをカバーしています。

この2つのモデルの核心的な能力の一つは、継続的な音声会話中にバックグラウンドでツールやAPIを実行することを可能にし、ユーザーがネットワーク検索やタスク実行のために会話を一時停止する必要がないようにすることです。モデルは97言語の自動認識および会話中の言語変更、近似リアルタイムのビジュアルポジショニングをサポートし、長時間の思考タスクにおいて「ちょっと確認してみます…」などの言葉を使ってユーザーに現在の状態を知らせることが可能です。
性能に関しては、Gemini 3.8 Live Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで82.6点を獲得しました。また、Gemini 3.8 LiveはSpeech Agent Arenaで第2位となりました。Extended ThinkingバージョンはT-Voiceテストで68.6%、Sierra T-Voiceベンチマークでは35.1%、Big Bench Audioテストでは97.7%を記録しました。
さらに、グーグルはAgora、LiveKit、Vercel、Pipecat、Fishjam、Vision Agentsなどのプラットフォームと提携し、新モデルの統合を容易にしています。また、グーグルは両モデルによって生成されたすべての音声に不可視のSynthIDウォーターマークが埋め込まれており、AIによって生成された音声を識別するために使用されていると述べています。
今回のアップデートにより、リアルタイムの音声インタラクションは「聞くことと話すこと」から理解、推論、タスク実行へと拡張され、音声AIが継続的で多タスク対応のインテリジェントエージェント型のインターフェースへと進化しています。
VIP会員