Google は、ネイティブなエンドツーエンドの音声インタラクション分野で最新の突破を公式に発表し、新世代のリアルタイム音声大規模モデル「Gemini3.8Live」と、高難度のタスク向けにカスタマイズされた「Gemini3.8Live Extended Thinking」をリリースしました。これらのモデルは、Google のネイティブな音声技術体系において大きな飛躍を示しており、リアルタイムでの会話遅延と自然さを新たな高みに押し上げるだけでなく、低遅延の音声ストリームにおいて初めて深い複数ステップの推論能力を実現し、複雑な専門的なシナリオにおける音声AIの応用パターンを完全に変革しました。
従来の主流の音声インタラクションアーキテクチャでは、AIシステムは迅速な応答の浅層的な会話と時間がかかる深層的な思考の間に妥協を余儀なくされていました。高い難易度の質問にはユーザーが長時間の沈黙を耐えなければならない場合がありました。Googleが今回リリースした「Gemini3.8Live」は、高速な会話と日常的なストリーミング体験を最適化しています。より鋭いトーンの変化、自然な打ち切りと文脈理解の能力により、ユーザーに非常にスムーズで人間のような質感を持つリアルタイムの音声コミュニケーションを提供します。

そしてその上位バージョンとしてリリースされた「Gemini3.8Live Extended Thinking」は、高複雑性の業務フローに対して根本的なアップグレードを実施しています。このモデルは、AIに「話しながら考える」バックグラウンドの拡張推論能力を提供し、リアルタイムで一貫した会話を維持しつつ、後台で複雑な多段階のロジック分解やコードデバッグ、または技術診断を並行して実行できるようにし、困難な問題に遭遇した際に会話の流れを強制的に中断することなく対応できます。
実際の応用面において、新世代のLiveシリーズモデルは、音声アシスタントのサービス範囲を大幅に広げます。日常的な自然な会話だけでなく、「Gemini3.8Live」および拡張推論バージョンは、リアルタイムのステップデバッグ、複雑な数学的推論、リアルタイムの外国語同時指導、および複数タスクのストリーミングコマンド実行などの高知能要件のシナリオにおいて、これまでのバージョンよりも顕著な性能を発揮しており、多数のマルチモーダルおよび音声推論業界の基準評価テストで首位を記録しています。
開発者および企業向けユーザーに対して、Googleは関連するモデル機能が本日から公式APIおよび開発ワークステーションを通じて正式に公開されると発表しました。開発者は、この極めて低遅延なネイティブ音声インターフェースを直接呼び出すことができ、スマート家電、カスタマーサービス、リアルタイムプログラミング補助、および協働オフィスなどの製品形態において、次世代の双方向音声代理サービスを迅速に構築できます。
VIP会員