グーグルは最近、Gemini Liveに新たな音声機能のアップデートをリリースし、ユーザーが自然な音声コマンドを使ってチャットやSpark、毎日のニュースなどの機能を呼び出し、情報処理やタスクの実行などの操作を行うことを試みています。グーグルは、アップデート後のGeminiアプリがユーザーのニーズを自動的に理解し、ユーザーが具体的なタスクに対してどの機能を使用すべきかを判断する必要がないと述べています。

グーグルの大規模モデルGemini

ただし、この設計は現在のAIアプリケーションが直面しているインタラクションの課題を露呈しています。グーグルが音声インターフェースを通じて操作を簡略化しようとしても、Geminiではチャット、Spark、毎日のニュースを独立した機能として表示し、それぞれが異なるアイコンと入口を持ち、ユーザーにとっての理解と選択のコストを増加させています。

その中で、毎日のニュースはGmailやカレンダーなどのグーグルエコシステムのデータを基盤として、ユーザーにプロアクティブなカスタマイズされた更新を提供していますが、その情報選別能力にはまだ不足があり、一部の通知がユーザーにとって現在必要ではない可能性があります。一方で、タスク実行能力を持つAIエージェントであるSparkは、将来的なAIアシスタントの方向性に近づいていますが、グーグルがそれを独立ブランド化したため、ユーザーはそれぞれの機能の違いをさらに理解する必要があります。

この問題はGeminiに特有ではありません。現在のAI業界では、内部モデル構造や機能モードを直接ユーザーに暴露する問題が一般的です。例えば、一部のAI製品ではユーザーがチャット、協力、エージェントなどの異なるモードを区別する必要がありますが、消費者は統一されたインターフェースから要望を提出し、AIが適切な能力を自動的に判断して呼び出すことを望んでいます。