人工知能アシスタントのデスクトップでのインタラクティブな体験が新たな進展を遂げました。OpenAIは現地時間木曜日に、ChatGPTのデスクトップアプリケーションに重要なアップデートを実施し、ChatGPT Voiceのサポートを正式にリリースしました。この新しい機能により、ユーザーは直接音声でChatGPTと会話でき、AIエージェントをパソコン上で独立してさまざまな複雑なタスクを実行できるようになります。
この新機能は、今月初めにOpenAIが新たにリリースしたチャットGPT・ライブという新しい音声モデルシリーズに基づいています。ChatGPT Voiceは現在、ChatGPT WorkおよびCodexを全面的にサポートしており、強力なコンピュータ操作能力を持ち、ユーザーがさまざまなウェブサイトやアプリケーションへのアクセスをスムーズに行えるようにします。特にmacOSシステムでは、Appshots機能と組み合わせて、ユーザーはAIに画面全体および代替テキスト(alt-text)へのアクセスを許可することさえできます。
これまで主にスムーズな会話体験と中断処理の最適化に焦点を当てていたモバイル端末用の音声機能とは異なり、今回のデスクトップ端末のアップデートは実行能力において質的な飛躍を遂げています。ユーザーは単純な音声コマンドで複数ステップからなる複合命令を下すことができ、ChatGPTが情報の補足や2度目の確認を必要とする際に、適切に対応できます。公式に公開されたデモンストレーションでは、開発者が1つの音声コマンドでAIに新しいコードスレッドを作成させ、Pull Requestを提出し、バグの根本原因を迅速に特定するのに成功した例がありました。さらに、OpenAIはiOSアプリのリモートアクセス機能を通じて、Codex内でChatGPT Voiceを呼び出すことも可能であることを明らかにしています。
一方で、業界の競合企業も同時に音声インターフェースの分野に注力を強めています。Anthropicも自社のClaudeに対して新しい音声モードをリリースしており、Gmail、Calendar、Slack、Notion、Canvaなどの主要なオフィスアプリケーションで、Opus、Sonnet、Haikuモデルを呼び出してさまざまな日常的な業務タスクを効率的に処理できるようにしています。
