OpenAIはこのほど、新しいモデルであるGPT-Live-1をAPIに導入することを正式に発表しました。このモデルは開発者に対して、リアルタイム音声アプリケーションおよび業務プロセスのための核心的なサポートを提供し、AI音声インタラクションが従来の「セグメント処理」から本格的な自然な会話へと進化していることを示しています。
技術的な構造において、GPT-Live-1は音声理解と音声出力を同じモデル内で深く統合しています。従来の「音声をテキストに変換し、大規模言語モデルで推論し、再び音声に変換する」という複数の接続障壁を打ち破り、システム遅延を大幅に低減しています。このモデルはフルデュープルックス対話に対応しており、システムが音声を出力しながらもユーザーの音声を聞くことができ、また会話中に中断や停止、背景ノイズなどの複雑な状況を正確に処理できます。

流れの良いインタラクティブ体験に加え、GPT-Live-1は機能拡張とシナリオへの適用において非常に高い柔軟性を示しています。開発者はシステムのヒントを使ってモデルのトーン、速度、会話スタイルを簡単に調整でき、バックエンドモデル、ツール、スマートエージェントフレームワークを設定できます。同時に、このモデルはネイティブな音声認識と書き起こし、返信テキストをサポートしており、アルファベットや数字の理解、キーワードのバイアス、ラウンド検出能力を持っています。Codexなどのツールと接続でき、OpenAI Presenceを通じて企業システムを照会したり、承認された操作を実行したり、必要に応じて人間に引き渡すことができる音声作業を構築できます。実際のアプリケーションでは、電話の場面にスムーズに組み込むことができ、レストランの予約やカスタマーサービスなどのフルデュープルックス音声スマートエージェントのタスクを担うことができます。
実際の応用における効果も顕著です。初期評価では、Speakという言語学習プラットフォームがGPT-Live-1を導入した後、学習者が思考の停止期間中に誤って中断される回数が、これまでのラウンドベースのシステムと比べてほぼ80%減少しました。医療サービスプラットフォームもこのモデルにより構造を簡略化し、コード量を大幅に削減しました。OpenAIが公開したテストでは、GPT-Live-1はFull Duplex BenchテストにおいてGPT-Realtime-2.1よりも30ポイント高いパフォーマンスを示し、GPT-6Astraの中程度の推論強度を使用してTau3エンドツーエンド音声スマートエージェントのテストでもトップになりました。
現在、GPT-Live-1はAPIで正式に利用可能となっており、フロントエンド音声層の料金は1分あたり0.05ドル(1時間あたり約3ドル)、バックエンドモデルおよびスマートエージェントツールの費用は別途計算されます。同時に、OpenAIはそのリアルタイム音声オプションをさらに拡張し、Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinderなど多くの新しいボイスを追加しました。今後数か月以内にさらなるボイスと言語のサポートを追加し、スマート音声エコシステムの普及を全面的に加速する予定です。
VIP会員