現在のAI音声インタラクションにおいて、従来のカスケード型アーキテクチャは、音声をテキストに変換し、モデルの推論を行い、テキストを音声に戻すなどのステップが連続しているため、顕著な遅延が生じることがあります。この課題を根本的に解決するために、OpenAIは正式にAPIに新しいフルデュアルモードの音声モデル「GPT-Live-1」をリリースしました。このモデルは、開発者に人間のように滑らかな音声インタラクション体験を直接提供します。
従来の音声スマートエージェントは、複雑な会話シーンに対処する際、停止、中断、トピックの切り替えなどで非常に脆弱になる傾向があります。一方、GPT-Live-1は単一のモデルで入力と出力のオーディオを同時に処理し、アーキテクチャ設計において画期的な簡略化を実現しています。これは即時の応答中の中断をサポートし、深い推論やツール呼び出しを後方のテキストモデルにシームレスに委譲できるため、会話をバックグラウンドで継続しながらも高い柔軟性を保つことができます。
実際のパフォーマンスおよび応用シーンにおいて、このモデルは多数の核心的な利点をもたらしています。まず第一に、優れた中断処理能力があり、初期テストでは言語学習プラットフォーム「Speak」が、思考の停止中に中断される頻度を約80%減少させたことを確認しています。次に、開発者はシステムプロンプトを使ってスマートエージェントのトーン、テンポ、会話スタイルをカスタマイズでき、背景ノイズや静黙の文脈を完璧に処理できます。これは電話カスタマーサービス、飲食予約、長時間の会話インタラクションなどに非常に適しています。ベンチマークテストでは、中程度の推論強度を持つGPT-6 Astraとの組み合わせでトップクラスの結果を示しました。
現在、GPT-Live-1はAPIで全面的に利用可能であり、フロントエンドの音声層の料金は1分あたり0.05ドルです。YelpやIntercomなどの業界パートナーは、このモデルがループの切り替えの正確性を大幅に向上させ、AI音声サポートが以前のような止まり止まりのペースから脱却し、人と対面したような自然で滑らかな新時代の体験を実現したと述べています。
VIP会員