在目前的 AI 語音交互中,傳統的級聯式架構常常因爲語音轉文字、模型推理以及文字轉語音等步驟的串聯而產生明顯延遲。爲了徹底解決這一痛點,OpenAI 近日正式在 API 中推出了全新的全雙工語音模型 GPT-Live-1,將類人般的流暢語音交互體驗直接帶給廣大開發者。

傳統語音智能體在應對複雜的對話場景時,往往容易在停頓、打斷或轉換話題時顯得非常脆弱。而 GPT-Live-1採用單一模型同時處理輸入與輸出音頻,在架構設計上實現了顛覆性的簡化。它不僅支持即時響應打斷,還能將深層推理以及工具調用無縫委派給後端的文本模型,讓對話在後臺持續進行的同時保持高度的靈活性。

image.png

在實際性能表現和應用場景上,該模型帶來了多項核心優勢。首先是卓越的中斷處理能力,在早期測試中,語言學習平臺 Speak 發現它將思考停頓期間的中斷減少了近80%。其次,開發者可以通過系統提示詞來定製智能體的語氣、節奏與對話風格,並能完美處理背景噪聲和靜默上下文,非常適合用於電話客服、餐飲預訂以及長會話交互。在基準測試中,其搭配中等推理強度的 GPT-6Astra 後表現名列前茅。

目前,GPT-Live-1已在 API 中全面可用,前端語音層的定價爲每分鐘0.05美元。多位行業合作伙伴如 Yelp、Intercom 等均表示,該模型大幅提升了輪次切換的準確性,讓 AI 語音支持真正走出了走走停停的節奏,實現瞭如真人面對面般自然流暢的全新體驗。