OpenAI於近日正式宣佈將全新模型GPT-Live-1引入API,爲開發者打造全雙工實時語音應用及業務流程提供核心支撐。該模型的推出,標誌着AI語音交互正在從傳統的“分段式處理”向真正的自然對話演進。

在覈心技術架構上,GPT-Live-1實現了語音理解與語音輸出在同一模型中的深度整合。它打破了傳統模式中“語音轉文字、大語言模型推理、文字轉語音”的多次銜接壁壘,從而大幅降低了系統延遲。該模型全面支持全雙工對話,不僅能讓系統在輸出語音的同時依然聆聽用戶的聲音,還能在對話過程中精準處理打斷、停頓以及背景噪聲等複雜場景。

image.png

除了流暢的交互體驗,GPT-Live-1在功能擴展和場景落地上也展現出極高的靈活性。開發者可以通過系統提示詞輕鬆調整模型的語氣、語速和對話風格,並配置後端模型、工具及智能體框架。同時,該模型支持原生語音識別轉寫和回覆文本,具備字母數字理解、關鍵詞偏置及輪次檢測能力。它可以與Codex等工具連接,也可以通過OpenAI Presence開發能夠查詢企業系統、執行獲批操作並在必要時轉交人工的語音工作。在實際應用場景中,它能夠無縫切入電話場景,勝任餐廳預訂、客戶服務等全雙工語音智能體任務。

實際應用層面的成效同樣顯著。在早期評估中,語言學習平臺Speak接入GPT-Live-1後,學習者在思考停頓期間的誤打斷次數較此前基於輪次的系統減少了將近80%;醫療服務平臺也通過該模型精簡了架構,大幅削減了代碼量。在OpenAI公佈的評測中,GPT-Live-1在Full Duplex Bench測試中的表現比GPT-Realtime-2.1高出30個百分點,並在搭配GPT-6Astra中等推理強度時,在Tau3端到端語音智能體任務測試中榮登榜首。

目前,GPT-Live-1已正式在API中提供,其前端語音層的定價爲每分鐘0.05美元(按每小時計算約爲3美元),後端模型和智能體工具的費用另行計算。與此同時,OpenAI還進一步擴展了其實時語音選項,新增了Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等多款全新聲音,並計劃在未來數月內持續增加更多的語音和語言支持,全面加速智能語音生態的普及。