OpenAI 近日宣佈,將目前用於 ChatGPT 語音功能的 GPT-Live-1 正式開放給開發者使用。開發者現在可以通過 API 把這一語音模型集成到自己的應用和業務流程中,構建能夠實時聽取用戶講話、同時進行迴應的全雙工語音助手。該模型的語音前端價格爲每分鐘 0.05 美元,後臺用於複雜推理的模型則需按相應模型價格另行計費。

image.png

邊聽邊說,打斷與停頓都能自然處理

GPT-Live-1 是 OpenAI 今年推出的新一代實時語音模型,最大特點是採用全雙工架構。傳統語音 AI 通常依次完成語音識別、語言模型推理和語音合成三個步驟,用戶說完話系統才能處理並生成回答;而 GPT-Live-1 能在聽取用戶講話的同時生成語音輸出,因此可更自然地處理打斷、停頓、附和以及快速的來回對話,還能判斷何時該繼續說話、暫停、傾聽或調用工具。

OpenAI 表示,這種架構明顯降低了語音交互延遲,解決了傳統流水線容易出現的銜接問題,開發者無需再自行協調多個獨立模型之間的複雜切換。測試中,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 個百分點,尤其在輪流發言延遲與交互行爲方面提升明顯;與 GPT-6 Astra 以中等推理強度配合時,在評估端到端語音智能體任務的 Tau3 測試中也取得第一名。

複雜推理交給後臺模型,成本可按需組合

GPT-Live-1 並不負責所有複雜推理。OpenAI 將負責實時聽說交互的語音模型與負責深度推理的後臺模型分離:當用戶提出需要搜索、複雜分析或較長任務的問題時,GPT-Live-1 會把工作交給後臺模型,同時繼續維持自然語音交流。開發者因此可按業務選擇後臺模型——簡單任務用更快更便宜的模型,複雜問題交給更強的推理模型。

應用方面,GPT-Live-1 原生支持電話場景,可用於餐廳預約、客戶支持等全雙工語音智能體。早期案例中,語言學習平臺 Speak 發現,相比此前基於輪次的系統,GPT-Live-1 使系統主動打斷學習者的情況減少接近 80%。模型還提供原生語音識別轉寫與響應文本,支持關鍵詞偏置、輪次檢測,並針對嘈雜環境做了優化;OpenAI 同時擴大了可用聲音,覆蓋更豐富的口音、方言和語言。開發者還可將 GPT-Live-1 與 Codex 等工具結合,由語音模型接收任務、後臺工具處理,再回到語音對話。