Google 正式公佈了其在原生端到端語音交互領域的最新突破,推出全新一代實時語音大模型 Gemini3.8Live 以及針對高難度任務定製的 Gemini3.8Live Extended Thinking。這兩款模型代表了 Google 原生音頻對音頻技術體系的重大跨越,不僅將實時對話延遲與自然度推向全新高度,更首次在低延遲語音流中實現了深層多步推理能力,徹底改變了語音人工智能在複雜專業場景下的應用範式。

在以往的主流語音交互架構中,人工智能系統通常需要在快速響應的淺層對話與耗時較長的深度思考之間做出妥協,面對高難度問題往往需要用戶忍受長時間的靜默等待。Google 此次推出的 Gemini3.8Live 着重優化了極速對話與日常流式交互體驗,能夠以更敏銳的語調起伏、自然打斷與上下文理解能力,爲用戶提供極其流暢且具備人類級質感的實時語音交流。

image.png

而在其基礎上推出的 Gemini3.8Live Extended Thinking,則針對高複雜度業務流進行了根本性升級。該模型賦予了人工智能“邊說邊想”的後臺擴展推理能力,使系統在維持實時連貫對話的同時,於後臺併發執行復雜的多步驟邏輯拆解、代碼排錯或技術診斷,無需在遇到困難問題時生硬中斷對話節奏。

在實際應用落地方面,新一代 Live 系列模型將大幅拓寬語音助手的服務邊界。除了日常的自然交談外,Gemini3.8Live 及擴展推理版本在實時步驟排錯、複雜數理推導、實時外語同聲輔導以及多任務流式指令執行等高智力需求場景中展現出了顯著優於以往版本的表現,在多項多模態與語音推理行業基準評測中位居榜首。

對於開發者與企業級用戶,Google 宣佈相關模型能力即日起通過官方 API 及開發工作臺正式開放接入。開發者可直接調用這一極低延遲的原生音頻接口,在智能硬件、客戶服務、實時編程輔助及協同辦公等產品形態中快速構建具備高階推理能力的下一代全雙工語音代理服務。