Google 正式公佈了其在原生端到端語音交互領域的最新突破,推出全新一代實時語音大模型 Gemini3.8Live 以及針對高難度任務定製的 Gemini3.8Live Extended Thinking。這兩款模型代表了 Google 原生音頻對音頻技術體系的重大跨越,不僅將實時對話延遲與自然度推向全新高度,更首次在低延遲語音流中實現了深層多步推理能力,徹底改變了語音人工智能在複雜專業場景下的應用範式。
在以往的主流語音交互架構中,人工智能系統通常需要在快速響應的淺層對話與耗時較長的深度思考之間做出妥協,面對高難度問題往往需要用戶忍受長時間的靜默等待。Google 此次推出的 Gemini3.8Live 着重優化了極速對話與日常流式交互體驗,能夠以更敏銳的語調起伏、自然打斷與上下文理解能力,爲用戶提供極其流暢且具備人類級質感的實時語音交流。

而在其基礎上推出的 Gemini3.8Live Extended Thinking,則針對高複雜度業務流進行了根本性升級。該模型賦予了
在實際應用落地方面,新一代 Live 系列模型將大幅拓寬語音助手的服務邊界。除了日常的自然交談外,Gemini3.8Live 及擴展推理版本在實時步驟排錯、複雜數理推導、實時外語同聲輔導以及多任務流式指令執行等高智力需求場景中展現出了顯著優於以往版本的表現,在多項多模態與語音推理行業基準評測中位居榜首。
對於開發者與
VIP會員