人工智能企業 xAI 近日宣佈推出新一代語音識別與生成模型Grok Voice Think Fast 2.0,並全面向開發者開放。該模型在智能水平、轉錄準確率、對話交互能力及工具調用效率等方面實現了顯著躍升,其官方定價爲每分鐘音頻 0.08 美元。

權威的 Artificial Analysis 語音識別基準測試中,Grok Voice Think Fast 2.0的綜合得分達到 82.9%,不僅超越了前代版本,也高於GPT-Realtime-2.1Gemini 3.1 Flash。同時,其智能體能力評分錄得 56.5%,在同類模型中處於領先地位。在響應速度上,該模型的首次音頻播放時間大幅縮短至 0.70 秒,交互體驗更加流暢。

在語音轉錄精度方面,官方測試表明,新模型在多語言環境下的轉錄準確率較上一代提升了約 1.4 倍,並在多國語言的大規模音頻測試中展現出強大實力。特別是在背景噪音干擾和電話壓縮等複雜現實場景中,其抗干擾能力與競品的差距被進一步拉大。

技術架構上,Grok Voice Think Fast 2.0引入了語音並行推理機制,大幅減少了系統等待時間。通過強化學習對對話策略的深度優化,模型能夠輸出更簡練的回答,確保單次處理單個核心問題,從而顯著提升了複雜任務中的工具調用效率。

目前,該技術已在實際業務場景中展開驗證,並在Starlink電話服務中完成了 A/B 測試,有效推動了銷售轉化率與客服響應效率的雙重提升。按照官方規劃,舊版本標識符計劃於 2026 年 8 月 5 日自動切換至全新版本。