在實時人工智能語音交互賽道上,硬件與技術巨頭英偉達(NVIDIA)迎來全新突破。公司近日正式推出了旗下首款開源端到端全雙工語音對話模型NemotronLabs VoiceChat11B,標誌着其在語音生成與理解的底層架構上邁出了重要一步。

與以往需要串聯語音識別(ASR)、大語言模型(LLM)以及語音合成(TTS)的傳統分步架構不同,該模型通過一個統一的網絡直接完成流式語音理解與生成。這一技術路徑不僅徹底消除了多模型編排帶來的繁瑣交接,還大幅壓縮了響應延遲。實測數據顯示,其平滑輪換延遲低至448毫秒,且具備邊聽邊說的全雙工交互能力。當用戶在中途插話時,智能體能夠迅速讓出話語權,展現出極高的流暢度。

值得一提的是,作爲首個在對話持續進行時支持工具調用的開源全雙工模型,VoiceChat11B 創新性地引入了獨立的輸出通道與預置的“保持”話術機制。在處理複雜的外部 API 請求時,系統可以通過側通道自動觸發操作員定義的過渡臺詞,有效避免了等待期間可能出現的長時間靜默,讓語音智能體的工程化落地變得更加順暢。

不過,從實際部署角度來看,該模型目前仍處於試點階段。由於其需要單張至少配備80GB 顯存的高性能 GPU 才能高效運行,且官方將其標註爲“僅限研究用途”,目前尚未提供成熟的託管 API。業內人士指出,儘管在長上下文及多輪對話的極端場景下仍存在一些侷限性,但其開放的權重與容器設計,依然爲聯絡中心、汽車座艙、零售點餐以及智能無障礙輔助等領域的開發者提供了全新的探索方向。