阿里千問今天推出了同聲傳譯大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架構把實時同傳從頭重構了一遍,準確度、流暢度和簡潔度一起往上擡,字均延遲(LAAL)從2.8秒降到2.3秒——對同傳這種"慢一秒就跟不上講話人"的場景來說,這0.5秒的壓縮直接決定了聽感是否自然。

在已經支持60種語言的基礎上,新模型又補了三塊讓同傳真正能落地的拼圖。第一是實時說話人分離,每句話歸到對應的人頭上,音色復刻也更穩,不會再出現甲乙不分、聲音串味;第二是原文譯文同幀同出,雙語同屏顯示,聽的人能邊聽邊對;第三是長上下文消歧,模型會聯繫前文來讀懂當下,人名、術語這類最容易翻錯的地方精準度明顯提升。

image.png

底子上是基於 Hybrid MoE 的 Thinker–Talker 雙模塊設計,靠 Interleave 把流式理解、文本輸出和語音生成串成一條線。Thinker 把視頻、音頻、原文和譯文編排進同一條因果序列,按時序交替排列、端到端產出,讓"聽懂"和"譯出"在同一個序列裏完成;Talker 再拿着譯文和源音頻,把譯文合成爲保留原說話人音色的語音——也就是說,翻譯出來的聲音還是那個講話人的聲音。

image.png

在覆蓋14個語向的多說話人長音頻評測集 Omnilingua-MSpeaker 上,它在翻譯忠實度、流暢度、簡潔度以及說話人分離錯誤率(DER)四個維度上,全都壓過了當前行業主流的實時同傳系統;公開 FLEURS 測試集上跑的70個語言方向裏,它在翻譯質量、字均延遲、語音識別準確率和語音合成質量四項上同樣領先上一代和主流系統。目前嚐鮮體驗入口和模型 API 都已開放,同傳這個長期被專業譯員把守的高門檻場景,正被大模型一步步推成人人可用的基礎設施。