近日,阿里通義千問團隊正式發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,推動語音合成從“能說話”邁向“會表達”。其Plus版本已在全球權威榜單Artificial Analysis的Speech Arena中斬獲全球第一,綜合表現超越Gemini3.1TTS、ElevenLabs v3等主流模型。

QQ20260720-165510.jpg

本次發佈包含雙版本:Flash版主打實時交互,首包延遲約300ms,適配智能助手等低延時場景;Plus版聚焦高質量生成,自然度與音色還原度更優。

核心能力實現四大突破:

一是多語種與方言覆蓋升級,支持16種語言,Plus版在全部16種語言上的平均說話人相似度達82.75,位列行業第一;同時支持20種中文方言,避免“方言特色弱化”問題,更貼近母語者表達。

二是支持Free-style自然語言指令,無需專業標註,用“溫柔客服語氣”“帶貨主播風格”等自然語言即可精準生成對應語音。

三是細粒度標籤控制,支持[gasp]、[angry]等結構化標籤,可精確調控呼吸、笑聲等非語言細節,適配遊戲、有聲書等場景。

四是複雜聲學魯棒性強,即便參考音頻存在高噪聲、高混響,也能自動過濾雜音、保留音色,合成質量穩定。

配套精品音色庫覆蓋指令、方言、小語種等多類音色,支持48K高清音頻輸出(預計7月24日開放),單次合成最長支持3分鐘長文本。目前模型已在阿里雲百鍊平臺全面開放,開發者可接入體驗,共同探索語音交互新可能。

QQ20260720-170039.jpg