大模型廠商在語音賽道的軍備賽,又多了一名重量級選手。 7 月 20 日,千問正式發佈語音合成大模型Qwen-Audio-3.0-TTS,把說話這件事的控制權,從繁瑣的參數配置交還到了一句自然語言指令手裏。
這款新模型最鮮明的標籤是Free-style自然語言指令控制。過去要讓AI念出某種語氣、節奏或風格,往往得在後臺調一堆工程參數;如今用戶只需用日常語言描述想要的效果,模型就能照着指令把聲音合成出來,門檻被大幅削平。
更關鍵的是,千問爲不同場景準備了兩副面孔。面向實時交互的Flash版本,把首包延遲壓到了 300 毫秒級別,這個量級意味着對話裏的語音響應幾乎感覺不到停頓,足夠撐起實時問答、語音助手這類對延遲極度敏感的現場;面向高質量生成的Plus版本,則把火力集中在音質與表現力上,主攻有聲書、配音、內容創作等需要細膩聲音質感的任務。一條產品線,同時覆蓋了快和好兩條原本相互拉扯的需求曲線。
當自然語言成了控制語音的遙控器,千問這一步,把語音合成從工程活兒又往普通人的工具箱裏推進了一格。
