科大訊飛宣佈 Spark-Audio-1.0-Preview 上線,這是一款基於全國產化算力訓練的語音基座大模型。

過去,大模型處理音頻大多采用級聯方案:先把語音轉成文字,再交給大模型理解。這種做法有兩個明顯短板:一是信息丟失——文字只能記錄說了什麼,會丟掉語音裏自帶的語氣、情緒以及背景環境音等關鍵信息,導致模型對場景判斷不完整;二是鏈路割裂——語音轉寫、聲紋識別、語音翻譯等能力被拆成獨立模塊串聯運行,模塊之間存在斷點,容易累積錯誤,體驗上也會出現延遲、卡頓。

image.png

不再只做轉寫,而是直接“聽懂”語音

語音基座大模型不再只做語音轉文字,而是直接理解語音:一次性聽懂人聲、環境音、音樂等,還能理解聲音裏的語義、情緒和場景。

此次首發的 Spark-Audio-1.0-Preview 採用 0.65B(Dense 結構)的音頻編碼器,搭配 30B-A3B(MoE 結構)的大語言模型,使用了 1300 萬小時音頻以及大量文本數據,基於純國產算力集羣訓練完成。在同一個模型中可輸入文本和語音兩個模態,支持語音轉寫、多語言翻譯、多方言識別、環境音識別、說話人識別、情感分析以及複雜的音頻問答等任務,讓機器從“聽清”進一步走向“聽懂”。與訊飛星火大模型的“1+N”體系類似,在語音基座大模型上也可進行微調,開發語音識別、語音同傳、語音交互等專用模型或系統。

支持 99 種語言、202 種方言,複雜場景優勢明顯

官方稱,Spark-Audio-1.0-Preview 在各項語音評測任務上效果整體相當、部分超過,尤其在複雜場景高噪聲、小聲說等偏真實應用類任務上明顯領先;與尺寸更大的閉源語音基座模型相比,表現也十分接近。

該模型可支持 99 種語言及 202 種方言的識別。在多項任務中,與同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,在多語言、多方言語音識別的平均效果上表現出優勢;與尺寸高一個數量級的 Qwen3.5-omni-plus 效果接近。在 Fleurs、Kespeech、LibriSpeech 等中英文、多語言、多方言語音識別評測中,其得分高於 Gemini-3.1 Pro,並在 Fleurs 中文測試集中取得 SOTA。

訊飛也坦言,此次發佈的版本在通用知識、數學與代碼等任務上沒有出現明顯降智,但在指令遵循、對話、音頻理解等任務上仍有進步追趕空間,下一步將在鞏固優勢的同時補齊短板。目前,Spark-Audio-1.0-Preview 已正式開放體驗,API 後續將上線訊飛開放平臺。