9月16日,科大訊飛發佈語音基座大模型 Spark-Audio-1.0-Preview。最扎眼的標籤是"全國產"——這個模型基於全國產化算力訓練而成,從底層就把供應鏈風險擋在了門外。

能力上,Spark-Audio-1.0-Preview 支持文本和語音兩個模態的輸入、以文本模態輸出,能接的活兒相當雜:語音轉寫、多語言翻譯、多方言識別只是基本功,環境音識別、說話人識別、情感分析以及複雜的音頻問答也都在射程之內。它一口氣覆蓋99種語言和202種方言識別,訊飛把這總結爲智能語音完成從"聽清"到"聽懂"的躍升——過去機器追求把聲波準確轉成文字,現在它要分辨是誰在說、語調裏藏着什麼情緒、背景裏有什麼聲音。

目前 Spark-Audio-1.0-Preview 已正式開放體驗,API 後續將上線訊飛開放平臺。