阿里巴巴正式發佈語音識別大模型 Qwen-Audio-3.0-ASR-Flash,核心目標很直接——讓 AI 精準聽懂專業詞彙。模型在上下文一致性、行業詞識別和熱詞定製化三個維度做了系統性優化,同時具備語音潤色能力,可直接輸出結構化文本。

研究團隊持續從醫療、IT 編程、股票、社會名人等領域挖掘專業詞彙,建成了覆蓋多行業的高質量詞庫。在最新行業詞彙內部評測中,新模型對各行業專業詞的"聽中率"均有明顯提升,其中醫療場景更是突破了 95.36%。
三個版本覆蓋五大場景,已拿全球第一
Qwen-Audio-ASR-Flash 系列已在會議紀要整理、實時字幕、教育錄播、智能客服等場景中得到驗證,此前曾在 AI 評測平臺 Artificial Analysis 上以 1.7% 的錯字率拿下全球第一。這意味着在真實的辦公和教育環境中,AI 語音轉文字的準確度已經摸到了可用性的天花板。
目前該模型已通過阿里雲百鍊平臺開放調用,提供三個版本:實時語音識別最長 5 分鐘的 Flash 版、離線文件轉寫的 Filetrans 版,以及實時語音識別 Streaming 版。當 AI 不僅"能聽",還能聽懂你行業裏那些拗口的專業術語,語音交互的最後一公里,或許就快跑通了。
