Meta 推出 Muse Voice Transcribe,這是其首個實時音頻感知模型。開發者可通過 Meta Model API 調用該能力,定價爲每1000分鐘音頻3美元(約合20.2元人民幣),相當於每小時0.18美元。

邊說邊出字,20餘名說話者自動分軌
該模型在同一流程中整合了流式自動語音識別、說話人分離與端點檢測。所謂“流式”,就是邊說邊轉寫,模型不必等整段音頻說完纔出結果,而是一小段一小段持續輸出文字,延遲更低,適合實時聽寫、會議記錄、通話字幕等場景。用戶說話時,系統可同步輸出文字,無需等待完整錄音結束後再單獨處理。
Muse Voice Transcribe 可在包含20餘名說話者的錄音中分離不同發言者,還能識別說話是否結束,從而自動確定一段輸入的邊界。在語言支持上,模型訓練覆蓋70餘種語言,其中25種在發佈時完成驗證;支持長度超過1小時的音頻,也支持句內或句間的自然語言切換。開發者還可通過語言、關鍵詞和上下文偏置,提升特定語言、術語或場景下的識別效果。

自適應延遲機制平衡速度與準確率
爲了兼顧實時響應和識別準確度,Meta 引入了名爲“自適應延遲”(adaptive delay)的動態決策機制。系統不會對所有詞語採用固定的速度與準確度取捨,而是針對每個詞判斷需要額外接收多少音頻後再輸出識別結果:對於較容易識別的語音,系統會更快提交轉寫結果;而對於發音不清、術語較多或語境複雜的詞語,則調用更多前後文音頻信息來提升準確度。
Meta 方面表示,截至2026年9月1日,Muse Voice Transcribe 位列 Artificial Analysis 流式語音轉文本排行榜第1名。
VIP會員