在嘈雜的人羣中精準鎖定並聽清某個人的聲音,人類的聽覺系統能夠輕而易舉地做到這一點,但對於傳統的自動語音識別(ASR)模型來說,多人同時講話的“雞尾酒會難題”卻長期是一個未被徹底攻克的行業痛點。爲了解決這一長期困擾業界的難題,小米近日正式開源了工業級目標說話人語音識別大模型 CocktailASR-1。

該模型徹底改變了傳統語音識別的任務輸入方式,採用基於參考聲紋的目標說話人識別機制。用戶只需提供一段參考音頻,模型便會利用聲紋嵌入精準定位目標說話人,在多人混合音頻中只轉錄該特定人物的語音,而其他人說話的內容、混響以及背景噪聲均會被自動過濾,從而將複雜的混合音頻任務轉化爲高效的目標說話人識別。

image.png

在底層架構設計上,CocktailASR-1採用了一個端到端的大語言模型架構,具體由 D2V2音頻編碼器、Adapter 以及大模型解碼器串聯組成,且所有權重均整合在同一個檢查點中。在實際使用時,輸入格式爲將參考音頻與目標單聲道音頻進行拼接,中間插入一秒靜音作爲分隔。這種設計讓模型具備極高的通用性,無論是單人還是複雜的多元場景,無需切換模型即可一氣呵成。

多項基準測試數據驗證了該模型的強悍實力。在模擬多說話人測試中,其在 LibriMix2mix 和 LibriSpeechMix2mix 數據集上的字錯率(WER)分別壓低至4.11% 和2.90%。相比之下,同賽道的多款知名模型在混合場景下表現全軍覆沒,例如在 LibriMix3mix 測試中,部分競品的字錯率高達76% 到121% 不等,而 CocktailASR-1的字錯率僅爲12.29%,展現出了顛覆性的降維打擊優勢。即便是面對更具挑戰的真實會議錄製場景,如 AMI SDM 和 AliMeeting Far,該模型也大幅領先現有的各類解決方案。而在單人場景下,其在 LibriSpeech、WenetSpeech 以及 CommonVoice-zh 等數據集上也實現了全面超越。

除了突破性的識別精度外,該模型在工程落地和實用性方面還具備兩大亮點功能。首先是強大的負樣本拒識能力。當參考音頻對應的人並不參與當前對話時,模型能夠直接輸出空文本,從而有效防止智能音箱、車載語音助手等智能設備被旁人的聲音誤觸發。測試顯示其在多個數據集上的負樣本拒識率表現優異。其次,模型支持思維鏈推理功能,能夠在輸出最終答案前通過特定的標籤展示其判斷說話人的推理過程,雖然該功能對精度影響極小,但極大提升了系統的可解釋性與調試便利性。

目前,CocktailASR-1的相關代碼已在 GitHub 按照 Apache2.0協議正式開源,且具備極簡的依賴環境,僅需 torch、torchaudio、transformers 和 soundfile 等基礎庫即可輕鬆從 HuggingFace 加載並部署使用。小米此次在語音技術底層邏輯上的全新轉向,標誌着語音識別正從傳統的“捕獲所有聲音”正式邁向聚焦於“鎖定一個聲音”的全新發展階段。