9月27日,英偉達正式發佈了擁有約1億參數的免費人工智能模型Nemotron3Diarization。該模型專注於語音分割聚類(Diarization)任務,開放了權重數據,能夠精準識別對話中任意時刻的說話者,支持最多8人同時發聲的實時及錄音音頻處理。

在技術突破與性能表現上,Nemotron3Diarization在嚴苛的VoiceArena語音分割基準測試(v1版本)中以14.72%的錯誤率(DER)登頂榜首,顯著優於排名第二的系統(19.3%)。相比其前代產品Streaming Sortformer,新模型在使用1.04秒音頻緩衝區的八個測試場景下,平均錯誤率大幅降低了41%。爲平衡系統延遲與準確率,該模型支持從0.32秒至30.4秒的四級動態音頻緩衝區設置。

QQ20260928-105735.jpg

在功能應用層面,新模型可與Parakeet等語音識別系統無縫協同,自動生成帶有匿名說話者標籤(如“speaker_2”)的文本。儘管在參與者增多、背景噪音過大或混響嚴重時錯誤率會相應上升,但其強大的底層架構已能有效應對重疊語音等傳統技術難點。

此次英偉達推出輕量級且免費的高精度語音分割模型,大幅降低了複雜語音分析的技術門檻。這一動作不僅爲實時會議記錄、智能客服與多角色語音交互等應用提供了極具性價比的底層支撐,也預示着多說話人識別技術在端側與實時商業場景下的落地將進一步提速。