9月27日、NVIDIAは約1億パラメータを持つ無料の人工知能モデル「Nemotron3Diarization」を正式にリリースしました。このモデルは音声分割クラスタリング(Diarization)タスクに特化しており、重みデータを公開し、会話中の任意のタイミングでの発話者を正確に識別できます。最大8人同時発声のリアルタイムおよび録音音声処理をサポートしています。

技術的な突破と性能面では、「Nemotron3Diarization」は厳しいVoiceArena音声分割基準テスト(v1バージョン)で14.72%の誤り率(DER)を記録し、第2位のシステム(19.3%)を大きく上回りました。前モデルであるStreaming Sortformerと比較して、新しいモデルは1.04秒の音声バッファを使用した8つのテストシナリオで平均誤り率が41%大幅に低下しています。システムの遅延と精度のバランスを取るため、このモデルは0.32秒から30.4秒までの4段階の動的音声バッファ設定をサポートしています。

QQ20260928-105735.jpg

機能応用面では、この新しいモデルは「Parakeet」などの音声認識システムとシームレスに連携し、匿名の発話者ラベル(例:「speaker_2」)が付いたテキストを自動生成できます。参加者が増える、背景ノイズが大きくなる、または混雑している場合、誤り率は相対的に上昇しますが、その強力な下層アーキテクチャにより、重なる音声などの従来の技術的課題に対処する能力があります。

今回はNVIDIAが軽量で無料かつ高精度な音声分割モデルを提供することで、複雑な音声分析の技術的なハードルを大幅に下げました。この動きは、リアルタイム会議記録、スマートカスタマーサービス、多役割音声インタラクションなどのアプリケーションに対して非常にコストパフォーマンスの高い下層支援を提供するだけでなく、複数の話し手認識技術がエッジ側およびリアルタイムビジネスシーンでの実装がさらに加速されることを示唆しています。