リアルタイムAI音声インタラクションの分野において、ハードウェアおよび技術の巨頭であるNVIDIA(ナビダス)は新たな突破を遂げました。会社は最近、自社初のオープンソースのエンドツーエンドの両方向音声対話モデル「NemotronLabs VoiceChat11B」を正式にリリースしました。これは、音声生成と理解の基盤的な構造において重要な一歩を踏み出したことを意味しています。
従来の分離型アーキテクチャでは、音声認識(ASR)、大規模言語モデル(LLM)、音声合成(TTS)を連続して使用する必要がありました。これに対して、このモデルは統一されたネットワークを通じてストリーミング音声の理解と生成を直接行います。この技術的手法は、複数のモデルを編成することによる煩雑な連携を完全に排除し、応答遅延を大幅に短縮します。実験データによると、その滑らかな切り替え遅延は448ミリ秒にまで低く、一方で聞くことと話すことの両方を同時にできる両方向の対話能力を備えています。ユーザーが途中から会話を挟んだ場合でも、インテリジェントなエージェントは迅速に話し合いの場を譲ることができ、非常に高い流れのよさを示しています。
注目すべき点として、このVoiceChat11Bは、対話が継続している間でもツール呼び出しをサポートする最初のオープンソースの両方向モデルです。このモデルは、独立した出力チャンネルと事前に設定された「保持」のフレーズメカニズムを独創的に導入しています。複雑な外部API要求を処理する際、システムはサイドチャンネルを通じてオペレーターが定義したトランジションフレーズを自動的にトリガーし、待機中に発生する可能性のある長時間の沈黙を効果的に防ぎます。これにより、音声知能エージェントの実用化がさらにスムーズになります。
