ステップスターランの今日、StepAudio3シリーズモデルが正式にリリースされました。StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3GenおよびStepAudio3Musicの5つのモデルがすべてステップスターランオープンプラットフォームで利用可能となっており、そのうちのいくつかのモデルはArtificial Analysisランキングで世界第1位を獲得しています。このシリーズは、人間のような音声生成、完全なオーディオ生成、リアルタイムでの音声インタラクション、複雑な音声理解および音楽創作などのシナリオをカバーしています。

その中でも、StepAudio3Realtimeはネイティブなフルダプルックスのリアルタイム会話に対応しており、意味、トーン、感情、副言語、環境音を同時に理解できます。また、推論と音声生成を並行して実行でき、ツールコールや長時間のタスクの非同期実行にも対応しています。Artificial Analysis Conversational Dynamicsランキングにおいて総合スコアは98.9%で世界第1位、音声推論の正確率は99.7%で同じく世界第1位です。
StepAudio3ASRは音声認識と大規模モデルの文脈理解能力を統合し、中国語、英語、地方言、中英混合、長時間の音声、医療、法律、金融など専門的なシナリオをサポートしています。WER(誤り率)は1.7%で、世界第1位です。一方、StepAudio3TTSは発音、トーン、テンポ、休符、笑い、逡巡、つっかえなどの副言語表現を強化し、ストリーミング生成をサポートし、リアルタイム音声インタラクション向けとなっています。

さらに、StepAudio3Genはキャラクターの声、効果音、環境音、背景音楽を統一して生成でき、複数のキャラクターおよび音声のタイミング制御をサポートします。StepAudio3Musicは曲の作成、カラオケの伴奏、カバー、ABC記譜法に基づいた複数ラウンドの作業をサポートし、自然言語によってジャンル、メロディー、テンポ、楽器、感情を制御できます。全体的に見れば、StepAudio3は音声モデルの能力を単なる識別や生成から、完全なオーディオコンテンツの生産とリアルタイムのスマートなインタラクションへと拡張しています。
VIP会員