MiniMax は今日、音楽生成モデル「MiniMax-Music3」をリリースしました。歌詞と音楽の説明を入力するだけで、最大5分間の完全な曲を作成でき、出力形式は32kHz、16ビットステレオWAVファイルです。
この機能を支えるのは、階層的な自己回帰アーキテクチャで、2つのモデルがそれぞれ役割を担い、上下関係で協力しています。グローバルLLM(Global LLM)はパラメータ数8Bで、フレームごとに最初のRVQコードブックを予測し、曲の長期的な意味と構造の変化を専門的にモデル化しています。これはQwen3-8Bから初期化されており、トレーニングではまず埋め込み層と出力層を音楽的な語彙に適応させ、その後、ローカルモデルと共にすべてのコードブックを統合してモデル化します。ローカルLLM(Local LLM)はパラメータ数0.6Bで、各フレームにおける他の音響コードブックを予測し、細かい音響情報を少しずつ補完します。大きなモデルが構造の骨格を担当し、小さなモデルが音声の血肉を補うというように、役割分担が非常に明確です。

公式によると、このモデルは長時間の音声において、音楽のテーマ、リズム、ボーカルの特徴、編曲の進行を安定して守ることができ、イントロ、サビ、プリサビ、サビ、ブリッジ、インストゥルメンタルパート、エンドなど、すべての構造を欠かさず表現できます。公式はGitHub上にモデルのページを公開しており、試聴用の生成された曲の例も提供しています。
