8月3日、人工知能企業のMiniMaxは、新世代の汎用動画モデル「MiniMax H3」のオープンソース化を正式に発表しました。
このモデルは、テキスト、画像、動画、音声が混在するマルチモーダルなコンテキストを深く融合し理解できる、全モード生成システムです。これにより、従来の単一タスクの枠を超えて、非常に高いタスクの汎化能力を示しています。
H3は、4〜15秒の出力時間に対応し、24 FPSのフレームレートと32kHzのステレオサウンドを提供します。ユーザーは、21:9、16:9、4:3、1:1など、さまざまな一般的なアスペクト比を選択できます。また、短辺を768ピクセルに設定する通常モードで基本的な創作を行うことも可能です。さらに専用のH3-Regenerate-2Kオプションにより、最高で2K解像度の驚きの映像を出力することが可能です。多言語対応では、アラビア語、中国語、英語、フランス語・ドイツ語・イタリア語、日本語・韓国語、西語・ロシア語など、11種類の主要言語を安定してサポートしています。
多様なクリエイティブなシーンに適応するために、H3は柔軟なモデルバージョンと豊富な入力仕様を提供します。H3-Base-FL2VA(フリーフレームモード)は、0〜2枚の画像を入力としてサポートし、テキストから動画生成、最初のフレームから動画生成、最後のフレームから動画生成、および最初と最後のフレームを協働して生成するさまざまなタスクに自由に柔軟に対応できます。一方、H3-Base-Ref2VA(マルチモーダル参照モード)は、最大9枚の画像、3つの動画(合計15秒以内)、3つの音声を混合入力としてサポートし、ファイル総数は最大12個まで可能です。これは、プロのクリエイターにとって前例のない細密な制御手段を提供します。
システムアーキテクチャの下層設計において、完全なMiniMax H3は3つのコアモジュールから構成されています。まず、H3-Context-IR(コンテキスト中間表現)は、複雑な多様な指示を深く解析し、モデルが理解しやすい構造に変換するものです。これは高品質な出力を保証する重要な要素です。次に、H3-Baseモジュールは、768pの基本的な音声と動画を生成します。最後に、H3-Regenerate-2Kモジュールは、初期結果と元のコンテキストを戻すことで、2K超解像再構築を行います。この組み合わせにより、生き生きとした詳細を保持しつつ、視覚の忠実性を大幅に向上させます。
現在、このモデルはMiniMax H3 Community Licenseに基づいて正式に公開されており、関連する開発者や技術愛好家は
