本日、AI企業のMiniMaxは汎用的なマルチモーダル生成モデル「MiniMax H3」を正式に発表しました。このモデルは初めてテキスト、画像、動画、音声の統一的な理解と生成を実現し、長年にわたって動画生成分野でタスクやモダリティが分断されていた状況を打ち破り、マルチモーダル生成モデルが「専門家」から「汎用的なアシスタント」へと進化する上で重要な一歩を踏み出しました。

公式によると、H3はネイティブなステレオサウンドとビデオ出力をサポートしており、最大で15秒間の2K解像度のコンテンツを生成可能です。初期テストでは、H3は指示に従う能力、ブランド情報の表示、V2V動作の移行などのシナリオにおいて商用レベルの安定性を示しており、広告、EC、ゲーム、UIデザインなど多くの商業分野への応用が可能となっています。

QQ20260731-094430.jpg

技術面では、H3はContextual Omni Representation(文脈的マルチモーダル表現)技術を導入し、自然言語をさまざまなモダリティをつなぐ共通のブリッジとして活用しています。ユーザーは複雑な関係を言葉で説明するだけで、例えば「あるビデオのヒッチコック風のカメラワークを参考にし、指定された画像の人間が特定のオーディオの歌を歌わせる」といったような指示を出すことで、モデルは自動的に全プロセスの理解と生成を行います。自社開発したH3-VAEおよびIn-context Regeneration技術と組み合わせることで、H3は2K解像度での1秒あたりの生成コストが主流モデルの1/3未満、768P解像度では1/2未満となり、業界で現在知られている最適なコストパフォーマンスのソリューションを提供しています。

注目すべきは、MiniMaxが今後数日以内に、関連する法規制に合致した条件下でH3のモデル重みをオープンソース化することを発表したことです。これは国内の動画生成大規模モデルが初めてコミュニティ向けに重みを公開するものであり、オープンソースエコシステムの構築を促進し、国内チップの適合性を加速することを目的としています。H3は設計当初から複数の国内チップとの互換性を考慮しており、そのオープンソース化により、国内企業がマルチモーダルAIアプリケーションにかかる技術的ハードルをさらに下げることになります。

MiniMax側は、H3は現在画面の精細さやモデルの規模において改善の余地があると述べており、今後HシリーズとMシリーズのモデル機能を統合し、Scalingを通じてモデルの上限を継続的に拡張していく予定です。

業界の分析では、H3の発表とオープンソース化は、閉鎖型モデルが長年主導していた動画生成分野の構造を変える可能性があり、マルチモーダルAIの一般化へのスピードを加速させるものとされています。