テキスト大規模モデル分野で継続的な取り組みを進めた後、人工知能企業のMiniMaxはこのほど、新たなマルチモーダル生成モデルMiniMax H3を正式にリリースし、数日以内にモデルの重みを全面的にオープンソース化することを業界に約束しました。

マルチモーダルなコンテキスト入力をサポートする生成モデルとして、MiniMax H3はテキスト、画像、動画、音声の任意の組み合わせを入力として受け取ることができ、最終的にはネイティブなステレオ音声を備えた高解像度動画を出力します。実際の応用においては、ユーザーはモデルに参考となる動画、画像、または音声素材を提供し、自然言語による指示と組み合わせることで、複雑な視聴覚コンテンツ制作を一気に完了できます。

image.png

技術的なアーキテクチャにおいて、MiniMax H3は従来のマルチモーダルモデルがタスクごとに専門モデルに分割していた做法を完全に打ち破りました。開発チームはテキストから画像生成、テキストから動画生成、画像から動画生成、および音声処理などのさまざまなタスクをすべて同じ事前学習フレームワークに統合し、より簡潔なH3-Omni Transformerアーキテクチャを導入しました。これにより、エンドツーエンドのトレーニングスループットは約30%向上しました。また、Tokenizerを再構築することで得られたH3-VAEアーキテクチャにより、非常に高い圧縮率を実現し、高解像度での推論コストを効果的に低下させました。

価格とエコシステムの面では、MiniMax H3は2K解像度における秒単位の価格が主流の同種モデルの三分之一未満であり、設計当初から国内チップの互換性を十分に考慮しました。現在、このモデルは映画オープニング、ゲームUIアニメーション、ダイナミックポスター、広告ECなど様々なシナリオで広い応用可能性を示しており、テキストのレンダリングやブランド情報の提示の正確性も顕著に向上しています。