ドイツの人工知能スタートアップ企業であるブラックフォレストラボ(Black Forest Labs)は、マルチモーダルベースモデル「Flux3」を正式に発表しました。このモデルはSelf-Flowアーキテクチャに基づいて構築されており、専用の画像、動画、音声、およびアクションコーデックを備え、物理的世界とデジタル環境における統一された理解と生成を実現しています。
最も注目すべき点は、音声と映像の同期です。Flux3は、最初にネイティブな音声生成をサポートするマルチモーダルモデルであり、一度に最大20秒の音声と映像が同期したセグメントを出力できます。この能力は、テキスト、画像、動画から動画への変換、キーフレームに基づくトランジション、および複数のキャラクターによる会話などをカバーしています。このようなモデルにとって、「聞こえる」と「見える」を一つの基盤にまとめることは、単なる画像や動画の専門家ではなく、より広範な能力を持つことを意味します。

初期テストでは、720p解像度、10秒のセグメントで設定された状況において、Flux3はLuma Ray3.2を93%の勝率で下回り、Runway Gen-4.5に対しても77%の優位性を持ちました。さらに、Seedance2.0やGemini Omni Flashなどのトップモデルと比較しても、わずかな優位性を維持しています。
