ドイツのAIスタートアップであるブラックフォレストラボラトリが、マルチモーダル基礎モデル「Flux3」を正式に発表しました。このモデルはSelf-Flowアーキテクチャに基づいて構築されており、専用の画像、動画、音声、および動作コーデックを備え、物理的・デジタルな環境の統一的な理解と生成を実現しています。

image.png

LumaやRunwayを圧倒し、トップクラスのモデルと対等に

このFlux3は、最初にネイティブな音声生成をサポートするモデルとして、一度に20秒間の音声と映像が同期したセグメントを出力でき、テキスト/画像/動画から動画への変換、キーフレームに基づくトランジション、多言語での会話などの機能も含まれます。720p解像度、10秒間のセグメントでの初期テストでは、Flux3はLuma Ray3.2に対して93%の勝率で上回り、Runway Gen-4.5に対しては77%の勝率で圧倒しました。また、Seedance 2.0やGemini Omni Flashなどのトップクラスのモデルと比較してわずかな優位性を維持しています。

ロボット分野への進出、段階的に製品をリリースする戦略

同社はMimic Roboticsと共同で、ロボット向けの動画アクションモデル「Flux-mimic」を開発しました。現在、アウディ工場で生産作業のテストが行われており、AIの能力が純粋なデジタル世界から実体的な製造シーンへと拡大されています。BFLは段階的に製品をリリースする戦略を採用しており、Flux3 Videoはすでにリリースされ、Flux3 Imageとオープンソースモデルの「Flux3 Dev」も近日中に順次公開される予定です。