Black Forest Labsは、Early Access方式でFLUX3マルチモーダルベースモデルをリリースしました。このモデルは、画像、動画、音声を統合した一貫したアーキテクチャを採用し、連合学習を行います。このモデルは、Self-Flow(自己監督フローマッチング)学習フレームワークに基づいて拡張され、動画、画像、音声を同時にトレーニングしています。FLUX.1およびFLUX.2シリーズの基礎上に、さらにマルチモーダル生成と理解タスクへと拡張されています。

性能は全面的に優れている、ネイティブな音声同期出力
FLUX3は、一度の生成で最大20秒の動画を出力し、ネイティブな音声を添えることができます。テキストから動画生成、画像から動画生成、動画から動画生成、入力された動画と音声の継続、キーフレームから動画生成、多言語対話、複数のショットをつなげる等多种のクリエイティブモードをサポートしています。音声付きの10秒間の720p動画の人工評価において、FLUX3はGrok Imagine Videoに対して69%の勝率を記録し、Seedance 2.0およびGemini Omni Flashと比較してそれぞれ52%の勝率を示し、全体的な優位性を示しています。
画像能力が全面的に向上し、ロボット行動予測への進出
