7月23日,德國人工智能初創公司黑森林實驗室(Black Forest Labs)正式發佈多模態基礎模型Flux3,標誌着生成式視頻技術迎來重大突破。該模型基於Self-Flow架構打造,配備專用的圖像、視頻、音頻及動作編解碼器,實現了對物理與數字環境的統一理解與生成。

作爲首款支持原生音頻生成的模型,Flux3可一次性輸出長達20秒的音視頻同步片段,並涵蓋文本/圖像/視頻轉視頻、基於關鍵幀的轉場及多語言對話等功能。在720p分辨率、10秒片段的早期測試中,Flux3展現出強勁競爭力,性能超越Luma Ray3.2(93%勝率)與Runway Gen-4.5(77%勝率),並在與Seedance2.0及Gemini Omni Flash等頂尖模型的對標中保持微弱優勢。
此外,公司聯合Mimic Robotics開發了適用於機器人領域的視頻動作模型Flux-mimic,目前已在奧迪工廠開展生產任務測試。BFL採取分階段推出策略,Flux3Video現已上線,Flux3Image與開源權重的“Flux3Dev”也將在近期陸續發佈。通過打破單一模態的信息侷限,Flux3正加速推動AI向具備感知與行動能力的物理世界“世界模型”演進。
