德國人工智能初創公司黑森林實驗室(Black Forest Labs)正式發佈多模態基礎模型 Flux3。它基於 Self-Flow 架構打造,配備專用的圖像、視頻、音頻及動作編解碼器,把對物理世界與數字環境的統一理解與生成攬到了一起。
最扎眼的一點是音視頻同步。Flux3是首個支持原生音頻生成的多模態模型,一次就能吐出長達20秒的音視頻同步片段,能力覆蓋文本、圖像、視頻轉視頻,基於關鍵幀的轉場,以及多角色對話等。對一支模型來說,把"聽得見"和"看得見"捏成同一套底座,意味着它不再只是圖像或視頻的單科選手。

早期測試裏,在720p 分辨率、10秒片段的設置下,Flux3把 Luma Ray3.2按93% 的勝率壓了下去,對 Runway Gen-4.5也有77% 的勝率優勢;即便擺到 Seedance2.0與 Gemini Omni Flash 這類頂尖模型面前,它仍守住了微弱上風。
動作也被它伸進了現實。黑森林實驗室聯合 Mimic Robotics 開發了面向機器人領域的動作模型 Flux-mimic,目前已在奧迪工廠跑起了生產任務測試——多模態能力從屏幕裏走到了產線上。發佈節奏上,BFL 選擇分階段推進:Flux3Video 已經先上線,Flux3Image 與帶開源權重的 "Flux3Dev" 也將在近期陸續放出。
