京東宣佈開源自研實時流式視頻編輯模型 JoyAI-Video-Edit,用戶可以一邊觀看視頻一邊修改人物與場景,讓視頻創作從"先有素材再修改"變爲可實時互動編輯。京東官方表示,在流式實時視頻編輯方向,該模型對比當前業內代表性模型各項指標全面領先,達到世界一流水平。

image.png

視頻實時編輯首先要解決速度問題。視頻由一幀幀連續畫面組成,如果模型處理速度跟不上播放速度,就會出現卡頓與延遲。JoyAI-Video-Edit 基於全自研 JoyAI-Video 模型,在 720P 分辨率下實現每秒 30 幀的模型推理速度,能夠在保持較高畫面清晰度的同時跟上常見影視視頻的播放節奏。

視頻長度也是流式編輯的一道門檻。此前流式編輯模型只能處理幾秒或分鐘級片段,而 JoyAI-Video-Edit 支持任意時長的穩定流式編輯,可以隨着視頻持續播放、持續處理。用戶不必等待整段視頻生成完成,就能在播放過程中實時修改場景、替換物體、調整人物形象或改變畫面風格,實現"邊觀看邊創作"。

權威評測全面登頂,四類編輯任務優勢突出

爲評估模型能力,研究團隊將 JoyAI-Video-Edit 與 SANA Streaming、LiveEdit、Xmax-X2.0 等國際代表性流式視頻編輯模型進行對比。結果顯示,在覆蓋典型視頻編輯場景的評測數據中,JoyAI-Video-Edit 整體效果全面領先。

在業界權威的 OpenVE-Bench 通用評測中,該模型超越了目前所有的流式編輯方法,在全局風格、局部替換、局部刪除和字幕編輯等任務中優勢尤其突出,大幅領先行業同類模型。具體應用場景上,創作者可以讓視頻中的人物連續更換服裝,在直播中把普通街道變成動畫世界,也可以在家裝設計中嘗試不同的傢俱、牆面和燈光效果。

不止視頻創作,還能爲機器人"量產"訓練數據

值得關注的是,JoyAI-Video-Edit 還爲具身智能數據大規模合成提供了新的技術路徑。機器人訓練需要大量物體抓取、搬運與操作視頻,但真機數據採集成本較高,危險或少見場景也難以反覆採集。

依託對場景、物體與畫面內容的可控編輯能力,JoyAI-Video-Edit 可將人手操作視頻轉化爲機械手或機械臂操作素材,並在保留物體位置、空間關係與動作軌跡的基礎上,替換場景、物體與機器人形態,讓一段視頻擴展出更多訓練樣本。從視頻創作到機器人訓練數據合成,這款模型的開源或將爲多個賽道同時打開新的想象空間。