生數科技於9月15日正式發佈了全新的 Vidu S2視頻大模型系列。本次發佈的 Vidu S2包含兩個核心模型:面向持續交互數字角色生成的 Vidu S2-Avatar,以及面向輸入視頻流進行實時編輯的 Vidu S2-Editing。在此基礎之上,生數科技還進一步探索了面向 VR 頭顯的實時空間視頻生成與編輯能力。整個全鏈路研發由朱軍教授的博士生、生數科技流式視頻生成與推理負責人張金濤負責。

在模型特色方面,Vidu S2-Avatar 實現了從語音持續控制到更高交互自由度的跨越。用戶上傳一張角色圖片後,即可通過文本或語音與模型互動,模型不僅支持說話時的表情與姿態,還增強了舞蹈等大幅度動作的指令跟隨能力。更重要的是,該模型支持在視頻流進行中的任意時刻動態加入物品、服裝或背景參考圖,讓角色在互動中拿起杯子、換上指定服裝或進入新場景。同時,模型引入了視覺反饋機制,確保諸如“拿起杯子然後微笑”等連續動作與狀態保持的可靠性。此外,S2-Avatar 將實時輸出分辨率從上一代的540P 提升至720P。

image.png

Vidu S2-Editing 則專注於接收持續輸入的視頻流,並根據文本指令和可選參考圖進行實時編輯,讓畫面跟隨人物擡手、轉身或鏡頭移動自然變化。目前該模型主要支持四類任務:一是風格遷移,在保留人物輪廓、姿態和場景佈局的同時改變畫面筆觸與色彩;二是虛擬試穿,將參考服裝遷移到視頻人物身上,精準處理服裝邊界、材質紋理及肢體遮擋關係;三是人物替換,將參考角色的面部、髮型、服裝和外觀整體遷移至源視頻,同時保留原有姿態與運動;四是背景替換,根據參考圖更換環境並在人物持續運動時保持穩定的空間關係。

在空間視頻探索方面,Vidu S2將 Avatar 的實時輸出接入空間視頻轉換流程,生成同步的左右眼視圖;Editing 則支持先編輯普通單目視頻再轉換爲空間視頻,或直接編輯已有的空間視頻,且兩類模式均支持上述四類編輯任務,相關結果可流式傳輸至 VR 頭顯。

image.png

在底層技術選擇上,Vidu S2進行了多項關鍵技術創新。首先是提出了 Self-Replay Forcing(SRF)訓練方法,模型先生成較長的自生成軌跡,再從中採樣連續片段重新加噪並進行可傳播梯度的因果重放訓練,有效避免了小誤差累積導致的身份漂移或動作斷裂。其次在數據處理上,兼顧了舞蹈視頻的動作豐富度與畫面穩定性,並採用事件順序描述的視頻標註和偏好獎勵優化。同時,S2-Avatar 引入了 VLM 智能體作爲視覺反饋,用於檢查動作完成情況並調整後續提示詞。在性能與效率優化方面,採用輕量級單步 Refiner 恢復高分辨率細節,結合 TurboDiffusion 與 TurboServe 技術降低計算開銷,實現各模塊共享時間線調度。

在公開與專業評測中,Vidu S2展現了出色的綜合性能。在 StreamAV-Bench 評測中,S2-Avatar 在視覺與音頻質量、音畫對齊及主體背景一致性等9項指標上均取得最優。在視頻編輯方面,S2-Editing 在 OpenVE 與 RefVIE 聯合評測中取得4.26分,在 Sparkle-Bench 上各項指標均爲最優,並在 ViViD 虛擬試穿測試及多項專業人工偏好對比中大幅超越同類模型。

談及未來規劃,生數科技表示空間視頻目前仍處於固定視角探索階段,如何在頭顯中保持清晰畫質並進一步降低延遲、探索全景空間視頻將是接下來的核心攻堅方向。

體驗網址:https://vidu.com/vidu-stream