字節跳動正式發佈 Seedance 2.5 視頻生成模型,將單次視頻生成時長從 15 秒翻倍提升至 30 秒。該模型將陸續上線即夢 AI 與豆包專業版,API 服務也將於近期接入火山方舟,面向影視、廣告、教育、工業製造乃至自動駕駛等多場景開放。

image.png

官方稱,Seedance 2.5 延續了統一的多模態音視頻聯合生成架構,核心突破在於長敘事能力、多模態參考和編輯能力的全面提升。簡單來說,AI 視頻不再只是生成一個零散片段,而是可以完成一段有起承轉合的完整創作。

30 秒內組織多鏡頭敘事,多輪延長保持一致

在官方展示的示例中,一段歌手一鏡到底登臺演出的片段完整呈現了敘事邏輯:鏡頭從紅色幕布縫隙推進至暖色後臺化妝間,年輕女歌手整理耳機,工作人員提醒登臺,隨後她穿過通道與舞伴互動、接過麥克風,最終登上舞臺——鏡頭拉遠至體育館全景,觀衆、燈牌、熒光棒和歡呼聲盡收眼底。模型可在 30 秒內組織鋪墊、推進、轉折、收尾等多個邏輯關聯的鏡頭。

多輪延長能力同樣驚豔——模型可在已有視頻基礎上繼續生成 30 秒,並保持人物主體、場景、畫面風格乃至聲音和音效的一致性。官方示例中小男孩抱着足球跑出地鐵車廂、男主追趕並最終抓住小男孩的連續動作一氣呵成,毫無跳脫感。

30 張圖、10 段視頻一起投喂,羣像敘事無壓力

Seedance 2.5 支持用戶單次輸入最多 30 張圖片、10 段視頻、10 段音頻作爲參考素材。模型可綜合理解不同素材中的構圖、場景、風格、人物和道具等元素,並按指令精準用於視頻生成。在多人同框場景中,它還能同時還原多人形象與聲音並保持主體穩定——官方展示的 30 秒音樂會片段採用 16 比 9 橫屏、電影感寫實風格,參考素材覆蓋鋼琴家、大提琴、小提琴、主唱、管絃樂隊、合唱團和觀衆席。當 AI 視頻從"特效玩具"進化到能駕馭完整敘事和羣像調度,短視頻創作的工具箱恐怕又要重寫一回了。