xAI 爲視頻生成模型 Imagine Video1.5推出重大升級,新增圖像參考、語音參考、純文本生成視頻以及原生1080p輸出能力,進一步提升AI視頻創作中的角色一致性、場景控制和畫面質量。目前,文本轉視頻和1080p視頻生成功能已在 Grok Imagine 網頁版、iOS版和Android版上線,圖像與語音參考功能已率先向美國地區 SuperGrok Heavy 和 SuperGrok Plus 用戶開放,並計劃後續覆蓋更多用戶。

此次更新爲用戶提供了更靈活的視頻生成流程。創作者既可以直接通過文字描述生成視頻,也可以上傳參考圖像控制角色、產品或場景,還能夠結合角色圖片與語音樣本,讓AI在不同鏡頭中保持外觀和聲音一致。xAI 表示,Imagine Video1.5單次生成最多支持七個視覺參考,用於分別固定人物面部、產品特徵或環境元素,從而實現更精細的內容控制。
在多重參考模式下,用戶可以保留角色身份並替換背景,也可以保持場景不變更換角色,或僅調整動作而維持整體視覺設定。語音參考功能則進一步解決了AI視頻製作中的角色連續性問題,使同一角色在多個片段中保持穩定的面部特徵和聲音表現。
面向開發者,xAI API 已支持通過 grok-imagine-video-1.5 模型調用圖像引用、文本轉視頻和原生1080p視頻生成能力。開發者可以通過API傳入提示詞、參考圖像URL、視頻時長、寬高比和分辨率等參數完成視頻生成,語音參考功能則需要通過請求方式接入。
Imagine Video1.5於上月發佈,xAI 曾表示該版本在運動表現、物理模擬和音頻生成方面進行了優化。此次升級進一步強化了模型對身份、場景和產品細節的控制能力,使AI視頻生成從簡單的畫面轉換逐步邁向更接近專業影視製作流程的多模態創作工具。
