商湯科技宣佈面向社區開源輕量級統一多模態模型 SenseNova U1.5-Lite-Preview。這款模型並非簡單的規模升級,而是基於 SenseNova U1 的系統性迭代,在同一架構中貫通視覺理解、推理、生成與編輯四大能力。
最引人注目的是其輕量體量——僅以 8B-MoE 的參數規模,就將能力推進到 4K 分辨率、更精細的真實質感以及更復雜的視覺控制。商湯表示,如果說 U1 驗證了統一架構的可行性,那麼 U1.5 要進一步證明能力能否持續擴展。

四大方向顯著提升,生成與編輯全鏈路優化
相比 U1,U1.5-Lite-Preview 在四個核心方向帶來顯著提升:原生支持 4K 圖像生成、更精細的局部紋理與真實世界質感、更準確的中英文文字生成與複雜版式組織、更穩定的圖像編輯和視覺指令遵循。
在技術細節上,商湯針對網格僞影和高分辨率細節建模問題,重新設計了生成頭,減弱視覺 Token 網格對最終圖像的影響,並將訓練擴展至 4K 分辨率。在圖像編輯方面,模型重新組織了編輯數據與訓練任務,強化對原圖內容、主體身份、空間結構和非編輯區域的保持能力,確保在完成目標修改的同時儘可能保留原圖中不需改動的部分。
多項基準測試大幅提升,編輯能力尤爲突出
測評結果印證了這輪優化的實際效果。Qwen-Image-Bench 得分從 47.14 提升至 55.20(配合提示詞增強),ImgEdit-Bench 從 3.90 升至 4.37,GEdit-Bench 英文版從 7.47 提升到 8.17,中文版從 7.42 升至 8.05。整體來看,生成質量與編輯穩定性均有明顯躍升,尤其在圖像編輯的指令遵循與原圖保持方面進步突出。
商湯強調,U1.5-Lite-Preview 的核心思路是不盲目擴大模型規模,而是對生成與編輯全鏈路進行系統性優化。這種"以架構創新換取能力增長"的路線,爲輕量級多模態模型的持續迭代提供了一個值得關注的範本——當 8B 參數就能跑通 4K 生成與精細編輯,統一多模態架構的潛力或許纔剛剛開始釋放。
