隨着具身智能趨勢的演進,
商湯科技開源日日新 SenseNova U1,實現多模態原生統一架構

發布於AI新閒資訊
時間 :Apr 29, 2026
閱讀 :1分鐘

隨着具身智能趨勢的演進,
商湯開源8B輕量級統一多模態模型SenseNova U1.5Lite,核心視覺任務表現超越同級,部分複雜排版與文字渲染媲美大規模商業模型;原生支持3-4K上下文,可同時處理主體、數量、空間關係、文字、佈局、風格等多重約束。
商湯科技面向社區開源輕量統一多模態模型SenseNova U1.5-Lite-Preview。該模型基於U1系統性迭代,在單一架構中融合視覺理解、推理、生成與編輯四大能力,僅以8B-MoE參數即支持4K分辨率、更真實質感與複雜視覺控制。商湯稱U1驗證了統一架構可行性,U1.5則實現了輕量高性能的突破。
商湯開源輕量級多模態模型SenseNova U1.5-Lite-Preview,採用8B-MoT參數和NEO-unify架構,支持原生4K圖像生成、精細紋理、精準中英文字生成及穩定圖像編輯。該模型重點提升長篇自然語言與結構化視覺指令理解,實現複雜需求下的精準多模態生成。
商湯科技開源多任務視覺模型SenseNova-Vision-7B-MoT,集成目標檢測、OCR、深度估計、法線估計、圖像分割與多視圖處理等核心視覺任務於7B參數單一架構,爲視覺理解及GUI智能體開發提供高效基座。
商湯發佈並開源“日日新SenseNova-Vision”視覺大模型,核心是將視覺能力原生融入通用基礎模型,打破傳統將檢測、分割等專家模型打包的割裂模式。該模型以單模型在多項評測中實現了四大領域的性能碾壓,標誌着視覺任務向統一原生架構的關鍵升級。