阿里通義千問團隊近日端出了一道讓開源社區眼前一亮的菜:開放權重的圖像生成與編輯模型Qwen-Image-2.1正式登場。最讓人意外的是它的身板——視覺生成組件僅用70億參數,卻在自家的評測基準上壓過了市面上絕大多數閉源模型。團隊放話底氣十足,不過第三方獨立評測尚在趕來的路上,這份成績單還需時間檢驗。更接地氣的是,它不挑設備,一塊像RTX3090這樣的主流消費級顯卡就能托起它跑起來。
Qwen-Image-2.1最拿手的一招是"合併同類項"。官方展示的合照裏,每張面孔都來自不同人物的單獨照片,模型像一位耐心的拼圖師,把它們自然縫合成一張羣像。這背後是它對透明圖像的原生支持——生成的不是普通RGB圖,而是帶透明通道的RGBA格式,用戶於是可以把物體單獨摳出來,也能直接在透明圖層上改寫文字,排版和後期都省了事。
參考圖的處理能力同樣誇張。一次最多吞下十張參考圖,羣像合成、虛擬試穿、房間設計都在這套框架裏跑通。想局部修改也不必重畫整張圖,畫個圈、塗個遮罩、隨手點幾下做標記,模型就明白該動哪一塊。團隊透露,架構層面的改動加上KV緩存複用,讓推理速度明顯提升,尤其當參考圖數量一多,提速感受更明顯。
門檻也放得很低。模型已在Hugging Face、GitHub和魔搭社區(ModelScope)同步上線,還配了個在線Demo供人把玩。唯一需要注意的是授權:它掛的是研究許可,明確禁止商用,企業用戶若想落地,得另外向千問團隊單獨申請商業授權。換句話說,個人把玩與學術探索敞開大門,真要賺錢做生意,還得先過授權這一關。
VIP會員