通義千問開源Qwen-Image-2.1 7B模型整合生圖與圖片編輯

阿里巴巴旗下通義千問(Qwen)宣布開源新一代影像模型Qwen-Image-2.1,將文字生成圖片與圖片編輯整合至單一模型,並以7B參數的視覺生成元件兼顧影像品質、推理效率與運算成本。新模型也原生支援透明背景圖片,可直接生成及編輯帶有透明通道的影像。
7B模型整合生成與編輯
Qwen表示,Qwen-Image-2.1採用輕量化架構,視覺生成元件由32層單流擴散變壓器(Single-Stream DiT)組成,共7B參數。為提升多張圖片輸入時的推理效率,模型採用混合粒度注意力架構,並透過KV快取重用輸入圖片及編輯指令的資訊,以降低記憶體使用量。

透明圖片功能也是此次更新重點。Qwen-Image-2.1可依照提示詞判斷輸出一般圖片或帶有透明通道的圖片,也能直接編輯透明圖層,或將一般照片中的主體擷取為具有透明背景的RGBA圖層,方便後續設計與合成。

最多支援10張參考圖片
在圖片編輯方面,Qwen-Image-2.1最多可同時使用10張參考圖片,將不同人物、服裝或家具等素材整合至同一畫面。模型也支援透過圓圈、繪製標記或獨立遮罩指定編輯區域,讓使用者只修改圖片中的特定部分。

此外,模型強化人物與產品的一致性,在編輯人像時可更穩定保留臉部特徵,也能維持商品的文字、材質與形狀。Qwen-Image-2.1同時支援全景圖、資訊圖表及分鏡等應用,並改善文字排版、人像光線與細節呈現。

Qwen表示,Qwen-Image-2.1可應用於設計、內容創作、電子商務及視覺敘事,整合影像生成、透明圖處理與多種圖片編輯功能。