开源大模型追踪:Qwen-Image-2.1 :7B 视觉生成模型开源榜登顶 60.28,原生 RGBA 透明出图

Qwen-Image-2.1 是阿里巴巴 Qwen 团队于 2026-09-20 开源的图像生成与编辑一体化模型,视觉生成部分为一个 7B 参数的 32 层单流 DiT,搭配 Qwen3-VL 8B 文本编码器与 64 通道 RGBA VAE。BF16 全量权重约 33GB,INT8 量化栈可压到约 14GB,Unsloth 的 Q4_K_M GGUF 甚至能在 12GB 显存上跑通;vLLM-Omni 在 1024² 40 步下实测约 3.3--4.5 秒/张(厂商数据)。它最大亮点是原生 RGBA 透明出图与最多 10 张参考图编辑,在 Qwen 自建开源榜拿到 60.28 分(同级第一梯队)。需要本地可控出图、透明素材、商品合成的设计与算法团队。需注意:它采用 Qwen Research License(仅研究/评估非商用),与历代 Apache 2.0 的 Qwen-Image 不同,商用需向阿里单独申请。

一、模型速览

项目 说明
发布方 阿里巴巴 Qwen 团队
发布时间 2026-09-20(本周新发,开源权重上架 HF + ModelScope)
架构 7B 单流 DiT(32 层)+ Qwen3-VL 8B 文本编码器 + 64 通道 RGBA VAE(16× 空间压缩)
能力 文生图、图像编辑、最多 10 张参考图合成、原生 RGBA 透明出图
分辨率 原生 2K(2048×2048),支持 7 种比例(含 16:9 的 2752×1536)
许可证 Qwen Research License(仅研究/评估,非商用;商用需向阿里单独申请)
权重体积 BF16 全量约 33GB;INT8 栈约 14GB;Q4_K_M GGUF 约 4.2GB(仅 DiT)

一句话:它把"生成 + 编辑 + 透明"塞进一个 7B 检查点,是把上代 20B MMDiT 砍到三分之一体量、却补齐原生透明通道的"瘦身旗舰"。

它与本专栏 8/25 写过的 SenseNova U1.5 Lite(理解+生图+编辑三合一)路线相似,但 Qwen-Image-2.1 是纯视觉生成模型、参数更小、且原生 RGBA------对"透明贴纸 / 图层合成"这类设计苦活是直接利好,不像通用多模态模型要靠后期抠图。

数据来源:Qwen/Qwen-Image-2.1 模型卡 + QwenLM GitHub README。关键提醒:前代 Qwen-Image 1.0 / Edit / 2512 全部 Apache 2.0,2.1 改为研究许可,这是本周开源图像模型里最该先读清楚的一条。

二、核心亮点:为什么 2.1 值得本地跑

1. 体量砍三分之二,能力不降反补。 上代 Qwen-Image 1.0 是 20B MMDiT、BF16 单 DiT 就 40.9GB;2.1 的视觉 DiT 仅 7B(14.2GB BF16,32 层单流),整包(含 8B 编码器 + VAE)约 33GB。"7B"这个 headline 数字其实只算生成器,真正吃显存的大头是 Qwen3-VL 8B 文本编码器(17.5GB BF16)------它既读提示词又编码参考图,没有独立图像编码器。所以容量规划要对着"7B + 8B"算,而不是对着 7B 算(来源:PacketNebula 拆解)。

2. 原生 RGBA,抠图步骤直接消失。 64 通道 VAE 在生成管线上就带 alpha 通道,出图即透明 PNG,编辑时也能保留透明、把照片主体提进透明层再复用。官方推荐的提示词约定是:"This is an RGBA image with transparency. ... The image has alpha channel and the background is transparent." 对贴纸、图标、电商抠图这类高频活,这一步能去掉最常见的"毛边"来源(来源:模型卡 / saascity 指南)。

3. 一次调用吃 10 张参考图做局部编辑。 编辑支持圆形、手绘标记或独立 mask 圈定区域;多参考图场景下条件图像与文本只需编码一次、在去噪步间复用前缀 KV cache(mixed-granularity attention + prefix KV-cache reuse),降低重复计算。模型卡给出的样例包括"6 张人像拼合群像""5 张参考图组装穿搭"(来源:官方示例 / aicybr)。

4. 日零生态 + 一个必须警惕的许可坑。 Diffusers(QwenImage21Pipeline,PR#14804)、ComfyUI(PR#16400)、vLLM-Omni、SGLang-Diffusion、LightX2V、stable-diffusion.cpp 均在发布当天给出支持。但许可证从 Apache 2.0 退回 Qwen Research License------"research or evaluation purposes only",产品化需向阿里申请商业许可;首批 14 个社区微调衍生权重同样受该条款约束。这意味着"能下载"≠"能上线",部署前先谈许可,别等上线才发现(来源:dev.to / pondero / saascity)。

三、部署实战:两条可运行链路

环境准备(Diffusers 路线,最通用,需源码版 diffusers)

复制代码
pip install --upgrade "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers

推理代码(文生图 + 原生 RGBA 透明 PNG)

python 复制代码
import torch
from diffusers import QwenImage21Pipeline
​
# 1. 加载 BF16 权重(首次会自动下载约 33GB)
pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
# 2. 24GB 消费级显卡靠 CPU 卸载跑通;显存足可去掉此行
pipe.enable_model_cpu_offload()
​
# 3. 按官方约定写 RGBA 提示词,否则背景不透明
prompt = (
    "This is an RGBA image with transparency. "
    "一个扁平矢量风格的深色咖啡杯吉祥物贴纸,粗描边,柔和投影。"
    "The image has alpha channel and the background is transparent."
)
# 4. 原生 2K,默认 40 步、不带 classifier-free guidance
image = pipe(
    prompt=prompt,
    width=2048, height=2048,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("sticker_rgba.png")  # 直接存为透明 PNG

效果验证(计时 + 峰值显存自检,复制即跑)

python 复制代码
import torch, time
from diffusers import QwenImage21Pipeline
​
pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()
​
t0 = time.time()
img = pipe(
    prompt="一只戴宇航头盔的柴犬,写实摄影风格,背景纯净",
    width=1024, height=1024,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(1),
).images[0]
img.save("verify.png")
print(f"耗时 {time.time()-t0:.1f}s | 峰值显存 {torch.cuda.max_memory_allocated()/1e9:.1f}GB")

备选链路:低显存 GGUF(12GB 卡可跑)

bash 复制代码
# 用 stable-diffusion.cpp(llama.cpp 的扩散兄弟项目)跑量化版,无需 CUDA
# DiT: leejet/Qwen-Image-2.1-GGUF(Q2_K 2.6GB ~ Q8_0 7.7GB,推荐 Q4_K_M 约 4.2GB)
# 编码器: Qwen/Qwen3-VL-8B-Instruct-GGUF(Q4_K_M 约 5GB)
# VAE: Comfy-Org/Qwen-Image-2.1 的 vae_bf16.safetensors(约 0.68GB)
sd-cli --diffusion-model qwen-image-2.1-Q4_K_M.gguf \
       --vae qwen_image_2.1_vae_bf16.safetensors \
       --llm Qwen3VL-8B-Instruct-Q4_K_M.gguf \
       -p "一个卡通树懒吉祥物在挥手,扁平矢量插画,明亮色彩" \
       --steps 20 --cfg-scale 6.0 --sampling-method euler -W 1024 -H 1024 -o out.png

说明:以上来自 Qwen 官方 Quickstart、Diffusers PR#14804 与 leejet/stable-diffusion.cpp 文档;enable_model_cpu_offload() 是官方为显存受限 GPU 提供的选项。多参考图编辑走同一 pipeline 的 image= 入参(最多 10 张),具体参数名以最新 diffusers 源码为准。本机无 GPU,未做实测,请读者按自有硬件验证速度与显存。

四、性能测评:同级模型怎么选

模型 生成组件 许可证 原生 RGBA 最大分辨率 显存(BF16) 开源榜(Qwen-Image-Bench)
Qwen-Image-2.1 7B DiT + 8B TE Qwen Research(非商用) 支持 2K(2048²) ~33GB 全量 / ~14GB INT8 60.28(29 款中第 7)
Qwen-Image 1.0 20B MMDiT Apache 2.0 不支持 1K ~41GB ---
FLUX.1-dev 12B Apache 2.0(非商用) 不支持 1M px ~24GB ---
Nano Banana 2.0(闭源对照) --- 闭源 API 不支持 --- --- 59.82

数据来源:Qwen-Image-Bench 为阿里自建基准(29 款模型,vendor 自测,非第三方审计);Nano Banana 2.0 / GPT Image 1.5(59.65) / GPT Image 2.5 Sunburst(67.01) 为闭源对照,仅作方向参考。

生成质量看三个维度:出图速度 ------vLLM-Omni 在 1024² / 40 步 / 单张数据中心 GPU / BF16 下实测约 3.3--4.5 秒/张(来源:vLLM-Omni recipe / PacketNebula);厂商称 2K + 10 参考图编辑约 1.59 秒(CellCog 引用,vendor 口径);stable-diffusion.cpp 在 AMD iGPU 上约 20 分钟/张(1024²、20 步,社区数据);显存 ------BF16 全量约 33GB(含 8B 编码器),INT8 栈约 14GB,Unsloth Q4_K_M GGUF 可在 12GB 卡跑通,有用户报告 16GB 卡开 offload 峰值约 13.9GB(单一数据点,待复现);生成质量------Qwen-Image-Bench 60.28 排在 29 款中第 7,领先同档开源 Nano Banana 2.0(59.82) 与 GPT Image 1.5(59.65),但落后闭源 GPT Image 2.5 Sunburst(67.01)。它的长板在"透明 + 多参考编辑 + 中文/长文本渲染",这些是设计流水线的真实痛点,而非单纯美学跑分。

为什么 RGBA 是这次最该关注的点?因为传统出图后还要接一步抠图/去背,而抠图恰恰是"毛边、锯齿、半透明丢失"的高发区。Qwen-Image-2.1 把 alpha 做到生成管线里,贴纸、图标、商品图层能直接产出可用素材------对设计岗是省掉一个易错环节,对算法岗是少维护一条后处理链路。

数据口径提醒:Qwen-Image-Bench 为厂商自建基准,目前无独立第三方复测,分数作方向性参考;出图速度除 vLLM-Omni 的 3.3--4.5s 为 recipe 实测外,其余为厂商/社区口径且标注来源;本文未做本机实测,显存与速度请读者按硬件自查。

Qwen-Image-2.1 是本周最值得本地试的图像开源权重------7B 体量 + 原生 RGBA + 日零生态,把"设计可用"往前推了一步;但研究许可是它的硬约束:原型、评估、内部研究随便用,凡涉及商用上线,先向阿里申请商业许可,别把"能下载"误当成"能发布"。

五、使用建议

部署档位速查:

  • 12--16GB 显卡:Unsloth / leejet 的 Q4_K_M GGUF(DiT ~4.2GB + 编码器 ~5GB)+ stable-diffusion.cpp 或 ComfyUI,开 offload

  • 24GB 单卡:BF16 全量 + enable_model_cpu_offload(),Diffusers 直跑 2K

  • 多卡 / 集群:vLLM-Omni 或 SGLang-Diffusion,走 /v1/images/generations OpenAI 兼容接口,FP8 + 张量并行提吞吐

  • Mac / 无独显:stable-diffusion.cpp Vulkan 版(AMD/Intel 核显)或 M 系芯片,全精度峰值约 31GB 内存

  • 适用场景:透明贴纸/图标/图层素材生成;电商多参考图合成与局部改款;需要中文/长文本渲染的 poster、信息图;研究评估与内部原型。

  • 不适用场景:任何未获阿里商业许可的产品化部署(研究许可禁止);追求闭源榜首画质(GPT Image 2.5 Sunburst 67.01 仍领先);需要视频生成(它是图像模型,不含视频)。

  • 调优提示 :① 透明图务必在提示词写明 RGBA 约定句式,否则背景不透明;② 显存吃紧先量化 8B 编码器(INT8/W4A8 收益最大);③ 默认 40 步、CFG 可关,加 true_cfg_scale>1 会近似翻倍单步计算;④ 多参考编辑用 mask/手绘圈定区域,比整图重绘更稳。

相关推荐
Eric.463 小时前
8G 显存极限优化|SDXL+ComfyUI 本地部署 AI 漫剧批量生产工作流(源码 + 报错根治)
人工智能·ai绘画·comfyui·本地部署·ai漫剧
这张生成的图像能检测吗6 小时前
(论文速读)一种用于图像超分辨率的有效扩散变换结构
人工智能·计算机视觉·扩散模型·超分辨率
这张生成的图像能检测吗1 天前
(论文速读)FCDM:ConvNeXt 也能做高效扩散模型,卷积网络重新挑战 DiT
扩散模型·图像生成·卷积
Rocky Ding*2 天前
深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、Qwen-Image、GLM-Image核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·扩散模型·ai-native
山顶夕景2 天前
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
OxYGC3 天前
玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪
大模型·transformer·开源大模型·ai基础
VIP_CQCRE3 天前
用 Ace Data Cloud 的 gpt-image-2,把 AI 图像生成接入真实业务场景
ai·aigc·api·图像生成·acedatacloud
这张生成的图像能检测吗3 天前
(论文速读)LLSA:把 DiT 稀疏注意力从二次复杂度降到对数线性
计算机视觉·注意力机制·图像生成
小草cys3 天前
MiniMax H3 和 Wan2.2的对比
大模型·图像生成·多模态大模型·视频生成·minimax·wan