大家好啊,我是 jianpeng。
今天和大家聊一下 Qwen-Image-2.1。我想和你一起看几个具体的改图任务,最后再把 ComfyUI 里容易弄混的模型组件和分辨率说清楚。
一张透明贴纸,中间是粉橙色的"BLOOM",周围有花叶和笑脸太阳花。现在把文字改成更长的"Qwen-Image",原来的画风和装饰还要接得上。
这是 Qwen-Image-2.1 官方展示的一项任务。同一批案例中,还有把五张独立参考图合成一套穿搭,以及用三色标记同时指定去表、改发色、换衣服。
这几件事都很像我们改稿时遇到的要求。我查了这次官方发布的样张和 X 上的社区作品,也检查了透明示例的原文件。我们就从这些能看见、能核对的细节聊起。
透明贴纸改字:字串变长,整块文字也要重新安排
我们先看文字宽度,再看周围的花叶。要求只有"换字"两个字,实际牵动的却是字形、布局和装饰之间的关系。

原图的"BLOOM"只有五个字母,结果中的"Qwen-Image"明显更长。输出沿用了粉橙色的视觉感觉,同时重新分配文字横向空间,让更长的字串进入原来的装饰主题。花叶和笑脸太阳花的整体构图仍然接近。
我觉得这里有意思的,是它同时处理了"改成什么"与"改完后怎样放得下"。如果你做过图形化标题、贴纸字或活动素材,应该能想到这种改稿:画风已经选定,接下来只想围绕现有稿件继续调整。
透明信息也参与了这条路径。官方说明支持原生 RGBA 生成与编辑,其中 RGB 描述颜色,Alpha 描述透明程度。我保存并检查了这组官方原始 PNG:输入与输出都含 Alpha 通道,也都有实际透明和半透明像素。所以,至少这组样张确实带着透明信息;至于其他任务的边缘质量,以及周边装饰能否精确保留,还不能从这一组推开。
五张参考图做穿搭:模型要处理物品与身体的关系
再看多图案例。输入包括一张人物照片和四张单品图:街角人物穿白色上衣、牛仔短裤,另外提供粉色绗缝外套、银色平底鞋、棕色手提包与黑白毛绒帽。
你可以先沿外套、鞋、包、帽逐一找对应,再看它们怎么进入人物所在的场景。

结果延续了街角场景,人物穿上粉色外套和银色鞋,拿着棕色包,戴上黑白帽子。几张原本独立的单品图,被安排到同一具身体和同一视角中。
这一步涉及重绘。外套需要形成贴合身体的衣褶,帽子要与头部对应,鞋和包也要进入场景的透视与接触关系。参考图给出物品依据,模型还要补出"这些物品出现在这里"所需的视觉信息。
不过,别只看四件单品都到位了。人物的脸部、发型和姿态也明显重绘,所以我会把这组图理解成多件单品的视觉组合,不会据此认定人物身份或原姿态被精确保留。
如果你准备把它接进自己的工具,可以先按"主图加参考材料"组织输入:主图承担人物与场景,单品图提供要替换或加入的对象。官方上限是最多 10 张参考图,这组用了 5 张;我更关心的是每张输入各自发挥了什么作用。
做穿搭方案、人物视觉提案或多素材构图时,这种组合方式值得试。要拿来精确展示商品,我们就得回到原商品核对款式、纹理和细节,不能只看整体搭配得顺不顺眼。
三色标记:把"改哪里"直接画在输入上
多图解决材料从哪里来,区域标记则帮助说明修改发生在哪里。第三组案例在输入照片上用了三种颜色的标记:蓝色标记指向手表,红色标记指向金发,绿色标记指向衣服,分别对应移除手表、改为黑发和换成灰衣。
一起对照三个修改要求,再看看沙发、窗和毯子有没有延续原场景。

输出中,手表消失,头发变黑,衣服变灰;沙发、窗和毯子的总体场景仍在。一个请求包含多项修改,视觉标记把每项要求与具体位置联系起来。
这个用法很直观:你可以指着现有图说清要改哪几处。文字负责描述内容,标记负责位置,不用把一段话都花在解释"我到底指的是哪里"上。
但我会把圈选标记与"圈外绝对不动"的像素锁定分开看。这里没有未编辑区域的逐像素比较;如果某一部分必须精确复用,我们仍要保留原稿和人工修改路径。
X 上的提前体验:整页组织与细节偏差一起看
看完官方改图,我们再换个角度,看两张完整作品。Richard C. Suwandi 在 X 的提前体验帖里,说自己获得了 Qwen-Image-2.1 提前访问,并把五个示例称为 one-shot。他的主页自述为 Qwen Dev ambassador,这个关联身份也一起交代给你。
先看其中的周一四格漫画:赖床、面对 214 条未读、猫坐在电脑上,最后人与猫一起分吐司。四句指定文字分别进入对应格子,画面顺序也能连成一个笑话。

但你再看眼镜:第二格戴着,第三格消失,第四格又出现了。标题与末格文字还多了未要求的序号,墙上便签也有多余冒号。故事安排得有趣,角色状态和"只输出指定文字"却没完全守住;这正好让我们看到多格指令执行里的具体偏差。
另一张咖啡长图,把种植、采摘、烘焙、研磨、冲煮五块内容沿弯曲小路串起来。你顺着这条小路看,编号、插图和小字是怎样接上的,就很清楚了。

我喜欢它把整页组织成一条路线:编号帮助定位,插图承接流程,小字也能读出。模型同时增加了提示中未要求的副标题。做技术图解时,我们可以借鉴这种排法;不过,字能读清与事实可靠是两回事,流程和知识仍得核对专业材料。
生成与编辑怎样放进同一条工作流
看到这里,我更关心一个工作流问题:生成初稿、加入参考和局部修改,能不能接在一起?
Qwen 官方项目说明将文生图与带图编辑统一到同一模型;ComfyUI 对应的生成和编辑工作流也使用同一组权重。我们因此可以沿同一模型探索这几步之间的衔接,而连续修改之后还能保留多少原稿细节,是接下来值得实际验证的地方。
从哪个入口开始,运行前分清哪三件事
如果你想先体验,可以从 Qwen 官方试玩入口开始。已经在用 ComfyUI,就参考 2.1 专属教程,更新到包含相关核心节点的版本,再选对应的生成或编辑模板。
这里有三件事,我想提前帮你分清。
第一,7B 是视觉生成组件的规模。 完整链路还包含 Qwen3-VL 8B 编码器与 VAE,不能根据"7B"直接推定整套任务的显存开销。
第二,ComfyUI 要配齐三类权重。 扩散模型、编码器和 VAE 分别进入 diffusion_models、text_encoders、vae 目录,并在工作流中匹配对应文件。当前 2.1 模板采用 INT8 DiT、BF16 编码器和 BF16 VAE;不要把旧版 Qwen-Image 的模型组合直接套进来。
第三,支持原生 2K 不代表模板默认输出 2K。 ComfyUI 2.1 文生图模板默认 1 MP,2048×2048 方图约为 4 MP。实际分辨率、精度和参考图数量都会影响资源需求,本次官方材料没有提供适用于全部任务的统一最低显存保证。
最后确认使用范围:Qwen Research License授权非商业研究与评估,商业使用模型材料需另获许可;生成物权益与托管入口条款另行核对。
如果你准备上手,我建议先挑一张本来就想改字的素材。看它怎样安排新文字,又保留了多少原有风格,再决定要不要继续加入多图和局部编辑。