Qwen-Image-2.1 图像编辑拆解:从透明改字到多图合成

大家好啊,我是 jianpeng。

今天和大家聊一下 Qwen-Image-2.1。我想和你一起看几个具体的改图任务,最后再把 ComfyUI 里容易弄混的模型组件和分辨率说清楚。

一张透明贴纸,中间是粉橙色的"BLOOM",周围有花叶和笑脸太阳花。现在把文字改成更长的"Qwen-Image",原来的画风和装饰还要接得上。

这是 Qwen-Image-2.1 官方展示的一项任务。同一批案例中,还有把五张独立参考图合成一套穿搭,以及用三色标记同时指定去表、改发色、换衣服。

这几件事都很像我们改稿时遇到的要求。我查了这次官方发布的样张和 X 上的社区作品,也检查了透明示例的原文件。我们就从这些能看见、能核对的细节聊起。

透明贴纸改字:字串变长,整块文字也要重新安排

我们先看文字宽度,再看周围的花叶。要求只有"换字"两个字,实际牵动的却是字形、布局和装饰之间的关系。

原图的"BLOOM"只有五个字母,结果中的"Qwen-Image"明显更长。输出沿用了粉橙色的视觉感觉,同时重新分配文字横向空间,让更长的字串进入原来的装饰主题。花叶和笑脸太阳花的整体构图仍然接近。

我觉得这里有意思的,是它同时处理了"改成什么"与"改完后怎样放得下"。如果你做过图形化标题、贴纸字或活动素材,应该能想到这种改稿:画风已经选定,接下来只想围绕现有稿件继续调整。

透明信息也参与了这条路径。官方说明支持原生 RGBA 生成与编辑,其中 RGB 描述颜色,Alpha 描述透明程度。我保存并检查了这组官方原始 PNG:输入与输出都含 Alpha 通道,也都有实际透明和半透明像素。所以,至少这组样张确实带着透明信息;至于其他任务的边缘质量,以及周边装饰能否精确保留,还不能从这一组推开。

五张参考图做穿搭:模型要处理物品与身体的关系

再看多图案例。输入包括一张人物照片和四张单品图:街角人物穿白色上衣、牛仔短裤,另外提供粉色绗缝外套、银色平底鞋、棕色手提包与黑白毛绒帽。

你可以先沿外套、鞋、包、帽逐一找对应,再看它们怎么进入人物所在的场景。

结果延续了街角场景,人物穿上粉色外套和银色鞋,拿着棕色包,戴上黑白帽子。几张原本独立的单品图,被安排到同一具身体和同一视角中。

这一步涉及重绘。外套需要形成贴合身体的衣褶,帽子要与头部对应,鞋和包也要进入场景的透视与接触关系。参考图给出物品依据,模型还要补出"这些物品出现在这里"所需的视觉信息。

不过,别只看四件单品都到位了。人物的脸部、发型和姿态也明显重绘,所以我会把这组图理解成多件单品的视觉组合,不会据此认定人物身份或原姿态被精确保留。

如果你准备把它接进自己的工具,可以先按"主图加参考材料"组织输入:主图承担人物与场景,单品图提供要替换或加入的对象。官方上限是最多 10 张参考图,这组用了 5 张;我更关心的是每张输入各自发挥了什么作用。

做穿搭方案、人物视觉提案或多素材构图时,这种组合方式值得试。要拿来精确展示商品,我们就得回到原商品核对款式、纹理和细节,不能只看整体搭配得顺不顺眼。

三色标记:把"改哪里"直接画在输入上

多图解决材料从哪里来,区域标记则帮助说明修改发生在哪里。第三组案例在输入照片上用了三种颜色的标记:蓝色标记指向手表,红色标记指向金发,绿色标记指向衣服,分别对应移除手表、改为黑发和换成灰衣。

一起对照三个修改要求,再看看沙发、窗和毯子有没有延续原场景。

输出中,手表消失,头发变黑,衣服变灰;沙发、窗和毯子的总体场景仍在。一个请求包含多项修改,视觉标记把每项要求与具体位置联系起来。

这个用法很直观:你可以指着现有图说清要改哪几处。文字负责描述内容,标记负责位置,不用把一段话都花在解释"我到底指的是哪里"上。

但我会把圈选标记与"圈外绝对不动"的像素锁定分开看。这里没有未编辑区域的逐像素比较;如果某一部分必须精确复用,我们仍要保留原稿和人工修改路径。

X 上的提前体验:整页组织与细节偏差一起看

看完官方改图,我们再换个角度,看两张完整作品。Richard C. Suwandi 在 X 的提前体验帖里,说自己获得了 Qwen-Image-2.1 提前访问,并把五个示例称为 one-shot。他的主页自述为 Qwen Dev ambassador,这个关联身份也一起交代给你。

先看其中的周一四格漫画:赖床、面对 214 条未读、猫坐在电脑上,最后人与猫一起分吐司。四句指定文字分别进入对应格子,画面顺序也能连成一个笑话。

但你再看眼镜:第二格戴着,第三格消失,第四格又出现了。标题与末格文字还多了未要求的序号,墙上便签也有多余冒号。故事安排得有趣,角色状态和"只输出指定文字"却没完全守住;这正好让我们看到多格指令执行里的具体偏差。

另一张咖啡长图,把种植、采摘、烘焙、研磨、冲煮五块内容沿弯曲小路串起来。你顺着这条小路看,编号、插图和小字是怎样接上的,就很清楚了。

我喜欢它把整页组织成一条路线:编号帮助定位,插图承接流程,小字也能读出。模型同时增加了提示中未要求的副标题。做技术图解时,我们可以借鉴这种排法;不过,字能读清与事实可靠是两回事,流程和知识仍得核对专业材料。

生成与编辑怎样放进同一条工作流

看到这里,我更关心一个工作流问题:生成初稿、加入参考和局部修改,能不能接在一起?

Qwen 官方项目说明将文生图与带图编辑统一到同一模型;ComfyUI 对应的生成和编辑工作流也使用同一组权重。我们因此可以沿同一模型探索这几步之间的衔接,而连续修改之后还能保留多少原稿细节,是接下来值得实际验证的地方。

从哪个入口开始,运行前分清哪三件事

如果你想先体验,可以从 Qwen 官方试玩入口开始。已经在用 ComfyUI,就参考 2.1 专属教程,更新到包含相关核心节点的版本,再选对应的生成或编辑模板。

这里有三件事,我想提前帮你分清。

第一,7B 是视觉生成组件的规模。 完整链路还包含 Qwen3-VL 8B 编码器与 VAE,不能根据"7B"直接推定整套任务的显存开销。

第二,ComfyUI 要配齐三类权重。 扩散模型、编码器和 VAE 分别进入 diffusion_modelstext_encodersvae 目录,并在工作流中匹配对应文件。当前 2.1 模板采用 INT8 DiT、BF16 编码器和 BF16 VAE;不要把旧版 Qwen-Image 的模型组合直接套进来。

第三,支持原生 2K 不代表模板默认输出 2K。 ComfyUI 2.1 文生图模板默认 1 MP,2048×2048 方图约为 4 MP。实际分辨率、精度和参考图数量都会影响资源需求,本次官方材料没有提供适用于全部任务的统一最低显存保证。

最后确认使用范围:Qwen Research License授权非商业研究与评估,商业使用模型材料需另获许可;生成物权益与托管入口条款另行核对。

如果你准备上手,我建议先挑一张本来就想改字的素材。看它怎样安排新文字,又保留了多少原有风格,再决定要不要继续加入多图和局部编辑。

资料与作品出处

相关推荐
武子康1 小时前
GPU Pod 已经 Running,为什么扩容还没变成推理容量?
人工智能·llm·agent
sdzhyt1 小时前
济南第六届高层次人才招引大会举行|智慧云通开放AI全栈、售前、销售、产品经理等岗位
人工智能·求职招聘·招聘
shionhana1 小时前
AI PPT 生成的两个关键环节:结构生成和视觉生成,以 PPTMaker 为例
人工智能·chatgpt·agent·ppt
Am-Chestnuts1 小时前
DeepSeek表格复制到Word变竖线错列?用DS随心转对比几种整理方法
人工智能·word·ds随心转
55873 生态系统1 小时前
013+【架构实战】55873 智慧生活:如何让生命更有价值、更有意义?—— 四大生命价值维度设计全解
人工智能·55873全域文明生态体系·55873操作系统·全域文明生态系统·55873智慧生活
小小程序猴11 小时前
中小企业AI转型课程模块的工程化设计:从能力矩阵到课程编排
大数据·人工智能
别动我齐刘海1 小时前
ROS2 Jazzy + C++ 实战路线——ros2_control
c++·人工智能·python·opencv·机器学习·机器人·github
lisw051 小时前
智能客服:运行机制、效用与发展展望!
人工智能·ai智能体
Aloudata1 小时前
语义层和SQL Copilot:一个降低写SQL门槛,一个统一业务逻辑
大数据·人工智能·数据分析·data agent·语义层