Image 2.5来了,我用双参考图跑通了连续四格故事

大家好,我是孟健。

我提供角色设定与陶瓷杯两张参考图,一次生成一张四格故事。画面保留了人物服装与杯子橙把,色调由雨夜冷色转为室内暖色,整体可用作产品物料的概念初稿。


01 输入两张设定图,直接在单画幅跑通四格叙事

把多个不同来源的主体放进同一个连贯情节里,向来容易让画面走样。这一次,我把之前文生图得到的一张双角色三视图设定,以及另一张虚构的MOKU陶瓷杯商品图同时作为输入,要求在一张图内排出版面,讲清楚"出门、交接、送达、休息"四个阶段的雨夜送杯过程。

两名角色的原始参考图如下:

从原始设定看,上方是人类角色三视图:戴红圆眼镜、白发挑染、黄色外套、蓝绿斜挎包配深色裤子和白鞋;下方是名为DOT的配送机器人三视图:双青色方眼、头顶红天线、腰系橙色带子、有两个轮子。

对照回开头生成的四格大图,主体的核心特征承接得很顺畅。女孩的红眼镜、黄色外套,机器人的方眼和双轮行走机构,以及杯子醒目的橙色手柄,在四个分镜里都有体现。从冷雨夜街景跨入室内暖光的色调过渡自然,第三格送达特写里杯身上的"MOKU"字样清晰可读,四个分镜上方的中文小标题也都印在对应位置。

但放大细看,破绽依然明显。第二格交接场景里,机器人头顶的红色天线向一侧倾斜偏移,没有保持设定里的居中形态;画面背景还自作主张添加了提示词里并未要求的英文招牌。这里必须分清:这是一张画布内完成的四格故事排版,体现的是模型处理多图参考特征的整合能力,不能混淆成多次独立调用下同一角色能够跨图维持恒定。


02 看看业界的真实上手:从画质比拼转向编辑定位

9月8日官方正式发布新模型,声称相对Images 2.0延迟最多降50%(本机未复测)。官方产品线划分了偏向速度的Flare与偏向精细且耗时更久的Sunburst两条路线。

在Axios的提前上手报道中,记者Ina Fried测试了多项实用任务。她将自家宠物猫Raven的照片转成了几种不同的艺术画风;在已有纹身周围圈选修改设计并把局部颜色调浅;在设计"Axios 2028"概念标识时,初版相对平淡,但在引导加入日落天际线后,顺利延展到了品牌周边等物料上,参考主体保留较好。

在TechRadar的24小时实际体验中,作者Graham Barlow提到工作流工具是当前关注重心,包括图片评论打点定位修改、Sketch草图交互以及模板引导等。他也客观提醒,部分编辑工具栏从8月起就已陆续出现,不能把所有交互界面都算作这次模型更新的产物。

国内开发者cxuan的公开上手也展示了草图转图的用法,例如通过简笔面包草图生成立体的3D黏土风格面包,验证了简笔输入的转化能力。

对开发者而言,先提供已有素材再明确修改要求更具参考价值。给出参考图配合定点反馈,相比单纯要求画面更好看,能带来更明确且可控的生成结果。


03 检验密集文字与结构:排下十二行双语课表与六层分解图

做开发物料时,界面文字乱码和机械结构前后错乱是两个常见痛点。本轮我针对这两个高约束场景分别做了测试。

首先是一张包含三天日程、每天四个时段、总计十二行的双语开发训练营课表:

从画面排版来看,从早间九点到下午四点的时间段标注,以及"需求拆解 Scope"、"页面原型 Prototype"、"接口设计 API Design",一直到第三天的"发布复盘 Review",整整十二行中英对照全部排布就位,在此样本中没有发现文字乱码或时间错配。主标题、副标题和底部免责说明均正常呈现。不过在手机屏幕上阅读这些小字需要点开原图放大,且边缘依然带有额外生成的装饰性小英文。

紧接着是一张虚构台灯的六部件拆解图:

从上到下,六个部件顺次展开:"01 半球灯罩"、"02 扩散圆片"、"03 发光圆环"、"04 中空立柱"、"05 配重底座"以及最底部的"06 防滑脚垫"。编号、中文标签与引出线各自对应清晰,灯罩开口朝下、环和立柱的中空形态在视觉上均符合直觉。需要说明的是,这只是一张概念层面的视觉拆解示意,没有包含内部电路或加工公差,不作为装配依据。


04 审视物理反射与连续改图:镜面扭曲与商品三次调用

除了文字排版,空间关系和局部微调同样考验实用价值。

在空间测试中,我给模型设定了一个包含红色立方体、装有整颗柠檬的水杯、银色金属球、封面印着"BUILD"的蓝色笔记本等六件物品的场景,并在后方立一面镜子。

画面中的主光阴影、金属反射和玻璃焦散很有摄影质感,镜子里也映照出了前景对应的几样物体。但当我们放大观察镜中的笔记本封面时,字体出现了明显扭曲,不能确认为正确的几何镜像映射。这提醒我们:光影氛围具有真实感,并不代表画面符合严谨的光学几何。

连续局部修改也有类似规律。在外部测试中,Promptowy的Piotr Olszewski对街景和橄榄油包装进行了两组共11次连续修改,发现每次改动都会伴随非目标细节的微小变化,不过作者也明确说明底层型号不明。而在我自己的虚构MOKU陶瓷杯测试中,通过三次调用完成了原图加两轮编辑:

第一步文生图:奶油色杯身、橙色右把手、杯体印有"MOKU"商标,标牌写着"¥99"。

第二步修改文本:以原图作为输入,要求仅将标价从¥99改成"¥129"。结果中主要结构和阴影肉眼相似,价格成功换成了¥129。

第三步多约束修改:要求将杯子右把手换成鼠尾草绿,同时保留右侧原本的橙色色卡,并维持¥129的标价。画面中把手顺利变绿,色卡与价格也均得以保留。不过如果对非目标区域做像素比对,整体仍能查出肉眼不易察觉的细微差异,并非完全无损。

包含之前的尝试,两轮累计调用9次(文生图6次,带图参考3次,本轮新增5次),没有重抽挑图。未在同等条件下比对旧版或竞品,不给出综合成功率;实测中可以观察到非目标区域的像素出现变化。


05 把控不可变特征:从复杂初稿到交付检查

复杂的视觉初稿完全值得交给AI去搭架子,但交付检查绝不能外包给好看的画面质感。实际调用时,可以先明确列出红圆眼镜、天线朝向这类绝不可变的特征清单,再连同参考图一起输入。

拿到初稿后,立刻对照原始设定逐项核对:机器人底部的轮子数量有没有走样,红眼镜的框线是否断连,连环画里随行杯的杯身反光与商标朝向是否对齐。这些具体破绽往往藏在第一眼的惊艳背后,需要开发者逐格确认。


参考来源


👋 我是孟健,前腾讯 T11 / 前字节技术 Leader,现在全职做 AI 编程。

🔥 更多 AI 编程实战:

  • GitHub:@mengjian-github
  • 专栏:AI编程实战

觉得有用?点赞+收藏 就是最大支持 🙏

相关推荐
杨杨杨大侠2 小时前
KV Cache 到底缓存了什么?从逐 token 生成讲到 GPU 与显存
aigc·openai·ai编程
一航jason2 小时前
GPU 推荐用吗?——8295 上 Adreno 695 的现实评估
人工智能·ai·ai编程·llama·ai-native
桃西西呀2 小时前
换个会话就失忆?拆开 Agent 记忆的 4 层与 4 个流派,附9个坑的自检清单
人工智能·llm·ai编程
小虎AI生活2 小时前
腾讯文档AI工作台拆解:Agent内核进文件后,AI办公的交接问题终于有解了
ai编程
小傅哥2 小时前
Java + DDD,1:1 复刻 Deepseek Harness 项目
前端·后端·ai编程
Cx330❀3 小时前
【Linux网络】深入TCP协议:从滑动窗口到拥塞控制与性能优化全景解析
linux·开发语言·网络·tcp/ip·ai·性能优化·ai编程
撑伞的鱼99373 小时前
小白安装使用AI编程助手教程:文心快码从下载到跑通首个任务
青少年编程·教程·ai编程·ai工具
tedcloud1234 小时前
VoiceStudio 怎么搭建?开源本地 AI 语音克隆、配音与语音工作室
服务器·人工智能·开源·ai编程
Allen_LVyingbo4 小时前
2026医疗AI编程:医院信息工程部规模化编程与代码审核路径(上)
网络·人工智能·cnn·transformer·知识图谱·ai编程