注意:本文更适合工程师同学查看!
作为一个工程师,我以前对生图这件事其实有点距离感。
写代码、做产品、分析需求,这些我比较熟悉。但一说到构图、色彩、光影和艺术风格,就感觉门槛很高。很多词听过,却不知道怎么准确地用。
但是现在又很难完全避开 AI 生图。
写文章需要配图,做活动需要海报,讲方案需要把一些想法提前可视化。有时候还要制作头像、产品场景图和课程素材。
全部交给设计师不现实,自己从头学设计也没那么多时间。于是,我开始尝试用一种工程师更熟悉的方式理解 AI 生图。
不是把生图完全变成软件开发,而是借用一些工程上的思路,把原本模糊、依赖感觉的过程,变得更容易描述、验证和修改。
提示词不是咒语,而是需求说明
很多人第一次使用 AI 生图,会先去网上搜索各种"万能提示词"。
我用了一段时间后,感觉提示词没有那么神秘。
AI 生图的本质,是把我们的意图转化成一张新图片。输入可以是文字,也可以是参考图片和修改要求。
问题在于,如果意图本身没有说清楚,AI就只能猜。
这个情况在软件开发中很常见。需求方只说一句"做得高级一点""界面更有科技感",开发人员其实很难直接实现,因为目标、范围和判断标准都不明确。
生图也是一样。
比如:
生成一张有科技感的活动海报。
这句话看起来有要求,但实际上留下了大量空白:什么尺寸、什么活动、什么颜色、要不要人物、标题放在哪里、哪些区域需要留白?
换一种描述:
生成一张9∶16的AI活动海报,浅灰色背景、蓝色强调,整体简洁、扁平,标题区域保留足够留白,不出现人物和复杂装饰。
不一定一次就能生成满意的图片,但方向通常会准确很多。

我现在习惯从五个方面描述画面:
用途、主体、场景、画面要求和限制条件。
这和写需求文档很像。先说清目标,再补充必要的约束和验收条件。重点不在于堆多少专业词,而是尽量减少歧义。
不知道怎样描述风格时,也不用硬编词汇,直接提供参考图,然后说明哪些地方要保留、哪些地方要修改,往往更有效。
这有点像开发过程中补充原型或者参考产品。有些信息很难只靠文字说明,一张参考图就可以快速补齐上下文。
●第一张图不是交付物,而是可视化原型
工程师应该很容易接受一件事:第一版通常不会是最终版。
但使用 AI 生图时,很多人会下意识地认为,输入一句话之后,AI就应该直接给出一张完美图片。如果结果不满意,就觉得是模型不行,或者自己的提示词不够高级。
我现在更愿意把第一张图当成一个可视化原型。
软件原型的价值,不是第一版就把所有功能和细节做对,而是尽快验证需求、结构和方向。AI生成的第一张图也一样。
它最重要的作用,是帮助我确认:
• AI理解对了什么?
• 哪些地方理解错了?
• 哪些需求我自己之前也没想清楚?
有了画面之后,原本模糊的感觉会迅速变得具体。
原来只是觉得"不太好看",现在可以继续判断:是主体不对,还是构图太满;是颜色不合适,还是标题区域不够突出。
这其实是我感受到的敏捷最直接的一次落地:先快速得到一个看得见的版本,再围绕真实结果继续调整。
修改图片,也可以像调试程序
图片不满意时,我通常先判断问题属于哪一类。
是人物、物品或文字不对,还是位置、比例和留白不合理?是整体风格跑偏,还是手指、Logo、局部文字出现了异常?
这和排查软件问题有点像。
不能只说"效果不对",而是要先定位问题发生在哪一层。问题不同,处理方式也不同。
整体方向错了,就重新生成;风格说不清,就增加参考图;局部有问题,就做局部修改;如果越改越乱,就回到上一个版本。
修改时,我会尽量一次只解决一个主要问题。
例如:
保留当前布局和配色,只把左侧的机器人替换为附件中的TRAE宝
这其实是在控制修改范围。一次改动太多,就很难判断到底是哪项要求影响了结果,也容易把原本正确的部分一起破坏掉。


软件调试中,修改范围越大,越容易引入新的问题。生图也有类似情况:本来只是想改一个人物,结果背景、配色和构图也跟着变化了。
所以,已经正确的部分要明确保留,只修改当前最影响结果的问题。
满意的版本也要及时保存,包括图片和对应的要求。
AI生图不一定会随着修改次数增加而持续变好。后面的版本可能解决了一个问题,却又破坏了之前已经满意的部分。
能够保存关键版本、随时回退,比一味向前生成更重要。
不要急着学遍所有工具
现在的生图工具很多,而且各有所长。
有些适合通过对话理解需求和连续修改,有些擅长控制风格、构图和细节,还有一些更适合套用模板、完成排版。
这和开发工具、框架的选择也有点像。
很少有一个工具可以在所有场景下都是最优选择。真正需要判断的,是它能不能解决当前问题,以及使用成本是否合适。
我的建议是,先确定一个真实任务,再选择一款操作简单、支持参考图和连续修改、成本能够接受的工具。
先用它完整做出一张自己真正需要的图。
只有当现有工具确实无法完成某种效果时,再去寻找其他工具。否则很容易花大量时间比较参数、研究功能,最后却没有完成一张真正能用的图片。
先跑通一个完整过程,再考虑是否需要更换工具,通常更加实际。
生成完成,还不等于可以直接发布
AI负责生成,人仍然要负责判断。
软件开发完成之后,还要经过测试和验收,不能因为程序已经运行起来,就直接认为可以上线。
AI图片也是一样。能够生成出来,只能说明"有结果了",不代表结果已经可以交付。
正式使用前,我至少会检查文字、人物和物体是否异常,信息是否真实,尺寸和清晰度是否合格,以及画面是否符合品牌和使用场景。
不同用途,对应的检查标准也不一样。
个人尝试和内部草稿,简单检查就可以;用于自媒体和活动宣传,需要更加完整地审核;如果涉及广告、商品或者正式出版,使用范围越大,出错成本越高,就要更加谨慎。
如果涉及他人的肖像、Logo、作品或参考素材,还需要确认授权和商业使用范围。公开发布 AI 生成合成内容时,也要按照相关规定主动声明,并使用平台提供的标识功能。
尤其不能让虚构画面冒充真实记录。
一张图可以是视觉示意,也可以是艺术表达,但如果它涉及新闻、产品效果、人物事件或真实现场,就必须把边界说清楚。
AI降低了制作门槛,但没有取消艺术门槛
回头看,我作为工程师能够较快上手 AI 生图,不是因为突然懂了艺术,而是因为生图过程里有很多熟悉的东西:
明确需求、补充上下文、快速做出原型、根据结果定位问题、控制每次修改的范围、保存关键版本,最后完成验收。
这些软件开发中的经验,不能直接替代设计能力,但确实可以帮助我们降低生图过程中的不确定性。
靠这套方法,普通人已经可以解决大量文章配图、活动物料和创意可视化的问题。
但我也越来越清楚它的边界。
如果只是做出一张"能用的图",方法和工具可以帮助我们走很远。想做出真正高水平、甚至顶级的作品,仍然需要对构图、色彩、光影、字体和视觉语言有深入理解。
工程化的方法可以帮助我们提高下限,让生图过程更加稳定。
但作品最终能够达到什么高度,仍然取决于审美和艺术修养。
AI让更多人拥有了视觉表达能力。
它降低的是制作门槛,并没有替我们补上艺术背景。
下一步,进行艺术补课,希望可以给大家做点艺术分享~