一个文生图提示词实验者 & 图片逆向提示词工程实验者的实验记录。
这次不谈"图好不好看",只看我写下的每一句指令,AI 到底听进去了多少。
为什么做这次实验
我平时玩文生图,有两个习惯:
一个是正向写提示词 ------把脑子里的画面尽量精确地描述出来,交给模型去画。
另一个是逆向拆提示词------拿到一张生成的图,反过去逐条对照我当初写的指令,看哪句命中了、哪句跑偏了、哪句模型自己"加戏"了。
这两件事其实是同一件事的两面:提示词不是"许愿",而是一份契约。 写得多漂亮不重要,重要的是模型最终交付了什么。
这次我挑了一个我很感兴趣的题材------"三视图人像" (一张图里同时呈现脸部特写 + 正面 / 侧面 / 背面全身立绘),用同一个模型 gpt-image2,连跑两组、两种完全不同的风格:
- 一组走皇家华丽路线(红裙 + 金冠)
- 一组走哥特时尚路线(黑礼服 + 银冠 + 面纱)
我想看的不是"哪张更好看",而是:
同一套"三视图"结构指令,套上不同风格词之后,模型的表现稳不稳定?哪些指令是"硬指令"(几乎必现),哪些是"软指令"(看心情)?
下面是实验结果。
实验一:皇家红裙与华丽冠饰
生成结果

我的观察
这一组的结构类指令几乎 100% 兑现 ------"左侧特写 + 右侧三视图"这种空间布局,AI 听得非常准。色彩、材质、配饰这些具象描述词也基本到位。
最让我意外的是模型主动"加戏"的两个地方:
- 地面出现了黑色镜面倒影------我完全没写,但它自己加了一个倒影,反而让画面高级感拉满。
- 红色花枝------我只写了"淡红色植物枝叶",它给的是带红色果实的冬青/海棠质感,比我想的更具体。
这恰恰是逆向拆词最有意思的地方:好的结果,往往来自"指令留白 + 模型自由发挥"的配合,而不是把每个细节都钉死。
实验二:哥特风格时尚肖像
生成结果

我的观察
这一组我把提示词写得更长、更密 ,加了"甜心抹胸""落肩袖""光斑散景"这种很具体的术语。结果是:指令兑现率依然很高,但"落肩袖"这一项出现了偏差------模型给了透明薄纱长袖,而不是我想要的落肩版型。
这给我一个很直接的体感:
提示词不是越长越好。当一个具体术语(比如"落肩袖")和另一个指令(比如"薄纱面纱垂落""银饰刺绣华丽")在视觉上可能冲突时,模型会自己做取舍,而它未必按你的优先级来。
换句话说,堆术语 ≠ 高控图。术语越多,彼此"打架"的概率越高,反而稀释了主意图。
横向对照:两组实验告诉了我什么
把两张图放一起看,有三个发现我觉得值得记下来。
发现一:结构指令是"硬通货",风格指令是"变量"
同样是"左侧特写 + 右侧正/侧/背三视图"这个结构,套在红色皇家风和黑色哥特风上,模型两次都稳定复现了布局 。说明空间结构类的指令属于"硬指令"------只要表述清楚,模型几乎必现。
而色彩、光影、材质这些风格类指令是"变量",它们决定画面的气质,但也最容易出现"色相偏移"(红 → 酒红)、"材质替代"(落肩袖 → 薄纱长袖)这类细微偏差。
发现二:留白处,往往是惊喜处
红色那组我没写"倒影",模型自己加了黑色镜面倒影;我没写"果实",模型给了带红色果实的花枝。这些"模型主动补全"的细节,反而是画面里最出彩的部分。
逆向拆词拆多了,你会发现:最好的图,常常不是"指令最满"的图,而是"主干清晰、枝叶留白"的图。
发现三:逆向对照,才是提示词进阶的真正练法
很多人写完提示词、看到一张"还不错"的图就过去了。但只要你愿意做一次逐条对照------把每句指令和画面里实际出现的元素一一对应------你就会立刻发现:
- 哪些词是"有效词"(真的影响了画面)
- 哪些词是"无效词"(写了跟没写一样)
- 哪些是"模型赠品"(你没写,它给了)
这张对照表,比任何"提示词模板大全"都更有价值。 因为它是针对你自己的意图、你自己的模型、你自己的审美的私人复盘。
写在最后
这次实验我最大的收获不是两张图本身,而是一个认知:
提示词工程的核心,不是"写得更多",而是"写得准 + 看得清"。
写得准,是知道自己每句话在要什么;
看得清,是能从结果里分辨出哪句兑现了、哪句没兑现。
前者靠练,后者靠逆向拆解。两条腿一起走,进步才快。
下一期我打算换个玩法:拿一张别人生成的图,试着反推出它的提示词,再用反推出来的提示词重新生成,看能还原到几分。如果你对这个"逆向还原"的玩法感兴趣,留言告诉我,我们下篇见。
我是程序观察 ,一个在文生图提示词和图片逆向工程上反复折腾的实验者。
一次真实的实验记录,不灌鸡汤,只摆数据和对照。