一次把"人工改图"改造成"模板 + 批量 + 质检"流水线的踩坑记录。技术笔记,不含任何推广。
背景
电商主图的生产长期有两个痛点:一是改图返工重 ,一张主图从出稿到定稿,平均要改 3 版以上;二是一致性难保证,同一 SKU 的不同尺寸、不同场景图,风格容易漂移。
2026-09-08 发布的图像模型在"多轮编辑一致性"和"生成延迟"上有明显提升(延迟最多降 50%),这让"批量流水线"第一次在工程上划算。本文记录把主图生产拆成流水线的实现思路。
关键挑战
- Prompt 不稳定:同一句自然语言描述,多次生成结果方差大,无法批量。
- 质检靠人:几十张图靠肉眼筛,等于没提效。
- 尺寸/场景矩阵爆炸:1 个 SKU × 3 尺寸 × 4 场景 = 12 张,人工做不现实。
方案
1. Prompt 结构化(模板化)
把自然语言描述拆成固定字段,降低方差:
python
PROMPT_TEMPLATE = (
"subject: {subject}; "
"background: {background}; "
"lighting: {lighting}; "
"mood: {mood}; "
"aspect_ratio: {ratio}; "
"style: e-commerce product photo, clean, no text"
)
def build_prompt(subject, background, lighting, mood, ratio):
return PROMPT_TEMPLATE.format(
subject=subject, background=background,
lighting=lighting, mood=mood, ratio=ratio
)
字段固定后,同一类图的输出方差显著下降,为批量铺路。
2. 尺寸/场景矩阵批量生成
python
from itertools import product
RATIOS = ["1:1", "4:5", "9:16"]
SCENES = [
("white studio", "softbox", "clean"),
("marble desk", "window light", "premium"),
("outdoor lawn", "natural", "fresh"),
("kitchen counter", "warm lamp", "cozy"),
]
def gen_matrix(sku_subject):
tasks = []
for (bg, light, mood), ratio in product(SCENES, RATIOS):
tasks.append(build_prompt(sku_subject, bg, light, mood, ratio))
return tasks
3. 自动质检:用规则 + 模型双重过滤
批量生成后,靠人工筛不现实。这里用两道闸:
python
def quality_gate(img_path, expect_ratio):
import os
from PIL import Image
# 闸1:硬规则------尺寸/比例/分辨率
with Image.open(img_path) as im:
w, h = im.size
if abs(w / h - expect_ratio) > 0.02:
return False, "ratio_mismatch"
if w < 800:
return False, "resolution_too_low"
# 闸2:模型判分(主体是否完整、有无文字水印)
score = vlm_score(img_path) # 自定义:主体完整度 + 文字残留检测
if score < 0.8:
return False, "content_score_low"
return True, "ok"
实测数据
在 200 张主图的批量任务上(1 个 SKU × 多场景):
| 指标 | 人工流程 | 流水线流程 |
|---|---|---|
| 单图平均耗时 | ~8 分钟 | ~1 分钟 |
| 一次通过率 | --- | 约 72% |
| 返工轮次 | 3 轮+ | 1 轮 |
| 尺寸矩阵覆盖 | 部分 | 100% |
说明:以上为单项目实测口径,样本有限,不同品类差异较大,不构成通用结论。
踩坑记录
aspect_ratio必须在 prompt 里显式写,只靠后处理裁剪会损失构图。- 多轮编辑要用同一 seed / 参考图,否则"改背景"会把主体一起改掉。
- 质检闸2 的模型判分要留人工复核,纯自动判分在"高级感"这类主观项上会误杀。
- 批量任务要限流,并发过高时接口抖动明显,失败重试会打乱矩阵顺序。
适合 / 不适合
- 适合:SKU 多、场景矩阵固定、对风格一致性要求高的电商团队。
- 不适合:单次只出 1--2 张图、审美判断高度依赖资深设计师的场景------流水线收益覆盖不了搭建成本。
小结
这一轮模型升级的价值,在工程上是"可批量、可连续编辑";把 Prompt 结构化 + 两道质检闸接上,人工改图的返工就压下去了。技术本身不复杂,难的是把质检标准写清楚。