Codex 实战:一句话完成 Temu 商品图采集与印花抠图自动化

最近有个老表想做一个 Temu 商品素材采集自动化,需求很具体,搜索商品、保存原图、提取衣服印花、按日期整理文件夹。

我没有直接把工具给他,而是现场用 Codex 演示了一遍。

这篇文章记录一下这次自动化流程的设计思路、执行步骤、目录结构和一些实际踩到的问题。

本文仅作为 AI 自动化流程演示,实际使用时需要遵守目标网站规则、版权要求和数据使用边界。

一、需求背景

前两天,有个老表来找我。

他说他想搞一下 Temu 上面的商品素材采集,尤其是女装印花 T 恤这一类商品。

他的原始需求大概是这样:

  • 打开 Temu
  • 搜索关键词「女装印花t恤」
  • 获取前 10 个商品图片
  • 保存商品原图
  • 提取衣服上的印花图案
  • 原图和结果图按日期分别归档
  • 整个过程尽量自动化

这个需求看起来不复杂。

但做过电商素材采集的人都知道,这里面最麻烦的不是技术难度,而是重复操作。

你要打开网页、搜索、点商品、保存图片、改文件名、上传抠图、保存结果、整理文件夹。

一两张图片还好。

几十张、几百张的时候,人就开始烦了。

所以这次我想验证的不是单点能力,而是一个完整流程:

text 复制代码
自然语言需求
  ↓
Codex 操作浏览器
  ↓
采集商品图片
  ↓
保存原始图片
  ↓
调用 imagegen 提取印花
  ↓
按日期整理结果

二、实操演示视频

下面是这次完整流程的实操演示视频。

视频建议放在这里,也就是读者刚理解完需求之后。

这时候他们已经知道你要解决什么问题,再看视频会更容易理解整个自动化流程。

视频发布到视频号了

bash 复制代码
https://mp.weixin.qq.com/s/IwSXfDlXyDSAZIXqfHAt9Q

三、我给 Codex 的任务描述

这次没有写复杂的脚本入口,而是直接把目标描述给 Codex。

任务描述类似下面这样:

text 复制代码
打开  temu 地址

搜索「女装印花t恤」

找到前 10 个商品

把原图片保存到 source_今天日期 文件夹

调用 imagegen 把衣服上的印花图像抠出来

保存到 yinhua_今天日期 文件夹

不要用 Python 代码处理图片

这里面有几个关键点:

  • 目标网站是 Temu
  • 搜索关键词是「女装印花t恤」
  • 商品数量限制为前 10 个
  • 原图和处理结果需要分目录保存
  • 抠图交给 imagegen
  • 不用本地 Python 图像处理

这个任务的核心不在于某一步有多难,而在于 Codex 能不能把这些步骤串成一个完整流程。

四、目录结构设计

为了方便后续整理,我让 Codex 按日期生成两个目录。

示例结构如下:

text 复制代码
Temu-Product-Intelligence/
├── source_2026-07-20/
│   ├── product_01.jpg
│   ├── product_02.jpg
│   ├── product_03.jpg
│   └── ...
│
├── yinhua_2026-07-20/
│   ├── product_01.png
│   ├── product_02.png
│   ├── product_03.png
│   └── ...
│
└── products.json

其中:

目录或文件 作用
source_日期 保存 Temu 商品原始图片
yinhua_日期 保存提取出来的衣服印花图
products.json 保存商品图片来源、序号等元数据

这样做的好处是比较明显的。

每天跑一次,就生成一组当天的数据。

后面如果要做趋势分析、素材库沉淀、重复图案检测,也更容易扩展。

五、自动化流程拆解

1. 打开网页并搜索关键词

Codex 会先打开 Temu 页面,然后在搜索框里输入目标关键词。

text 复制代码
关键词:女装印花t恤
平台:Temu
目标数量:前 10 个商品

这一步看起来很简单,但它其实已经涉及浏览器控制、页面加载等待、搜索输入、结果页识别等动作。

2. 获取商品图片

搜索结果出来以后,Codex 需要识别页面里的商品图片,并选取前 10 个。

这里需要注意两个问题:

  • 商品卡片可能是懒加载
  • 页面结构可能变化

所以实际自动化里,不能只假设页面一次加载完所有内容。

更稳的做法是:

text 复制代码
打开搜索结果页
  ↓
等待页面主要内容加载
  ↓
滚动页面触发图片加载
  ↓
提取商品图片地址
  ↓
去重
  ↓
截取前 10 个有效图片

3. 保存原始图片

拿到商品图片之后,先保存原图。

原图一定要保留。

原因很简单,后续如果抠图失败,还可以重新处理。

text 复制代码
source_2026-07-20/product_01.jpg
source_2026-07-20/product_02.jpg
source_2026-07-20/product_03.jpg

4. 调用 imagegen 提取衣服印花

这一步不是用 Python 做图像处理,而是交给 imagegen。

目标不是把整件衣服抠出来,而是尽量提取衣服正面的印花图案。

可以理解成:

text 复制代码
输入:商品原图
输出:衣服上的印花图案

理想结果是透明背景 PNG,方便后续做素材库、设计参考或二次整理。

5. 保存处理结果

处理后的图片保存到 yinhua_日期 目录。

text 复制代码
yinhua_2026-07-20/product_01.png
yinhua_2026-07-20/product_02.png
yinhua_2026-07-20/product_03.png

原图和结果图使用相同编号,方便一一对应。

六、这次自动化真正有价值的地方

这次演示里,最有价值的点不是「抓图」本身。

也不是「抠图」本身。

真正有价值的是,Codex 把多个工具和多个动作串成了一条工作流。

以前这类流程大概是这样:

text 复制代码
人打开网页
人搜索关键词
人下载图片
人上传到抠图工具
人保存结果
人整理文件夹

现在变成了:

text 复制代码
人描述目标
Codex 拆解任务
Codex 操作浏览器
Codex 保存图片
Codex 调用 imagegen
Codex 整理结果
人检查结果

变化就在这里。

人从执行者,变成了流程设计者和结果审核者。

对于电商运营、素材分析、选品研究这类工作来说,这个变化很关键。

七、实际过程中会遇到的问题

这个流程不是完全没有问题。

真实跑起来,通常会遇到这些情况:

  • 页面结构变化导致元素识别失败
  • 图片懒加载导致采集不完整
  • 商品图重复
  • 图片质量不稳定
  • 某些图片不适合提取印花
  • imagegen 可能拒绝处理部分图片
  • 结果需要人工抽查

所以这类自动化不应该一开始就追求 100% 完美。

更现实的目标是:

text 复制代码
先跑通主流程
再补异常处理
再加日志和重试
再做批量化
最后沉淀成稳定工具

八、可以继续扩展的方向

这个案例只是一个很小的入口。

如果后续继续做,可以扩展成更完整的电商素材采集系统。

1. 多关键词批量采集

例如:

text 复制代码
女装印花t恤
oversized graphic tee
summer printed t shirt
vintage print tee

每个关键词生成一个独立目录,方便后续对比。

2. 多平台采集

除了 Temu,也可以扩展到其他电商平台。

但不同平台的页面结构、加载方式和规则都不一样,需要单独适配。

3. 图案分类

提取出来的印花可以继续按类型分类。

例如:

  • 字母印花
  • 卡通图案
  • 复古风格
  • 花卉图案
  • 动物图案
  • 街头风格
  • 节日主题

4. 趋势分析

如果每天都跑一次,就可以沉淀出一个素材数据库。

后面可以分析:

  • 哪些图案重复出现
  • 哪些颜色组合变多
  • 哪些风格正在增长
  • 哪些关键词下的商品变化更快

这时候它就不只是一个采集工具了,而是一个小型选品情报系统。

九、我的一点感受

这次演示之后,老表看完沉默了一下。

然后他说:

这东西就是我想要的,这个能不能每天自动跑?

我一听就知道,他理解了。

因为他已经不再关心「能不能抓图」。

他开始关心「能不能持续运行」。

这就是自动化真正有意思的地方。

只要一个流程能跑通一次,后面自然就会想到定时、批量、分类、分析、报表。

十、结论

这次案例可以总结成一句话:

text 复制代码
一句自然语言需求,变成了一条真实可执行的工作流。

Codex 在这个场景里承担的不是单纯问答角色,而是任务执行角色。

它可以操作浏览器,可以整理文件,可以调用 imagegen,可以把原图和结果图按规则保存下来。

对于电商素材采集这类重复性工作来说,这类 AI 自动化已经有很强的实用价值。

当然,它还需要人工审核,也需要处理异常情况。

但方向已经很清楚了。

以后很多工作不会消失,而是会被重新拆分。

人负责定义目标、判断结果、做策略选择。

AI 负责执行那些重复、明确、耗时间的步骤。

这才是这个案例最值得记录的地方。

相关推荐
Urbano1 小时前
服装工厂卫衣量产提质增效方案:工序自动化替代、产能优化、多品牌设备选型及落地案例
运维·自动化
甲维斯1 小时前
Kimi K3 修Bug,越修越多!
人工智能
Litluecat2 小时前
2026年7月20日科技热点新闻
人工智能·科技·新闻·每日·速览
达达尼昂2 小时前
AI 编程的工程化实践:Flutter AI Harness 的设计与落地
人工智能·后端·全栈
廋到被风吹走2 小时前
【AI】从“卖能力“到“卖信任“,合规与安全成为新战场
人工智能·安全
GlobalSign数字证书2 小时前
自动化时代,如何高效部署SSL证书?
运维·自动化·ssl
蓝速科技2 小时前
蓝速科技 3D 全息舱展览馆落地实测:降噪算力与成像质量深度评测
人工智能·科技·3d
小小测试开发2 小时前
PromptFoo 源码分析与工程实战:LLM 测试框架的架构与最佳实践
人工智能·架构
IT_陈寒2 小时前
React的useEffect依赖项把我坑惨了
前端·人工智能·后端