1180 stars · MIT · Python · 支持 Codex / Claude Code / Pi / OpenCode
它解决什么问题
纯文本模型(DeepSeek、GLM)做 coding agent,看不了图。agent-vision-toolkit 的思路:视觉能力不必在模型里,可以在 harness(运行时)里------用工具把图片翻译成模型能理解的文本。
两个组件
- 视觉工具 CLI:图片问答、长截图 OCR、前端 UI 还原、GUI 自动化、像素对比、前景提取、主色分析;
- vision-skills 技能包:教 agent 何时用哪个工具。
任何能调 shell 的 agent 装上就"看得见"。
核心工具
| 工具 | 用途 |
|---|---|
| 长截图 OCR | 提取长图里的报错/日志/聊天文字 |
| 前端 UI 还原 | 设计图 → 前端代码 |
| GUI 自动化 | 看屏幕、定位元素、点击、读结果 |
| 图片问答 | 图里有什么、两图差异 |
| 像素对比 | 图片 diff |
| 前景提取 | 抠图 |
快速开始
bash
git clone --recurse-submodules https://github.com/Anionex/agent-vision-toolkit.git
cd agent-vision-toolkit
将 vision-skills 技能安装到你的 agent,即可让 text-only 模型调用视觉工具。
已验证
Codex + DeepSeek 实机验证,Claude Code、Pi、Oh My Pi、OpenCode 端到端验证。
注意
工具把图片转成结构化文本,模型理解的是文本而非像素级视觉推理。结构化看图(提文字/还原布局/定位元素)够用;审美判断、复杂图像推理需原生多模态模型。
中文版
我已将项目 README 和核心文档完整中文化:
https://github.com/yangshun2005/agent-vision-toolkit-cn
如果这个项目对你有帮助,也欢迎动动小手去原仓库点个 Star,支持作者持续维护。