【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力

1180 stars · MIT · Python · 支持 Codex / Claude Code / Pi / OpenCode

它解决什么问题

纯文本模型(DeepSeek、GLM)做 coding agent,看不了图。agent-vision-toolkit 的思路:视觉能力不必在模型里,可以在 harness(运行时)里------用工具把图片翻译成模型能理解的文本。

两个组件

  1. 视觉工具 CLI:图片问答、长截图 OCR、前端 UI 还原、GUI 自动化、像素对比、前景提取、主色分析;
  2. vision-skills 技能包:教 agent 何时用哪个工具。

任何能调 shell 的 agent 装上就"看得见"。

核心工具

工具 用途
长截图 OCR 提取长图里的报错/日志/聊天文字
前端 UI 还原 设计图 → 前端代码
GUI 自动化 看屏幕、定位元素、点击、读结果
图片问答 图里有什么、两图差异
像素对比 图片 diff
前景提取 抠图

快速开始

bash 复制代码
git clone --recurse-submodules https://github.com/Anionex/agent-vision-toolkit.git
cd agent-vision-toolkit

将 vision-skills 技能安装到你的 agent,即可让 text-only 模型调用视觉工具。

已验证

Codex + DeepSeek 实机验证,Claude Code、Pi、Oh My Pi、OpenCode 端到端验证。

注意

工具把图片转成结构化文本,模型理解的是文本而非像素级视觉推理。结构化看图(提文字/还原布局/定位元素)够用;审美判断、复杂图像推理需原生多模态模型。

中文版

我已将项目 README 和核心文档完整中文化:

https://github.com/yangshun2005/agent-vision-toolkit-cn

如果这个项目对你有帮助,也欢迎动动小手去原仓库点个 Star,支持作者持续维护。

相关推荐
向上的车轮1 小时前
AI音乐创作实战:用Workbuddy定制专属BGM并仿写《Star Sky》
人工智能·ai音乐·workbuddy
宸津-代码粉碎机6 小时前
OpenAI 连夜迎战 Grok Bot 和 Muse:AI 智能体从 “会聊天” 到 “能办事”,现在入场还来得及吗
java·大数据·人工智能·分布式·python
做萤石二次开发的哈哈7 小时前
视频解码器怎么对接?解码上墙、电视墙开窗与场景切换的ISAPI接入实战
人工智能·物联网·监控·视频编解码·大屏端·萤石开放平台·蓝海aiot一站式工作台
Leo.yuan7 小时前
2026年本地化Data Agent优质厂商盘点:哪些产品更适合企业生产环境
大数据·数据库·人工智能
长谷深风1118 小时前
Tool与Skill:AI能力设计的分水岭
java·人工智能·ai·大模型·aiagent
科技观察哨8 小时前
六足平台选型与纳米定位系统集成:HEB-640六自由度位移台在半导体光刻对准中的参数边界与国产替代评估
前端·人工智能
云上先途8 小时前
任务智能体可以自动完成哪些类型工作,是不是只能做简单重复操作?
大数据·人工智能
明志数科8 小时前
具身智能数据供给的分层:分布式采集与入厂采集的工程边界分析
人工智能·机器学习·机器人
像风一样自由20208 小时前
41.用FastAPI搭建一个RAG后端需要哪些接口
人工智能·大模型·fastapi·rag·智能体
小蒋观天下8 小时前
两轮车检测AI摄像头——2026行业竞争格局、商业模式与核心痛点
大数据·人工智能·安全·计算机视觉·ai大模型