Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文

在上一篇 Codex 接入 DeepSeek-V4-Flash 里,我们给 Codex 换上了 DeepSeek-V4-Flash 当底层模型。速度快、Agent 能力也强,但有一个短板:DeepSeek-V4-Flash 不是多模态模型,看不了图。

编程场景里看图其实挺刚需------UI 截图、报错信息、页面布局,光靠文字描述又慢又容易错。

先看结论 :给 Codex 加视觉就三步------① 在阿里云百炼控制台创建 API Key;② 把开源仓库 asuojun/claude-vision-skill 和 API Key 一起丢给 Codex,让它自己下载安装配置;③ 发一张图验证。视觉模型选通义千问 qwen3-vl-flash,便宜、新用户还有免费额度。全程约 5 分钟。

为什么 Codex 需要外挂眼睛

接上 DeepSeek-V4-Flash 之后,Codex 的底层模型就成了纯文本模型:能读代码、改代码,但处理不了图片。这在纯写代码的场景没问题,一旦要对着截图干活------看 UI 还原界面、读报错弹窗、核对设计稿------就卡住了。

思路有点像工地分工:Flash 当工头,负责推理和改代码;旁边再雇一个专职看图的人,把画面翻译成文字交回去。主模型负责想,视觉模型负责看。

原理:vision-skill 加 qwen3-vl-flash

好在已经有现成的开源方案:vision-skill,给 Codex 加上眼睛。

  • vision-skill :一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」------读本地或网络图片,调用视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill
  • 视觉模型 :负责真正看图的那个。我选的是通义千问的 qwen3-vl-flash------专门看图的 VL 模型,日常读 UI / 截图够用,而且便宜。

qwen3-vl-flash 官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;并且新用户有一定的免费额度。

接入前准备

  • 已完成上一篇教程:Codex 接入 DeepSeek-V4-Flash。没接也不影响本教程,但配置环境一致,演示更顺
  • 一个阿里云百炼账号:没有就先注册
  • 一个 API Key:在百炼控制台创建(下一步演示)

第 1 步:在百炼控制台创建 API Key

登录阿里云百炼控制台,进 API-KEY 管理,创建一个密钥并复制。这个 Key 等下有用。

安全提醒:API Key 是钱袋子。它一旦粘贴进 Codex 对话,就会随请求发给背后的模型服务商,介意的话用完后去百炼控制台重置;也别写进公开教程、别提交到公开仓库------被人拿去就会烧你的额度。另外,开源项目装到本机前值得先过一遍代码,装完可以让 Codex 告诉你它改了哪些配置。

第 2 步:把仓库和 API Key 交给 Codex 自动配置

不用自己下载、不用手改配置,直接在 Codex 里粘贴下面这段,让它按 README 自己来:

markdown 复制代码
帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill),
按照 README 的说明进行配置。
视觉模型选择阿里云百炼的 qwen3-vl-flash,
API Key 是 sk-你的APIKey(换成你刚创建的那一个)。

注意:sk-你的APIKey 要替换成你自己在百炼创建的 Key,别照抄示例。

Codex 会自己下载仓库、检查环境、写入配置,全程不用你动手敲命令。

第 3 步:验证识图

配置搞定后,贴上一张截图让 Codex 识别。它能正确说出图片里是什么,就说明「眼睛」已经装上、识图生效了。

如果验证不通过,先回第 1 步确认 API Key 有没有填错,再让 Codex 检查一遍 vision-skill 的配置。

常见问题

Q:DeepSeek-V4-Flash 不能看图吗?

A:对。它是纯文本模型、不是多模态模型,本身没有识图能力,需要外挂一个视觉模型来补上。

Q:给 Codex 加视觉要额外花钱吗?

A:视觉模型按 token 计费,不是按张收费。以 qwen3-vl-flash 为例,输入 0.15 元 / 百万 tokens、输出 1.5 元 / 百万 tokens;新用户还有一定免费额度,日常看图成本很低。

Q:vision-skill 是什么?

A:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」------读本地或网络图片,调用视觉 API,把描述塞回对话。仓库在 github.com/asuojun/claude-vision-skill。

Q:必须用 qwen3-vl-flash 吗?

A:不一定。vision-skill 走 OpenAI 兼容格式,任何支持视觉的模型都能换。本文以 qwen3-vl-flash 为例,是因为它便宜、新用户有免费额度,日常读 UI 和截图够用。

Q:怎么确认 Codex 识图生效了?

A:配置后直接贴一张截图让 Codex 识别,它能正确描述图片内容就说明生效了。

参考文章:Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文

相关推荐
小磊哥er1 天前
Wonder Claude Code - 一个可运行的、教学级的 Claude Code 精简复刻
javascript·ai编程
Rain5091 天前
谁动了我的 URL?——记一次微前端“灵异 Bug“的排查实录
前端·vue.js·人工智能·前端框架·bug·ai编程
CesareCheung1 天前
高级测试面试中的 AI 面试题:从原理到实战全解析
ai编程
kyriewen2 天前
GPT-6 发布当晚,三大 AI 集体宕机 4 小时——我扒完时间线,发现最该慌的不是宕机
人工智能·程序员·ai编程
却尘2 天前
Agent Framework(3):看懂它到底在运行什么
aigc·ai编程
promiseThen2 天前
LWC Workflow:用 7 个 Cursor Skill 搭一条 AI 协作开发流水线
前端·ai编程
昭昭日月明2 天前
RAGFlow 入门,不用从零造轮子
python·ai编程
魔术师Grace2 天前
AI 为什么会越改越坏?5个Tools 拆解编程 Agent
openai·agent·ai编程
这就是佬们吗2 天前
不写Prompt,写Loop:AI编程的下一场范式迁移
人工智能·prompt·ai编程
OpenTiny社区2 天前
太酷了!装上OpenTiny dsh‑genui这个插件,你的DeepSeek Harness点击就能干活了!
前端·ai编程