Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文

在上一篇 Codex 接入 DeepSeek-V4-Flash 里,我们给 Codex 换上了 DeepSeek-V4-Flash 当底层模型。速度快、Agent 能力也强,但有一个短板:DeepSeek-V4-Flash 不是多模态模型,看不了图。

编程场景里看图其实挺刚需------UI 截图、报错信息、页面布局,光靠文字描述又慢又容易错。

先看结论 :给 Codex 加视觉就三步------① 在阿里云百炼控制台创建 API Key;② 把开源仓库 asuojun/claude-vision-skill 和 API Key 一起丢给 Codex,让它自己下载安装配置;③ 发一张图验证。视觉模型选通义千问 qwen3-vl-flash,便宜、新用户还有免费额度。全程约 5 分钟。

为什么 Codex 需要外挂眼睛

接上 DeepSeek-V4-Flash 之后,Codex 的底层模型就成了纯文本模型:能读代码、改代码,但处理不了图片。这在纯写代码的场景没问题,一旦要对着截图干活------看 UI 还原界面、读报错弹窗、核对设计稿------就卡住了。

思路有点像工地分工:Flash 当工头,负责推理和改代码;旁边再雇一个专职看图的人,把画面翻译成文字交回去。主模型负责想,视觉模型负责看。

原理:vision-skill 加 qwen3-vl-flash

好在已经有现成的开源方案:vision-skill,给 Codex 加上眼睛。

  • vision-skill :一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」------读本地或网络图片,调用视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill
  • 视觉模型 :负责真正看图的那个。我选的是通义千问的 qwen3-vl-flash------专门看图的 VL 模型,日常读 UI / 截图够用,而且便宜。

qwen3-vl-flash 官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;并且新用户有一定的免费额度。

接入前准备

  • 已完成上一篇教程:Codex 接入 DeepSeek-V4-Flash。没接也不影响本教程,但配置环境一致,演示更顺
  • 一个阿里云百炼账号:没有就先注册
  • 一个 API Key:在百炼控制台创建(下一步演示)

第 1 步:在百炼控制台创建 API Key

登录阿里云百炼控制台,进 API-KEY 管理,创建一个密钥并复制。这个 Key 等下有用。

安全提醒:API Key 是钱袋子。它一旦粘贴进 Codex 对话,就会随请求发给背后的模型服务商,介意的话用完后去百炼控制台重置;也别写进公开教程、别提交到公开仓库------被人拿去就会烧你的额度。另外,开源项目装到本机前值得先过一遍代码,装完可以让 Codex 告诉你它改了哪些配置。

第 2 步:把仓库和 API Key 交给 Codex 自动配置

不用自己下载、不用手改配置,直接在 Codex 里粘贴下面这段,让它按 README 自己来:

markdown 复制代码
帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill),
按照 README 的说明进行配置。
视觉模型选择阿里云百炼的 qwen3-vl-flash,
API Key 是 sk-你的APIKey(换成你刚创建的那一个)。

注意:sk-你的APIKey 要替换成你自己在百炼创建的 Key,别照抄示例。

Codex 会自己下载仓库、检查环境、写入配置,全程不用你动手敲命令。

第 3 步:验证识图

配置搞定后,贴上一张截图让 Codex 识别。它能正确说出图片里是什么,就说明「眼睛」已经装上、识图生效了。

如果验证不通过,先回第 1 步确认 API Key 有没有填错,再让 Codex 检查一遍 vision-skill 的配置。

常见问题

Q:DeepSeek-V4-Flash 不能看图吗?

A:对。它是纯文本模型、不是多模态模型,本身没有识图能力,需要外挂一个视觉模型来补上。

Q:给 Codex 加视觉要额外花钱吗?

A:视觉模型按 token 计费,不是按张收费。以 qwen3-vl-flash 为例,输入 0.15 元 / 百万 tokens、输出 1.5 元 / 百万 tokens;新用户还有一定免费额度,日常看图成本很低。

Q:vision-skill 是什么?

A:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」------读本地或网络图片,调用视觉 API,把描述塞回对话。仓库在 github.com/asuojun/claude-vision-skill。

Q:必须用 qwen3-vl-flash 吗?

A:不一定。vision-skill 走 OpenAI 兼容格式,任何支持视觉的模型都能换。本文以 qwen3-vl-flash 为例,是因为它便宜、新用户有免费额度,日常读 UI 和截图够用。

Q:怎么确认 Codex 识图生效了?

A:配置后直接贴一张截图让 Codex 识别,它能正确描述图片内容就说明生效了。

参考文章:Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文

相关推荐
鱼樱前端2 小时前
用 AI 做内容变收入
前端·人工智能·ai编程
程序员黑豆4 小时前
Windows 系统 Java 环境变量配置全攻略:解决“不是内部或外部命令”
java·前端·ai编程
怕浪猫4 小时前
用 TRAE Work 来写这篇关于 TRAE Work 的征文
aigc·agent·ai编程
RETURN100ERRORS5 小时前
Agent - 记忆
ai编程
ServBay6 小时前
2026 年值得关注的 9 款 AI 工具,每月至少能省下40小时
aigc·ai编程
每天都是不一样的太阳7 小时前
用 TRAE Work 把 2 小时会议录音变成 5 分钟结构化纪要,这套 SOP 照搬就能用
ai编程
iini8 小时前
nRF Connect SDK 开发新体验:VS Code + Claude Code + DeepSeek + Nordic MCP 全流程(蓝牙开发实例)
agent·ai编程·nrf connect sdk·zephyr·蓝牙开发·deepseek·mcp·claude code·nordic mcp
程序员黑豆8 小时前
什么是JDK以及JDK都由哪些部分组成呢
java·前端·ai编程
浪遏9 小时前
11|进阶①:派小猫并行干活 + Agent 的自我认知
ai编程