
大家期待已久的 DeepSeek 多模态模型终于上线了。8 月 21 日,官方 X 发布公告上线多模态支持,模型 ID 为 deepseek-v4-flash-vision-exp,价格与 deepseek-v4-flash 保持一致。

使用 model='deepseek-v4-flash-vision-exp' 即可调用。此外,DeepSeek Harness 0.1.1 已于 8 月 21 日发布,内置对新模型的支持。
模型性能与价格

价格方面,与 deepseek-v4-flash 一致。百万 tokens 输入缓存命中,空闲时段为 0.05 元 ,高峰时段为 0.1 元 。百万 tokens 输出,空闲时段为 4.5 元 ,高峰时段为 9.0 元。
空闲时段价格为高峰时段价格的一半。高峰时段为北京时间 9:00 至 12:00 、14:00 至 18:00,其余时间为空闲时段。
官方定价说明见 DeepSeek API 定价。

官方 Chat 入口
打开 DeepSeek 官网,选择「识图模式」。

上传图片即可测试效果。

在 DeepSeek Harness 中使用
桌面客户端,适合新手
如果你没有 Mac 和 Node.js 环境,或不想一直开着浏览器标签页,可以使用社区基于 DeepSeek Harness 构建的开源桌面客户端 DSH Desktop。
它让 dsh 脱离浏览器、以原生窗口直接运行,支持多窗口和系统托盘常驻。官网提供 Mac 与 Windows 的安装包,启动时会自动拉起 dsh web 本地服务,对新手更友好。

更新 dsh 到最新版本
第一次安装 dsh,可参考博客的 DeepSeek Harness 安装配置保姆教程。
如果此前已经安装过 dsh,使用下面的命令升级到最新版:
bash
npx @deepseek-ai/dsh@latest web
如果命令太慢或卡住,可以从下面几种方式里选择一种。
bash
# 换 npm 镜像源
npx --registry=https://registry.npmmirror.com @deepseek-ai/dsh@latest web
# 永久使用镜像源
npm config set registry https://registry.npmmirror.com
# 全局安装,后续直接运行
npm install -g @deepseek-ai/dsh
dsh web
# 通过代理下载
HTTPS_PROXY=http://127.0.0.1:7890 npx @deepseek-ai/dsh@latest web
# 查看命中的 registry 和下载阶段
npm --loglevel=http npx @deepseek-ai/dsh@latest web
更新后运行 dsh --version,确认版本已经更新。不了解 DeepSeek Harness 的读者,也可以先阅读 官方介绍。

启动 Web GUI
执行 dsh web,然后打开 http://127.0.0.1:3080/。
bash
dsh web
启动后,在 DeepSeek 模型分组中会出现新增的「DeepSeek-V4-Flash-Vision-Exp」选项,选择它即可测试。

上传一张图片测试,响应时间约为 4 秒。

通过 API Key 接入
cc-switch
这里演示用 cc-switch 配置。前往 DeepSeek 开放平台 获取 API Key,然后按截图填写信息。

点击「获取模型列表」,在默认兜底模型中选择 deepseek-v4-flash-vision-exp,勾选 1M,再点击上方的「一键设置」。

以下是配置完成后的效果。

回到 cc-switch 首页,点击「启用」,配置即完成。

选择刚才添加的模型后,直接在 Claude Code CLI 中测试。同一张图片约 6 秒即可响应,内容也比较简洁准确,会从「人物」「场景」「特征」三个角度描述画面。

智谱 ZCode
ZCode 是智谱官方的 AI Agents Harness 项目,官网介绍是「简单、迅捷、氛围十足」。下载地址见 ZCode。

选择刚才添加的模型,使用同一张图片测试。

约 13 秒成功响应,内容与前面的测试基本一致,速度稍慢一些。

Obsidian,可选
如果你使用 Obsidian,配置好 Claudian 插件后即可直接对话。插件会自动加载 Claude Code CLI 的模型,也就是前面在 cc-switch 中配置的模型。


这次识图能力意味着什么
放在更大的背景看,这次更新补上了开源阵营长期缺失的一块:好用的视觉理解。
过去想在 Agent 工作流里加图片识别,选择其实很有限:要么走 MCP 方案(例如 GML),要么依赖 ChatGPT、豆包 seed 系列这类闭源多模态模型,门槛不低------就连 Claude Code 官方,至今也不支持图片识别。
而现在,一个与 Flash 同价、实测几秒内响应、还能直接挂进 Claude Code CLI 生态的开源视觉模型出现了。对开发者来说,「用得起」和「用得上」第一次同时成立,它很可能成为第一个兼顾性价比与实用性的开源图像识别方案。
往后看,它可以接入更多现有工作流与 Agent,衍生出图片识别、图片修复和编辑等场景,进一步拓宽 AIGC 开源生态的应用边界。