大家好,我是晚安code。
之前还在吐槽:DeepSeek 网页端那个"识图模式",连梁文锋都能认成张一鸣。结果 8 月 21 号,DeepSeek 多模态视觉理解模型 V4-Flash-Vision-Exp 直接上线了 API 平台------多模态 Agent 能力逼近 Opus-4.8,价格却按文本价算,一张图最高 0.001 元。这篇我把能力、benchmark、定价、调用方式一次讲清楚,看到最后你会知道它到底适不适合你。先收藏,慢慢看。
一、DeepSeek 多模态视觉理解模型到底发了什么
DeepSeek 这波不是小迭代,是 V4 系列第一次真正长出眼睛。
2026 年 8 月 21 日,DeepSeek 在官方 API 平台上线了 deepseek-v4-flash-vision-exp(来源:DeepSeek 官方 API 文档)。名字里的 Exp 是 experimental,官方明确说了,这是实验性质模型,不建议直接上生产。
多模态视觉理解模型:能同时接收文字和图片输入、并基于两者做推理的大模型。你可以理解为「AI 的眼睛」------以前只会看字,现在能看图。
这款模型的能力构成很有意思:纯文本能力(Agent、推理、世界知识)和 V4-Flash 正式版基本持平,没有因为加了视觉而降级;但一旦任务需要"看懂图片",成绩直接起飞,官方口径是多模态 Agent 能力已接近 Claude Opus-4.8。上下文窗口 1M token,最大输出 384K,支持 JSON Output、Tool Calls,还兼容 Anthropic 的 API 格式。
说回我吐槽那事。6 月网页端先上过一版"识图模式",媒体实测发现它本质是 OCR,人脸、场景全翻车。这次的 V4-Flash-Vision-Exp 是真正的视觉理解,两层是两码事------所以官方把老识图模式和技术报告连夜下线重做,也算给这次留了个干净的起跑线。
OCR(光学字符识别):从图片里"读字"而不是"看图"的技术。你可以理解为「扫描仪的眼睛」,只认文字,不认画面。


二、能不能打?一张对比表看懂「Agent 逼近 Opus-4.8」
"逼近 Opus-4.8"是官方口径,参考意义大于绝对值------这份分数是 DeepSeek 自家 Harness 框架测的,还没经过第三方独立验证。
我把官方公开的部分 benchmark 整理成表(2026-08 官方数据,V4-Flash 为 0731 版本):
| 基准 | V4-Flash-Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | --- | 65.0 |
| ZeroBench (Pass@5) | 35.0 | --- | 34.0 |
看这张表,重点不是绝对值,是三个信号:几乎所有项都比 V4-Flash 纯文本版高,说明视觉能力真补上了;Agents' Last Exam、ZeroBench 两项反超 Opus-4.8,Chartography 只差 0.7;差距最大的是代码类任务,离旗舰还有一段路。我盯着 ApexBench 看了半天------从 26.2 跳到 36.5,这 10 分是实打实的质变,"看截图做 Agent 任务"这条路算是走通了。

三、一张图只要 0.001 元:DeepSeek 图片理解价格怎么算
视觉模型最怕"视觉溢价"------各家一沾图片就按像素加价。DeepSeek 这次直接把价格焊死在文本价上。
计费逻辑一句话:图片不按"张"收钱,而是按尺寸折算成 token,和文本一起计价,单张图片最多算 384 个 token。什么概念?GPT 和 Claude 处理同等分辨率的图,通常要吃掉 800~1100 token,DeepSeek 不到一半。
价格和 V4-Flash 完全一致(元/百万 token,2026-08 官方定价):
| 计费项 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入(缓存命中) | 0.05 | 0.10 |
| 输入(缓存未命中) | 1.5 | 3.0 |
| 输出 | 4.5 | 9.0 |
高峰时段是北京时间 9:00--12:00、14:00--18:00,其余减半。我顺手算了笔账:一张图按 384 token 封顶,高峰输入价 3 元/百万 token,就是 384 × 3 ÷ 1000000 ≈ 0.0012 元。跑几百张图也就几毛钱,比你不小心调错接口烧掉的那点钱还少。
这感觉就像奶茶店说"加珍珠不加价"------加料不加钱,还管够。


四、怎么调用:三种接口、三种传图、Files API 免费
传图这步,DeepSeek 一次给齐了三种姿势,从"临时试一张"到"批量复用"全覆盖。
接口上兼容三条路:Chat Completions(OpenAI 格式,base URL 用 https://api.deepseek.com)、Messages(Anthropic 兼容格式)、Responses。传图也三种:base64 内联、外部 URL、Files API。最值得说的是 Files API。
Files API :DeepSeek 同步上线的免费文件接口,先上传图片拿到 file_id,后续多个请求直接引用,同一张图不用反复传。你可以理解为「图片的一次性门票,买一次反复用」。每用户 25GiB 存储、上限 1 万个文件。
对跑多轮 Agent 工作流的人来说,这个设计太贴心:Agent 第一轮读到一张截图,后面每轮都要参考它,有了 file_id 就不用每次把图再塞一遍。
python
import base64, requests # deepseek-v4-flash-vision-exp 调用示例(2026-08)
img = base64.b64encode(open("bug.png", "rb").read()).decode()
resp = requests.post(
"https://api.deepseek.com/chat/completions",
headers={"Authorization": "Bearer <YOUR_KEY>"},
json={
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "这张截图哪里报错了?"},
{"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{img}"}},
],
}],
},
)
print(resp.json()["choices"][0]["message"]["content"])
可能有人会问:图片是按像素、还是按张收钱?
都不是。图片按尺寸折算成 token 计费,单张最多 384 个 token,和文本同价,没有单独的"视觉费"。
五、实测能干什么:报错截图、发票、设计稿转页面
看截图写代码,是这模型目前最省事的用法------把报错截图直接甩给它,比贴一坨日志靠谱。
这些不是我瞎编的,是媒体公开实测过的场景:有人把 GitHub 页面的报错截图丢给它,它精准定位到 github-dashboard.html 第 682 行的 TypeError,还完成了从定位到修复的闭环;有人拿发票截图给它,它把类型、号码、日期拆成结构化字段;还有人拿设计稿截图,26 秒出了个配色布局几乎一致的响应式页面,连 hover 动效都自己加上。网易的作者甚至用它做了个《牛来》小游戏。

不过丑话说在前头:它毕竟带 Exp 后缀,官方自己都没承诺什么时候转正式版、会不会开源。以 2026 年 8 月为准,这模型适合拿来跑 Demo、搭视觉 Agent 原型、验证"看图干活"这条路,不适合把生产流量直接压上去------Exp 就是明晃晃的免责声明。

我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你会拿 DeepSeek 多模态视觉理解模型来识什么图?报错截图、发票还是设计稿?评论区聊聊你的用法。