DeepSeek 多模态视觉理解模型上线:Agent 逼近 Opus-4.8

大家好,我是晚安code。

之前还在吐槽:DeepSeek 网页端那个"识图模式",连梁文锋都能认成张一鸣。结果 8 月 21 号,DeepSeek 多模态视觉理解模型 V4-Flash-Vision-Exp 直接上线了 API 平台------多模态 Agent 能力逼近 Opus-4.8,价格却按文本价算,一张图最高 0.001 元。这篇我把能力、benchmark、定价、调用方式一次讲清楚,看到最后你会知道它到底适不适合你。先收藏,慢慢看。

一、DeepSeek 多模态视觉理解模型到底发了什么

DeepSeek 这波不是小迭代,是 V4 系列第一次真正长出眼睛。

2026 年 8 月 21 日,DeepSeek 在官方 API 平台上线了 deepseek-v4-flash-vision-exp(来源:DeepSeek 官方 API 文档)。名字里的 Exp 是 experimental,官方明确说了,这是实验性质模型,不建议直接上生产。

多模态视觉理解模型:能同时接收文字和图片输入、并基于两者做推理的大模型。你可以理解为「AI 的眼睛」------以前只会看字,现在能看图。

这款模型的能力构成很有意思:纯文本能力(Agent、推理、世界知识)和 V4-Flash 正式版基本持平,没有因为加了视觉而降级;但一旦任务需要"看懂图片",成绩直接起飞,官方口径是多模态 Agent 能力已接近 Claude Opus-4.8。上下文窗口 1M token,最大输出 384K,支持 JSON Output、Tool Calls,还兼容 Anthropic 的 API 格式。

说回我吐槽那事。6 月网页端先上过一版"识图模式",媒体实测发现它本质是 OCR,人脸、场景全翻车。这次的 V4-Flash-Vision-Exp 是真正的视觉理解,两层是两码事------所以官方把老识图模式和技术报告连夜下线重做,也算给这次留了个干净的起跑线。

OCR(光学字符识别):从图片里"读字"而不是"看图"的技术。你可以理解为「扫描仪的眼睛」,只认文字,不认画面。

二、能不能打?一张对比表看懂「Agent 逼近 Opus-4.8」

"逼近 Opus-4.8"是官方口径,参考意义大于绝对值------这份分数是 DeepSeek 自家 Harness 框架测的,还没经过第三方独立验证。

我把官方公开的部分 benchmark 整理成表(2026-08 官方数据,V4-Flash 为 0731 版本):

基准 V4-Flash-Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83.9 82.7 85.0
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 --- 65.0
ZeroBench (Pass@5) 35.0 --- 34.0

看这张表,重点不是绝对值,是三个信号:几乎所有项都比 V4-Flash 纯文本版高,说明视觉能力真补上了;Agents' Last Exam、ZeroBench 两项反超 Opus-4.8,Chartography 只差 0.7;差距最大的是代码类任务,离旗舰还有一段路。我盯着 ApexBench 看了半天------从 26.2 跳到 36.5,这 10 分是实打实的质变,"看截图做 Agent 任务"这条路算是走通了。

三、一张图只要 0.001 元:DeepSeek 图片理解价格怎么算

视觉模型最怕"视觉溢价"------各家一沾图片就按像素加价。DeepSeek 这次直接把价格焊死在文本价上。

计费逻辑一句话:图片不按"张"收钱,而是按尺寸折算成 token,和文本一起计价,单张图片最多算 384 个 token。什么概念?GPT 和 Claude 处理同等分辨率的图,通常要吃掉 800~1100 token,DeepSeek 不到一半。

价格和 V4-Flash 完全一致(元/百万 token,2026-08 官方定价):

计费项 空闲时段 高峰时段
输入(缓存命中) 0.05 0.10
输入(缓存未命中) 1.5 3.0
输出 4.5 9.0

高峰时段是北京时间 9:00--12:00、14:00--18:00,其余减半。我顺手算了笔账:一张图按 384 token 封顶,高峰输入价 3 元/百万 token,就是 384 × 3 ÷ 1000000 ≈ 0.0012 元。跑几百张图也就几毛钱,比你不小心调错接口烧掉的那点钱还少。

这感觉就像奶茶店说"加珍珠不加价"------加料不加钱,还管够。

四、怎么调用:三种接口、三种传图、Files API 免费

传图这步,DeepSeek 一次给齐了三种姿势,从"临时试一张"到"批量复用"全覆盖。

接口上兼容三条路:Chat Completions(OpenAI 格式,base URL 用 https://api.deepseek.com)、Messages(Anthropic 兼容格式)、Responses。传图也三种:base64 内联、外部 URL、Files API。最值得说的是 Files API。

Files API :DeepSeek 同步上线的免费文件接口,先上传图片拿到 file_id,后续多个请求直接引用,同一张图不用反复传。你可以理解为「图片的一次性门票,买一次反复用」。每用户 25GiB 存储、上限 1 万个文件。

对跑多轮 Agent 工作流的人来说,这个设计太贴心:Agent 第一轮读到一张截图,后面每轮都要参考它,有了 file_id 就不用每次把图再塞一遍。

python 复制代码
import base64, requests  # deepseek-v4-flash-vision-exp 调用示例(2026-08)

img = base64.b64encode(open("bug.png", "rb").read()).decode()
resp = requests.post(
    "https://api.deepseek.com/chat/completions",
    headers={"Authorization": "Bearer <YOUR_KEY>"},
    json={
        "model": "deepseek-v4-flash-vision-exp",
        "messages": [{
            "role": "user",
            "content": [
                {"type": "text", "text": "这张截图哪里报错了?"},
                {"type": "image_url",
                 "image_url": {"url": f"data:image/png;base64,{img}"}},
            ],
        }],
    },
)
print(resp.json()["choices"][0]["message"]["content"])

可能有人会问:图片是按像素、还是按张收钱?

都不是。图片按尺寸折算成 token 计费,单张最多 384 个 token,和文本同价,没有单独的"视觉费"。

五、实测能干什么:报错截图、发票、设计稿转页面

看截图写代码,是这模型目前最省事的用法------把报错截图直接甩给它,比贴一坨日志靠谱。

这些不是我瞎编的,是媒体公开实测过的场景:有人把 GitHub 页面的报错截图丢给它,它精准定位到 github-dashboard.html 第 682 行的 TypeError,还完成了从定位到修复的闭环;有人拿发票截图给它,它把类型、号码、日期拆成结构化字段;还有人拿设计稿截图,26 秒出了个配色布局几乎一致的响应式页面,连 hover 动效都自己加上。网易的作者甚至用它做了个《牛来》小游戏。

不过丑话说在前头:它毕竟带 Exp 后缀,官方自己都没承诺什么时候转正式版、会不会开源。以 2026 年 8 月为准,这模型适合拿来跑 Demo、搭视觉 Agent 原型、验证"看图干活"这条路,不适合把生产流量直接压上去------Exp 就是明晃晃的免责声明。


我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你会拿 DeepSeek 多模态视觉理解模型来识什么图?报错截图、发票还是设计稿?评论区聊聊你的用法。

相关推荐
用户938515635071 小时前
从一个"房子"讲起:为什么 Next.js 是面向 AI 的全栈框架(附博客实战拆解)
ai编程·全栈·next.js
钱六两2 小时前
Spring AI Advisor:一行代码解决 AI 应用"面条代码"
ai编程
wangruofeng4 小时前
1.17 万赞的 Claude 技能,源码只有 321 字节:拆解 Anthropic 内部疯传的 ELI5
aigc·ai编程·claude
Flynt5 小时前
从 Claude Code 切到 Pi 跑了一阵,聊聊真实体感
agent·ai编程·claude
潘高6 小时前
如何用AI做出高质量的PPT
ai编程
全栈弄潮儿7 小时前
先让 AI 出方案,再让它写代码:新手也能使用的设计习惯
aigc·openai·ai编程
long3167 小时前
封装(Encapsulation)
java·人工智能·ai·ai编程
zandy10118 小时前
AI编程工具技术测评2026:Kimi Code、Cursor等6款常见编程软件选型清单
ai编程
就叫飞六吧8 小时前
两道门:X-Frame-Options 和 SameSite 到底谁管什么
开发语言·chrome·ai编程