DeepSeek 涨价之后,我的余额扛不住了!

然后 DeepSeek 视觉模型又来了,看来还得冲一波。今天这篇重点来看一下它这个 Vision 体验版效果如何!
DS 有原生视觉模型了,这可是大事情!因为终于补齐短板了,唯一的遗憾点是之前涨了一波价格。
开始之前先来一个娱乐局:

请问这个帅哥是谁?

DeepSeek 答案是:这是袁进辉。好你个袁进辉,竟然敢假冒梁文峰爷爷。
从这个例子可以看出来,在认人这一块还是个"睁眼瞎"! 其实和官网之前放出的识图功能差不多。
其他,我就不废话了,分两个部分。一部分是看官方的基准数据(卖家秀),另一部分用 DSH 实测一下(买家秀)。
基准部分
每次测试新模型之前,我们都会先看一下官方怎么说(卖家秀),官方主要是发了一张基准图片:

并配文:
今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置
model='deepseek-v4-flash-vision-exp'访问该模型。
核心表达了几个点:
平衡文本和多模态能力
多模态能力解锁更多 Agent 场景(例子:做 PPT,DSH 官网二创,制作黏土怪物分格前端)
好了,没有其他了。
从基准中看,多模态相关的内容就四项,对标的是 Opus 4.8,按字面来看,是五五开!
但是,这里面很多常见的基准都没有。 我对它展示的某些基准也不是很熟悉,所以特意问了一下 GPT5.6。
| 基准 | 发布时间 | 主要测试内容 | 特点 |
|---|---|---|---|
| APEX-Bench | 2026 年 1 月 | 按要求修改学术论文海报 | 视觉编辑、指令执行、布局与审美 |
| Chartography | 2026 年 8 月 | 理解专业领域复杂图表 | 医疗曲线、金融K线、工程图、桑基图等 |
| ZeroBench | 2025 年 | 极难视觉推理 | 人工筛选的多步视觉难题,最初前沿模型接近零分 |
然后我也问了下,K3 和 Opus 4.8 发布的时候公布了哪些基准,GPT 告诉我 K3 发布的多模态基准比较强,比较全面,要比 DS 这个多很多。
因为每家都不一样,然后我让 GPT 帮我整理了一个能对上的基准。
| 基准 | DeepSeek Vision Exp | Opus 4.8 | Opus 5 | K3 | 可比性 |
|---|---|---|---|---|---|
| APEX-Bench Pass@1 | 36.5 | 39.4 | --- | --- | DeepSeek 与 Opus 4.8 可直接比较 |
| Chartography | 64.3 / 63.3 | 65.0 | 29.6 / 83.0 | --- | 必须区分是否使用裁剪与代码工具 |
| ZeroBench Pass@5 | 35.0 | 34.0 | 26.0 无工具 | 23.0 / 41.0 | DeepSeek、Opus 4.8 的数字疑似工具增强口径 |
| MMMU-Pro | --- | 78.9 / 82.7 | 约 84.7 | 81.6 / 83.4 | K3 与 Opus 4.8 可直接比较 |
| CharXiv Reasoning | --- | 80.5 / 89.9 | 约 91 | 84.8 / 91.3 | 无工具与 Python 工具 |
| MathVision | --- | 86.7 / 97.1 | --- | 94.3 / 97.8 | K3 与 Opus 4.8 可直接比较 |
| OSWorld-Verified | --- | 83.4 | --- | 84.8 | 同类电脑操作评测 |
| OSWorld 2.0 | --- | 55.7 | 约 70.6 | 58.3 | Opus 5 发布重点 |
| OfficeQA Pro | --- | 63.9 | 约 66.9 | 63.3 | PDF 全部渲染为图片 |
| BabyVision with Python | --- | 81.2 | --- | 85.7 | 使用 Python 工具 |
从图中可以看,Opus 4.8 虽然不是专门的视觉模型,但是和视觉相关的基准数据还是很多的。Claude 家模型发布的时候都会有一个几百页的模型卡片,详细展示这个模型。
同时我也问了下 GPT,它对 DS 的这些基准怎么看,以及为什么放这几个,背后的原因是什么。
GPT 的结论是:
多模态 Agent 能力进入第一梯队,接近 Opus 4.8;但还不能证明它是综合视觉第一梯队。
更准确地说,它像是一个"能看图片、截图和图表的 V4 Flash Agent",而不是专门强化摄影图片理解、OCR、视频理解的传统视觉大模型。
意图:
第一层意图
DeepSeek 不是想把它宣传成通用视觉模型
第二层意图
DeepSeek 刻意选择了最有利于形成宣传结论的四项测试。
第三层原因
这可能也反映出模型当前存在偏科。
没放的数据大概率不是当前版本最有优势的部分。这是合理推测
另外它还补充了一些内容:
diff
我倾向于判断,这个实验版可能重点训练了:
- 截图理解
- 图表理解
- 文档与图片信息提取
- 视觉信息参与工具调用
- 代码 Agent 中的图片输入
- 多模态长任务执行
而没有重点强化:
- 通用视觉问答
- 复杂 OCR
- 精确坐标定位
- 视频理解
- GUI 点击和操作
- 摄影图片细节识别
GPT 对于这种问题的理解,也是成精了!
其实不看 GPT,我也大概有数了。之所以问 GPT,只是为了让部分人知道,这并不单单是我的判断,它的"同行"对里面的道道门儿清。
大概就是抽了极少数能跑赢或者接近 Opus 4.8 的基准,营造出能和 Opus 4.8 五五开的感觉。
实测部分
数据部分的信息是比较枯燥的,而且还容易掺水。我们进入"有趣"的实测环节,我从来不按套路出题。我手上例子很多,但是由于余额已经不足了,同时也还有好多其他模型要测试,所以我们重点来测试一个例子。
这个例子叫"甲维斯的车库"!也是一个多维度考察的例子。
因为 DS 终于有视觉了,所以终于可以跑这个题目了。
这个题目会给两张参考图,一个是人物,一个是 3D 网页图片。

这个题目的关键考察点如下:

简单来说,这是考察它网页复刻能力、参考图建模能力,以及自主建模能力。同时要一定的世界知识,比如三蹦子到底是什么,它得理解,并能想象出它的样子。
好了,题目介绍完了,我们就直接打开 DSH,并且切换到 Vision-Exp 模型!

这次是官方DSH,标准模式,最新版本了哦,还有什么意见?是不是得选max,这个我就不选了,无数实验论证,High最具性价比。
然后就是等待了:

经过 24 分钟,全部搞定了,来看结果吧!
结果如下:

参考图如下:

首先来说好的部分:
有了视觉能力之后果然是另外一个高度了。整体的布局和定位都是准的啊,而且每个功能模块都在了,这一点值得表扬。而且它这个科技灰的配色,看着也不错。
但是:
它这个配色错了,我的意图是让它复刻这个效果,但是要塞入我的人物和不同的载具。它自作主张改了配色,其实可能不是自作主张问题,而且它无法精准识别配色。从界面上看,配色错误的地方非常多。
另外一个问题,它底部的工具条还原度较低。首先是颜色选项它搞了 8 个,我的参考图是 4 个,另外控制测试和自动旋转的控件也不够像。还有左下角拖动和滚动的提升没有复现。
上面它没做好的这几个点,其它带视觉模型很久之前已经做得不错了。我之前测过的有 Fable 5、GPT 5.6 Sol、Grok 4.5、K3。它们在多模态复刻方面都比这个 DSV 要强。
另外一个很重要的维度:3D 建模。

这一部分,我就不客气地直说了啊,完全是一塌糊涂。
你看这个人物建模和这个车子建模,根本没法看啊。唯一的欣慰点是,车子确实看起来像个车子,人也像个人,只是你不能要求它好不好。
其实结果已经很清晰了!
下面,我们可以稍微来观察一下它的制作过程。

这是刚开始的时候!
它是先查看了一下目录,然后发现了图片文件。
然后调用工具对两张图片进行分析。
最后获取了一个分析结果。
然后是制作了一个任务清单:

我整理和翻译如下:
| 任务 | 状态 |
|---|---|
搭建网页基础结构和 CSS,还原参考图 2.png 的布局与配色 |
进行中 |
| 创建 Three.js 3D 场景,实现旋转、缩放、自动旋转和预设视角 | 未开始 |
| 创建 9 个风格化 3D 载具模型:自行车、电动滑板车、摩托车、三轮车、五菱、特斯拉、小米、保时捷、钢铁侠 | 未开始 |
| 创建 Q 版 Jarvis 角色:刺猬头、青色墨镜、霓虹夹克,作为骑手或伙伴 | 未开始 |
| 实现交互功能:载具列表、数据面板、车漆颜色、视角按钮、滑块和自动旋转 | 未开始 |
| 最终检查并运行单个 HTML 文件,然后报告文件位置 | 未开始 |
这个思路还是很清晰的!
然后是校验部分:

它是写了测试脚本,然后也做截图进行了验证,同时也做了各种语法校验。
所以最后也是没有任何基础错误的!
整个流程还是和 Flash 一样,比较清晰。DeepSeek 终于完成了多模态识别、自己开发、自己截图验证的全套闭环。
对 DeepSeek 用户来说,这是一个好消息。
但是有些东西我也不得不说,大家还是要有一个清晰的认知。
我要吐槽几个点:
第一个:
好好的中文模型,老是飙英文,这一点要批评一下!你这是跟谁学坏的啊。
我目前手里只有一个叫 Claude 的家伙,中文需求,会时不时搞出英文输出!毕竟人家是不让中国人用的老外模型,我也能理解。但是你这个"国产之光",老是飙英文不太好吧。
第二个:
它这个任务列表非常不直观,还得我去看 JSON 数据,然后一条一条看具体的英文内容。
第三个:
视觉识别能力和基于视觉的修正非常有限,只能说比没有强了很多,但是比同行弱了不少。
另外从整个工具+模型的角度来说:DSH + DS 基本上没啥体验可言!
安装很慢,里面带了一堆东西,优化的并不好。
对大众的使用体验也非常不好。
网页版的智能体用起来总是很难受。
这种项目几天功夫近 20 万 Star 是"德不配位"的。这和项目本身没有太大关系,主要是 DeepSeek 的名声,属于流量项目,而非真实效果和体验。
体验差其实没关系,它可以慢慢改。只是世界不会等它,其它人已经跑太前面了,模型、Agent、各种功能和体验,整套东西都已经非常完善了。
标题中说的 DeepSeek 是"睁眼瞎",只是开个玩笑。它并不是看不见,而是视觉能力非常有限,这一点其实从它的基准数量就能感受出来了。
我最近深深地感受到,DeepSeek 不是在引领潮流,只是在努力追赶而已,每次测试,相比其他模型而言,都没有任何惊喜,感觉不到它有特别领先的地方。
如果连低价优势都没有了,我不知道用它的理由是什么。现在连不太懂的网友都开始在"梁圣"和"梁子"之间摇摆了。
最后我吐槽一个点:那些晚上和周末降价,平时涨价的模型,都不是东西,让不让人休息了。

虽然可以分流,😡但是价值观有严重问题。 谁TM周末搞业务啊,周末应该好好休息,享受人生,而不是做卷王。
还有模型发布选周五和周末的,我要严厉批评😡😡😡!
模型特别牛逼,让我心甘情愿加班的除外!