DeepSeek还是“睁眼瞎” ,最新视觉模型测试!

DeepSeek 涨价之后,我的余额扛不住了!

然后 DeepSeek 视觉模型又来了,看来还得冲一波。今天这篇重点来看一下它这个 Vision 体验版效果如何!

DS 有原生视觉模型了,这可是大事情!因为终于补齐短板了,唯一的遗憾点是之前涨了一波价格。

开始之前先来一个娱乐局:

请问这个帅哥是谁?

DeepSeek 答案是:这是袁进辉。好你个袁进辉,竟然敢假冒梁文峰爷爷

从这个例子可以看出来,在认人这一块还是个"睁眼瞎"! 其实和官网之前放出的识图功能差不多。

其他,我就不废话了,分两个部分。一部分是看官方的基准数据(卖家秀),另一部分用 DSH 实测一下(买家秀)。

基准部分

每次测试新模型之前,我们都会先看一下官方怎么说(卖家秀),官方主要是发了一张基准图片:

并配文:

今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。

核心表达了几个点:

平衡文本和多模态能力

多模态能力解锁更多 Agent 场景(例子:做 PPT,DSH 官网二创,制作黏土怪物分格前端)

好了,没有其他了。

从基准中看,多模态相关的内容就四项,对标的是 Opus 4.8,按字面来看,是五五开!

但是,这里面很多常见的基准都没有。 我对它展示的某些基准也不是很熟悉,所以特意问了一下 GPT5.6。

基准 发布时间 主要测试内容 特点
APEX-Bench 2026 年 1 月 按要求修改学术论文海报 视觉编辑、指令执行、布局与审美
Chartography 2026 年 8 月 理解专业领域复杂图表 医疗曲线、金融K线、工程图、桑基图等
ZeroBench 2025 年 极难视觉推理 人工筛选的多步视觉难题,最初前沿模型接近零分

然后我也问了下,K3 和 Opus 4.8 发布的时候公布了哪些基准,GPT 告诉我 K3 发布的多模态基准比较强,比较全面,要比 DS 这个多很多。

因为每家都不一样,然后我让 GPT 帮我整理了一个能对上的基准。

基准 DeepSeek Vision Exp Opus 4.8 Opus 5 K3 可比性
APEX-Bench Pass@1 36.5 39.4 --- --- DeepSeek 与 Opus 4.8 可直接比较
Chartography 64.3 / 63.3 65.0 29.6 / 83.0 --- 必须区分是否使用裁剪与代码工具
ZeroBench Pass@5 35.0 34.0 26.0 无工具 23.0 / 41.0 DeepSeek、Opus 4.8 的数字疑似工具增强口径
MMMU-Pro --- 78.9 / 82.7 约 84.7 81.6 / 83.4 K3 与 Opus 4.8 可直接比较
CharXiv Reasoning --- 80.5 / 89.9 约 91 84.8 / 91.3 无工具与 Python 工具
MathVision --- 86.7 / 97.1 --- 94.3 / 97.8 K3 与 Opus 4.8 可直接比较
OSWorld-Verified --- 83.4 --- 84.8 同类电脑操作评测
OSWorld 2.0 --- 55.7 约 70.6 58.3 Opus 5 发布重点
OfficeQA Pro --- 63.9 约 66.9 63.3 PDF 全部渲染为图片
BabyVision with Python --- 81.2 --- 85.7 使用 Python 工具

从图中可以看,Opus 4.8 虽然不是专门的视觉模型,但是和视觉相关的基准数据还是很多的。Claude 家模型发布的时候都会有一个几百页的模型卡片,详细展示这个模型。

同时我也问了下 GPT,它对 DS 的这些基准怎么看,以及为什么放这几个,背后的原因是什么。

GPT 的结论是:

多模态 Agent 能力进入第一梯队,接近 Opus 4.8;但还不能证明它是综合视觉第一梯队。

更准确地说,它像是一个"能看图片、截图和图表的 V4 Flash Agent",而不是专门强化摄影图片理解、OCR、视频理解的传统视觉大模型。

意图:

第一层意图

DeepSeek 不是想把它宣传成通用视觉模型

第二层意图

DeepSeek 刻意选择了最有利于形成宣传结论的四项测试。

第三层原因

这可能也反映出模型当前存在偏科。

没放的数据大概率不是当前版本最有优势的部分。这是合理推测

另外它还补充了一些内容:

diff 复制代码
我倾向于判断,这个实验版可能重点训练了:
​
- 截图理解
- 图表理解
- 文档与图片信息提取
- 视觉信息参与工具调用
- 代码 Agent 中的图片输入
- 多模态长任务执行
​
而没有重点强化:
​
- 通用视觉问答
- 复杂 OCR
- 精确坐标定位
- 视频理解
- GUI 点击和操作
- 摄影图片细节识别

GPT 对于这种问题的理解,也是成精了!

其实不看 GPT,我也大概有数了。之所以问 GPT,只是为了让部分人知道,这并不单单是我的判断,它的"同行"对里面的道道门儿清。

大概就是抽了极少数能跑赢或者接近 Opus 4.8 的基准,营造出能和 Opus 4.8 五五开的感觉。

实测部分

数据部分的信息是比较枯燥的,而且还容易掺水。我们进入"有趣"的实测环节,我从来不按套路出题。我手上例子很多,但是由于余额已经不足了,同时也还有好多其他模型要测试,所以我们重点来测试一个例子。

这个例子叫"甲维斯的车库"!也是一个多维度考察的例子。

因为 DS 终于有视觉了,所以终于可以跑这个题目了。

这个题目会给两张参考图,一个是人物,一个是 3D 网页图片。

这个题目的关键考察点如下:

简单来说,这是考察它网页复刻能力、参考图建模能力,以及自主建模能力。同时要一定的世界知识,比如三蹦子到底是什么,它得理解,并能想象出它的样子。

好了,题目介绍完了,我们就直接打开 DSH,并且切换到 Vision-Exp 模型!

这次是官方DSH,标准模式,最新版本了哦,还有什么意见?是不是得选max,这个我就不选了,无数实验论证,High最具性价比。

然后就是等待了:

经过 24 分钟,全部搞定了,来看结果吧!

结果如下:

参考图如下:

首先来说好的部分:

有了视觉能力之后果然是另外一个高度了。整体的布局和定位都是准的啊,而且每个功能模块都在了,这一点值得表扬。而且它这个科技灰的配色,看着也不错。

但是:

它这个配色错了,我的意图是让它复刻这个效果,但是要塞入我的人物和不同的载具。它自作主张改了配色,其实可能不是自作主张问题,而且它无法精准识别配色。从界面上看,配色错误的地方非常多。

另外一个问题,它底部的工具条还原度较低。首先是颜色选项它搞了 8 个,我的参考图是 4 个,另外控制测试和自动旋转的控件也不够像。还有左下角拖动和滚动的提升没有复现。

上面它没做好的这几个点,其它带视觉模型很久之前已经做得不错了。我之前测过的有 Fable 5、GPT 5.6 Sol、Grok 4.5、K3。它们在多模态复刻方面都比这个 DSV 要强。

另外一个很重要的维度:3D 建模。

这一部分,我就不客气地直说了啊,完全是一塌糊涂。

你看这个人物建模和这个车子建模,根本没法看啊。唯一的欣慰点是,车子确实看起来像个车子,人也像个人,只是你不能要求它好不好。

其实结果已经很清晰了!

下面,我们可以稍微来观察一下它的制作过程。

这是刚开始的时候!

它是先查看了一下目录,然后发现了图片文件。

然后调用工具对两张图片进行分析。

最后获取了一个分析结果。

然后是制作了一个任务清单:

我整理和翻译如下:

任务 状态
搭建网页基础结构和 CSS,还原参考图 2.png 的布局与配色 进行中
创建 Three.js 3D 场景,实现旋转、缩放、自动旋转和预设视角 未开始
创建 9 个风格化 3D 载具模型:自行车、电动滑板车、摩托车、三轮车、五菱、特斯拉、小米、保时捷、钢铁侠 未开始
创建 Q 版 Jarvis 角色:刺猬头、青色墨镜、霓虹夹克,作为骑手或伙伴 未开始
实现交互功能:载具列表、数据面板、车漆颜色、视角按钮、滑块和自动旋转 未开始
最终检查并运行单个 HTML 文件,然后报告文件位置 未开始

这个思路还是很清晰的!

然后是校验部分:

它是写了测试脚本,然后也做截图进行了验证,同时也做了各种语法校验。

所以最后也是没有任何基础错误的!

整个流程还是和 Flash 一样,比较清晰。DeepSeek 终于完成了多模态识别、自己开发、自己截图验证的全套闭环。

对 DeepSeek 用户来说,这是一个好消息。

但是有些东西我也不得不说,大家还是要有一个清晰的认知。

我要吐槽几个点:

第一个:

好好的中文模型,老是飙英文,这一点要批评一下!你这是跟谁学坏的啊。

我目前手里只有一个叫 Claude 的家伙,中文需求,会时不时搞出英文输出!毕竟人家是不让中国人用的老外模型,我也能理解。但是你这个"国产之光",老是飙英文不太好吧。

第二个:

它这个任务列表非常不直观,还得我去看 JSON 数据,然后一条一条看具体的英文内容。

第三个:

视觉识别能力和基于视觉的修正非常有限,只能说比没有强了很多,但是比同行弱了不少。

另外从整个工具+模型的角度来说:DSH + DS 基本上没啥体验可言!

安装很慢,里面带了一堆东西,优化的并不好。

对大众的使用体验也非常不好。

网页版的智能体用起来总是很难受。

这种项目几天功夫近 20 万 Star 是"德不配位"的。这和项目本身没有太大关系,主要是 DeepSeek 的名声,属于流量项目,而非真实效果和体验。

体验差其实没关系,它可以慢慢改。只是世界不会等它,其它人已经跑太前面了,模型、Agent、各种功能和体验,整套东西都已经非常完善了。

标题中说的 DeepSeek 是"睁眼瞎",只是开个玩笑。它并不是看不见,而是视觉能力非常有限,这一点其实从它的基准数量就能感受出来了。

我最近深深地感受到,DeepSeek 不是在引领潮流,只是在努力追赶而已,每次测试,相比其他模型而言,都没有任何惊喜,感觉不到它有特别领先的地方。

如果连低价优势都没有了,我不知道用它的理由是什么。现在连不太懂的网友都开始在"梁圣"和"梁子"之间摇摆了。

最后我吐槽一个点:那些晚上和周末降价,平时涨价的模型,都不是东西,让不让人休息了。

虽然可以分流,😡但是价值观有严重问题。 谁TM周末搞业务啊,周末应该好好休息,享受人生,而不是做卷王。

还有模型发布选周五和周末的,我要严厉批评😡😡😡!

模型特别牛逼,让我心甘情愿加班的除外!

相关推荐
SkyWalking中文站9 小时前
看清 Claude Code 的用量与文件变更
人工智能·ai编程·claude
飞哥数智坊10 小时前
TraeCode 180积分帮我做了一套系统,全程我感觉自己有点多余
人工智能·ai编程
AI人工智能集结号10 小时前
GEO优化公司怎么选?从检测、诊断到执行判断服务是否完整
人工智能
酒旅Agent开发实战10 小时前
开发者如何选择API和MCP
人工智能·大模型·酒店预订·ai agent·mcp
人民广场吃泡面10 小时前
什么是AI Agent?它又能给前端带来哪些效率提升?
前端·人工智能
沈管家AI数字员工10 小时前
自研 AI 智能体 vs 采购数字员工平台:成本、风险与周期的真实对比
人工智能
集成电路芯片封装设备10 小时前
除氧型真空共晶设备技术详解:从原理到应用
人工智能
武汉星际互动11 小时前
咨询量大、时段受限、口语化难识别,政务AI数字人如何承接大厅导办?
人工智能·政务
资讯综合11 小时前
500亿招聘市场悖论:AI技术能否填平行业的信任深坑
大数据·人工智能
早睡早起身体好12311 小时前
用 XGrammar 约束大模型工具调用:解决参数为空的问题
android·人工智能·神经网络·机器学习·自然语言处理·vllm