我曾经因为 DS 的风格和梁文锋说的那句话,而对 DS 充满了好感。
但是,我对DeepSeek的好感所剩无几了!
搞技术,实力为尊,做产品,体验为上,其它说再多都无用。
我这篇文章本来的标题是"辣鸡......",后来想想算了!
我对DS 最近的印象是:新版 Pro 很拉胯,编程工具 DSH 很拉胯,API 莫名其妙扣掉 60 多块,还欠了 -12 块!
听说 DS 又出了一个新版本,我心不死,又跑来测了一下!

名字的长度是越来越离谱了:deepseek-v4.1-flash-expires-on-0910。(对比GLM5.3 GPT5.6,Opus5)
听说是采用了新的模型结构,原生支持多模态(敢情之前的是假多模态?),能力更强,速度更快,成本更低!
看起来挺不错的!
我就拿一个例子测了,测了这个例子之后,我再也不想往下测试了!
它确实很快,但是又超级慢!
快在 tokens 输出速度高达 335 tok/s,慢在实际任务,超过三小时!
终于它比GLM 还慢了!
1、测试结果
我先给大家看一下运行的汇总情况:

PS:图中的高效调用,稳定输出是GPT生图乱加的!实际情况完全相反!
然后来看一下结果:

我先不展开说,大致结论是:浪费了大量时间,但是结果一般!
然后我来说一下过程以及过程中遇到的问题!
2、测试工具
这次还是用的 DeepSeek Harness。我是一点都不喜欢这个工具,体验太差了。
但是为了防止有人说第三方工具发挥不了 DS 的能力。所以我就用 DSH,然后就用它的标准模式。
启动命令如下:
arduino
C:\Users\tony>dsh web
dsh web: http://127.0.0.1:3080
然后配置官方的 API 和添加这个测试模型:

官方工具、官方 API、官方模型!
电脑和操作系统和写指令的人不是 DS 的,这些没办法。 可能有人还说要 Linux 才能发挥 DS 的能力,DS 你可太会挑了,DS 的部分用户,已经有点迷信的成分了。
3、我的需求
需求内容如下:

文字内容如下:
css
我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间显示具体的内容,可以通过鼠标拖动查看不同角度,然后可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色,布局,内容我希望你尽可能还原参考docs中的图 2.png,不同之处在于车库里的车子,以及骑车的人,以及车库的名字。
车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。
骑车开车的人物根据参考docs中的图 1.jpg 的头部形象进行设计,做一个 3D Q 版卡通想象。车库的主人是 Jarvis。
我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成。页面是3D视图,需要对建模进行良好的渲染。车子的建模要精准,人物建模要抓住特征,搞帅气一些。 不参考和修改当前目录下的其他文件。车子要考虑玻璃的半透明效果和车内部建模。 当前已经有一个页面了,不要读取和修改。单独生成一个全新的页面。
为了不让它搞错,我给它的提示词,其实比给别人的还要多。
参考图如下:


东西给完之后,就开始干活了!
4、测试过程和问题
刚开始就遇到了一个小问题:工具调用失败了!

从提示来看,像是在说这个模型不支持图片输入,然后切换到其它模型去识别图片了。
这个事情,我就已经感觉很奇怪了,这明明是个多模态模型,怎么就不支持图片输入呢?
为此,我专门配置到 Claude Code 中做了测试:

作为第三方的智能体,图片识别完全正常! 而且速度确实非常快,3 张图片识别完成只用了 8 秒钟,包括了思考过程。 这个速度确实相当可以了!
接下来它生成了任务清单:

这个清单还是很不直观,直接是一个 json 格式。感觉不是给人看的!
搞了一段时间后,它就进入到了验证运行错误的阶段:

从这里来看生成速度应该还可以,但是验证阶段,简直了......!!!
我不确定它在跑什么,但是很久,很卡。中间把 cURL 异常都弹出啦,科学工具重启,浏览器整个崩掉重启。

所以从上面的截图可以看到,我暂停了一次,然后继续!
接下来就是漫长和枯燥的等待:

我是从九点多开始的,断断续续,已经搞到十一点多了。 单看最新一轮的对话已经持续了 81 分钟了,完全没有停止的样子。提示信息也不变,就这么卡着。
什么子代理后台任务开了一大堆 ,好像很牛逼的样子。后来一查反而把效率拉低了! 我估计卡死也是因为并发太多的问题。
等着太无聊了,看了一下项目文件夹。
里面有一大堆文件:

还有专门的 Chrome 配置文件:

我测试了几十个顶尖模型,没有一个模型能干出这么多文件的。别人都是一个文件搞定,又快又好。
它搞了这么久,是不是结果会很好呢?其实也并没有!

我们来分析一下这个结果。
首先,它的网页复刻能力也是倒数的。 大的颜色和结构都在,但是细节错误不少。首先是颜色选择正常应该在左边啊,它移动到了中间,拖动提示词应该在颜色选择上方,其次是右边的选择应该是开关按钮而不是刷新按钮。
然后上线区域的高度和分割线也没处理好。其它字体、颜色、间距的细节就不说了。
页面还原能力比较糙!
其次,建模效果也一般,你这个人物搞这么丑,脸都没有,我怎么给你好评啊!
建模能力好像有所提升,比上一个版本细节了很多

自行车、电瓶车、摩托车这几个建模已经看起来像模像样了,但是特斯拉、小米、保时捷,还是很抽象!

能看出来是个车子,但是绝对不是小米。细节错误很多!
总体来说:网页复刻中下水平,建模中等水平!
我最生气的还是:它浪费时间,浪费空间,浪费 tokens!
我让它查了一下它生成了多少文件!
它说,测试文件生成了 177 个,33M。 还有 100 个 Chrome 用户配置!!!占了 2.2GB,总共 28959 个文件!
我可以骂人吗------SB!
无头校验一行命令就可以了。为啥搞这么多文件,你会不会啊!
人家都可以 ComputerUse 和 BrowserUse 了,嘎嘎快,嘎嘎好用,你在这里给我搞一堆 Chrome 配置文件!
然后我问了一下它为什么这么慢,时间都去哪里了!
它给我做了一个时间去向总结(诚实版):

它的一句话总结是:
80% 的时间不在写代码,而在"渲染→截图→交给视觉模型看→改→再渲染"这个验证闭环上 。我跑了 18 个后台渲染任务 + 21 次视觉模型评审,每一次循环都是分钟级的。
具体的时间分布情况:
| 环节 | 耗时占比 | 具体数字 |
|---|---|---|
| 无头 Chrome 渲染截图 | ~40% | 18 个渲染任务累计 约 80 分钟。单张截图 5s~234s,最慢一张 234s |
| 视觉模型评审 | ~12% | 21 次 workflow 调用,每次 30~120s,约 15 分钟 |
| 真实建模/代码编写 | ~25% | 7 个源文件(约 3500 行)分块写入 |
| 排错(见下) | ~15% | 6 次以上的"猜→渲染→发现猜错"循环 |
| 环境摩擦 | ~8% | 无网络、编码、沙箱审批 |
它一张截图就能搞 234s(6 分钟),你说是不是SB!
然后它自己总结了自己犯了哪些错误:
markdown
1. **虚拟时间预算算错**(最贵,约 15 分钟) `--virtual-time-budget=12000` 意味着 Chrome 要跑约 750 帧,而软件渲染一帧要 0.2~0.8s → **单张截图 121 秒**。正确值应该是 300~600ms(约 25 帧)。这一个参数就多烧了十几分钟。
2. **"只画两帧"的优化走了死路**(约 10 分钟) 为了省时间我加了 `__ONESHOT__` 模式,结果因为 `preserveDrawingBuffer` 与合成器时序问题,**所有截图全白**。我花了 3 个循环才确认是"渲染确实发生了(279 次 draw call / 83796 三角形)但合成器没取到画面"。
3. **4 路并行渲染反而更慢**(约 12 分钟) SwiftShader 是纯 CPU 渲染,4 个 Chrome 抢同一个 CPU,600 秒超时,还留下 **43 个僵尸 Chrome 进程**要清理。
4. **视觉模型大量幻觉,我追着假问题改了好几轮**
- "Spacebar · 3 wheel 文字重叠"------页面里根本没有这个字符串
- "仪表台上的花束"------那其实是 Q 版人物透过挡风玻璃露出的粉色头发
- "三轮车只有一个后轮"------两个都在,只是 3/4 视角遮挡
- 同一个模型在不同截图里给同一辆车打 4/10 和 7/10
**真正的 bug 反而是数值审计找出来的**:我后来加的 IK 残差报告(`?diag=1`)一秒钟就暴露了"自行车/机车手臂差 9cm 够不到车把",DOM 矩形审计(`?layout=1`)一次就找出"小视口下列表面板溢出"。**我应该一上来就做数值审计,而不是先做视觉评审。**
5. **Bug 发现得太晚,每个都要付一整轮渲染的代价**
- `add()` 把已构造的 Mesh 当几何体传入 → 62 处调用点全部报错,整个 3D 场景不渲染
- `scene.add(g)` 漏写 → 九宫格里 8 个格子全空
- **IK 符号搞反**:`torso.rotation.x = +0.26` 实际是让骑手往后仰,不是往前倾 → 手臂永远够不到车把,我调了三轮角度才发现
6. **环境摩擦**:我的模型**不支持读图**(必须绕道视觉子代理)、**无外网**(three.js 只能从本机其他项目找一份并改写成 IIFE)、每次启动 Chrome 都要沙箱审批(前 3 次)、PowerShell 5.1 的 BOM/编码/`if` 表达式语法各踩一次。
它自己都觉得自己的错误"罄竹难书"! 这只是它自己总结的,如果站在更高的维度来看,错误可能更多。
如果让 O 哥看了,可能直接建议"不要开始了,弃用就好"!
然后它还总结了一下,下次能快多少,据说可以压到 40~50 分钟!
从它的时间比例可以看出来,模型调用的时间就 20 多分钟,但是工具调用 161 分钟。
所以它对工具的控制能力是非常弱的。根本就没有用好工具! 大概率不是没用好,而是不太会。就是说它这个模型和 Harness,对工具的理解和控制并不好。
时至今日,Opus 5,GPT-6 这种都是又快又好,预判能力和有用信息的提取能力,以及工具的利用能力都非常强。这种东西没法量化,但是你一旦用了,一旦对比了,立马就有强烈的感受。
然后我再来做一个横向对比吧!
我先简单说一下,谷歌 3.8 Flash,网页复刻很好,3D 建模做得不咋地,但是速度几块,只要 3 分钟,这才叫 Flash 啊!
然后重点来对比下它真正的对手 GLM5.3Flash (价格也很便宜)

同样的例子,效果比 DS 好。网页布局方面还原度很高!DS 有的两个问题,它都做好了。
建模方面,人物的细节也要好很多:

目前钢铁侠的建模还是一个难点!
我之前一直吐槽 GLM 最大的问题就是"慢"!
这个例子从生成到验证也是花了不少时间的。我记得是一个小时多一些!
我当时觉得,效果很不错,但是速度太慢了!
现在一看,速度也还可以。
一个三小时,一个一小时,这么一对比,一小时的是不是快到飞起了!
我本来是想多测几个例子的,但是测完这个已经半夜了,我觉得它不光浪费了我的钱,扼杀了我生命了。我非常生气!
当时写下一句"辣鸡"就去睡觉了!
今天早上情绪稳定了很多。冷静下来看看,DS 的综合能力和国内外的顶尖模型相比,确实落后,它最新版的模型,都比不过人家几个月前的模型,更不用说和国外顶级模型去比了。
它的 Harness+model,在智能体任务上的整体体验还是挺糟糕的!
模型速度很快,但是完成任务的时间很久!
对工具和资源的控制能力很差!
浪费了大量时间和 tokens。本质上还是智商低,所以不停地试错,这种成本最终转嫁给了用户!
所以,我觉得这篇文章最适合的标题是:"浪费时间"!
一方面,表达我不应该浪费时间来测试,另一方面表达它官方这一套工具模型目前确实很浪费时间!
当价格优势和速度优势不再,能力又不拔尖,工具又草台,DS 的优势何在? 之前可能因为开源,现在所有国产模型都开源了,而且比它好。
DS今天这个样子,各种无脑吹,要付一半责任!
现在开始追,大规模招人,可能有点晚了!
再多说一句,DS 和宇树,就是被全民的热捧害死的,本来按它们自己的节奏,做自己,都挺好的。默默搞技术都挺好的。
不要觉得我骂人的话难听,智谱也被我骂过很多次,但是人家吸取教训越来越强了!
希望下次再测 DS 的文章开头是:"卧槽,牛逼了!"