DeepSeekPro 依旧拉跨,配上官方Harness,还不如Flash?

DeepSeek Pro 是唱了一天大戏啊!

目前唯一明确的就是涨价好几倍。

涨价也没事儿,关键还是模型质量!

刚开始主流媒体一波吹,基准对标 Fable 5!

然后大家上手一测发现很拉跨!

然后说是上错版本了,又把公告撤了!

然后又在晚上 7:30 左右发布了上线公告。

从来没有见过一个模型,还能这么玩的!

我也是测了又测,浪费了很多时间,前前后后起码测了三轮了。

第一轮用 OpenCode 和 Claude Code 测的。

第二轮是晚上 7:30 之后继续用 OC 和 CC 测的。

第三轮是今天上午,装了官方的 Harness 测的。

最终结果只有一个:Pro 就是拉跨,别找补了!正视问题,然后改进吧!

它在智能体流程上还不如 Flash,而且结果的稳定性也很差。

我可以给大家展示完整的过程和结果!

测试过程中,至少遇到了 3 次基础错误!

下面我就按顺序来捋一捋,不着急,一步一步来。

第一轮

我的一轮测试是在昨天上午九点多的时候开始的!当时大概测试了 4 个例子。

其中第一个是《赛博朋克版清明上河图》

当时的第一个感觉就不是太好,整个开发过程,就是一直卡在思考中,一言不发,然后突然告诉我一个文件名。中途还遇到一个问题,我是同时开了 Claude Code 在测试同样的问题。

然后两个软件,最终只生成了一个文件,问它们谁写的,都说是自己原创的。正常情况下,模型是不会覆盖代码的,即便要覆盖代码,应该也有明确的说明。

最终效果如下:

这个效果吧中规中矩,不算特别突出,但是也不算特别拉跨。

因为出了两个工具写一个文件的问题,可能会有互相干扰的成分,所以又单独测试一次。

OpenCode 里生成的结果如下:

这个已经是 Pro 的巅峰效果了,说实话空间感这一块,做得还不错,已经好于大部分模型了!

Claude Code 里面生成的效果如下:

这个效果是有点混乱的,而且出现了 JS 错误,导致页面是卡死的,一旦改变窗口大小,里面的内容就会清空。

这个表现就比较糟糕了,在当前这个时间点,其他模型都能自动验证了,DS还能出现这种错误,是比较离谱的。

从这一个例子的几次测试结果来看,Pro 的发挥也不是很稳定!

然后我继续用 OpenCode 测试了三个例子。

分别是天文机械表:

整体样式不错,细节上的纰漏不少,核心的一个天文现象"月相"出现了错误。

另外一个例子是复刻经典游戏《坦克大战》:

这个错得非常离谱,地图、道具、敌人运作机制、大本营的位置全部是错的。没有一项进行了高度还原,这个表现属于中下表现。唯一让人欣慰的是,代码没有出现基础错误,游戏能正常进入。

我还让它复刻了一个经典游戏《超级玛丽》:

这个效果也是非常抽象,各种玩法都是有问题的。问题太多,我也不知道从何说起了。

测完前面几个例子,我就已经不想继续测试了。

我整体感觉是"太难用了"!

未必是所有方面表现都很弱,但是它那种不稳定性,以及下限的表现实在是让人提不起一点兴趣。这种模型怎么去和顶级的、发挥稳定的多边形战士 Fable 5 比呢!别说 Fable 5 了,K3 和 GLM 5.2 在稳定性和全面性上都可以吊打它。

还有一个特别明显的问题是:它特别不爱说话,开发完完成之后的校验也不是很仔细。这就导致交互很差,结果不可控。

我测完就把记录和结论发出来了。

很多人表示认同,这个 Pro 不太行。然后有人说,这是 DeepSeek 上错模型了。我对此持怀疑态度!

第二轮

时间来到晚上,我正在散步,听说 DeepSeek 又有新动作了,这次在价格页、开发者平台、新闻页都有了明确的发布说明了。

更新日志:

时间:2026-08-13

DeepSeek-V4-Pro 更新

DeepSeek-V4-Pro 正式版已同步在 APP、网页端和 API 更新上线。API 调用方式不变,模型名设置为 deepseek-v4-pro,即可使用最新版本。

Agent 能力大幅提升

正式版 DeepSeek V4 Pro 极大增强了 Agent 能力,在生产环境中的性能表现提升尤为显著。然后就是写了一些基准数据!

这个 Agent 能力,值得好好看一看!

后面会和 Flash 做一个对比。

因为有些人无法接受 DeepSeek Pro 不行这个现实,硬要说是发错版本的问题,所以我又测了一轮。

这次还是用 CC 和 OC!

结果并没有变好,这次的清明上河图已经崩得没人样了:

就这个样子,我也没啥好说了。人、房子,全部没了。

坦克大战也是极其离谱:

这么大个页面,搞了这么个小一个框,进去之后,也是一片混乱!

《超级玛丽》也是超级拉跨:

角色就不说了,整个画面比之前的版本还离谱。最离谱的是它往右跑的时候,左边的内容全部消失了。这是末日逃生版超级玛丽么?

《天文机械表》还好一点,至少整体外形没有崩!

但是一个最核心点出了问题:指针跑了!

我测完这一轮陷入了沉思!

这就是正式版中的正式版么?怎么越测越差呢!

到这里我基本可以确定,什么上错版本了,就是一些人的找补而已。其实也不存在越测越差的问题,而是偶然性导致的。关键问题还是:这个版本的 Pro 就是不太行。

这种现象,我在谷歌身上也见过。

它当时的 3.1 Pro 就是呈现出这种练崩了的状态。这个版本之后,就再也没有看到新的 Pro 了,它的 Flash 已经更新到 3.6 ,现在应该是3.7了,但是 Pro 版却一点响动没有,推了又推!

第三轮

正式版的问题已经排除了,然后有人又质疑是智能体的问题了。有人还嘲笑我:现在竟然还用 Claude Code 和 OpenCode。我是不会惯着这些人的,我就问现在一般用什么。他告诉我用 Pi 和......。

好吧,我已经无法理解了!

Claude Code 是闭源 harness 的开创者和领头羊,OpenCode 作为它的开源对标者,居然不如 Pi 和......。

既然如此,我就在用DeepSeek官方的Harness来测一次!

接下来一个问题是,作为一个 0.1 版本的官方 DSH,能拯救这一切么,还能为 DS 的铁杆挽尊么?

不好意思,现实不以人的意志为转移!

昨晚大半夜我就把刚刚新鲜出炉的 DeepSeek Harness 安装好了!因为网络问题,还是折腾了好一会儿。DSH 目前还只是一个 Web 版本。其实作为本地智能体,用Web版并不是很合适。要和系统进行充分的交互的话,最好是使用桌面版。

接下来我就用 DSH 测一波吧。

因为我的一个失误,把 Flash 当 Pro 测了一遍,最后只能补测了一遍 Pro。坏处是我有得花不少时间,好处是测试数据更加丰富了。

我先给你们看一下 Flash 的表现,然后再看一下 Pro 的表现。

Flash 搞起来

搞起来,让我们一起探索未知之境吧:

这次是用了 V4-Flash-High!别再找补说为啥不用 Max,Max 除了浪费时间外,在我的问题上,并不会提升上限的。

我突然发现,Flash 在这个问题上也是一句话都不说,直接开始陷入冗长的思考。

还好官方的工具有一个好处,就是默认可以看到思考(Think)的内容,这样用户心里感受还好一点,能看到它在疯狂地刷新内容。

8 分钟后说了一句话:

我来编写这个单文件 HTML。这是一个融合《清明上河图》题材与赛博朋克美学的 Canvas 长卷,采用多层视差、预渲染图块、霓虹辉光与交互卡片。现在生成文件:

终于开始生成文件了!

接着就发生了一个写入失败:

其实它这里已经有点危险了,不看文件,直接写入。还好这个写入方法不是直接覆盖的。

它根据这个错误才意识到,我要求的是不去动已有的文件,创建新的文件。

代码写完,进入语法校验阶段:

这个阶段发现了两个小问题,并修复。然后做冒烟测试。

这个过程抓到了一个真实的 Bug,变量声明可见性相关的问题。

然后是自己截图查看效果:

这个思路确实非常清晰!

最后,用了 17 分钟,这个例子终于写完了。接下来就是激动人心的看效果的环节了。

这个效果嘛~~只能说是一般般了!WebDev目前是 DS 家模型的薄弱环节,需要赶紧补上。 GLM5.2虽然没有多模态,但是这一块短板已经补上了。

我觉得 Flash 在智能体工作流上表现还是比较稳健的。

首先是思考,然后生成代码,然后修改代码,然后做语法检查,然后做冒烟测试,然后截图改进。

从智能体操作流程的角度来说,还是非常不错的。

可惜 DS 整个系列都看不见,导致了很大的缺失,这个短板也必须赶紧补上!

Pro 搞起来!

Flash 跑完了,结果一般,但是工作流程做得不错!接下来就是今天重头戏 Pro 了。理论上是 Pro 肯定比 Flash 强的。但是实际嘛,很难说。

来来来,继续探索未知之境:

继续一句话都不说,陷入思考......

又到 6 分钟了......还没有任何输出!

8 分钟左右,开始写文件了。

然后继续思考!

然后开始修复一些页面布局上的问题:

玩犊子了,Pro 已经开始飙英文了!你说一个好好的纯国产模型,纯国产芯片,纯中文需求,为什么要用英文回答问题呢?

其实我本身觉得"英文和英伟达"都没有关系,但是有人特别强调"国产之光",所以我才有这么一问!

然后它又修复了两轮:

然后它就交稿了!

这次居然是花了 11 分钟,居然比 Flash 还快。

但快慢不是关键,关键是:

这家伙又没有做语法验证和冒烟测试,然后搞出了基础的 JS 错误 ,导致页面上什么都没有显示。之前修改的三轮,都是页面上的布局问题,它根本就没有 check 的动作,而是直接修改的!

DSV4 Pro 正式版,我也就没测多少个例子,但是已经遇到 3 次了,就是开发完直接出错,导致页面上不显示内容。这次是直接没做校验,有一次在 Claude Code 上是做了校验的,但是没有验出来。

我相信,我把错误给他,它肯定能修复。但是主动修复和被动修复,完全就是两个概念了!

好了,现在 3 轮测试都做完了,我觉得已经没啥好说了。

对比所有测试结果,99% 可以确定和 Harness 的关系不大,之前 OpenCode 上生成的一个抽卡结果已经是巅峰效果了,Claude Code 里抽的也不比这次差。

这次 DeepSeek Pro 是真的拉了,至少在我关注的领域是拉了。而且这并不仅仅是领域的问题,而是整个智能体工作逻辑的问题。 还记得这个版本更新公告里说的唯一句介绍么:极大增强了 Agent 能力!但是,在这个测试中,明显不如Flash!

DSV4Pro正式版不太行,应该不只是我一个人有这个看法:

我觉得主要是大家对 DeepSeek 其实都是有期待的,所以都会有落差!而且昨天的基准数据非常亮眼,都可以压着 GLM 5.2 和 Opus 4.8 打了,甚至大量的新闻都说对标 Fable 5。其实这种主流媒体,是完全瞎讲的,这完全就是捧杀了。捧过头了,就容易遭黑!

有人说我为什么评价DS有这么多情绪,因为讨厌别人吹牛逼,然后又不是真牛逼。有人负责吹,那么就有人要骂一骂,这样才能平衡啊。

还有一个因素,我是真的等着把Pro接入产品的,现在这个样子,期待落空了,最多搞个Flash了。

我也就是今天吐槽几句,以后就不说这个问题了。

希望 DeepSeek 的下一个版本能用实力堵住所有人的嘴!继续给大家提供质量有保障、极具性价比的产品。

我玩Grok4.6和GLM5.3去咯!

相关推荐
听你说321 小时前
推进具身智能安全评测:丈八科技与季华实验室达成战略合作
人工智能·科技·安全
阿里云大数据AI技术1 小时前
DataWorks Data Agent 7月升级: Qwen3.8-max 加持、管住 Token、打通 IM、铺向全球
大数据·人工智能·agent
2601_955759881 小时前
如何降低 Claude API 批量生产返工率
大数据·人工智能·算法
搞科研的小刘选手1 小时前
【南昌航空大学主办 | 南昌举办】第六届计算机图形学、人工智能与数据处理国际学术会议 (ICCAID 2026)
人工智能·数据处理·学术会议·计算机图像学·会议推荐
人工智能技术咨询.2 小时前
工信部教考中心证书
人工智能
ACP广源盛139246256732 小时前
WAIC2026 国产超节点算力浪潮下@ACP#IX9104 在算力矩阵中的定位与落地场景
大数据·数据库·人工智能·嵌入式硬件·线性代数·矩阵
tedcloud1232 小时前
book-to-skill 怎么部署?把技术书和文档转换成可复用的 AI Skill
运维·服务器·人工智能·开源·ai编程
鱼日先生2 小时前
Dify 高级实验(09):测试用例生成——如何让 AI 自动产出测试用例?
人工智能·测试用例·工作流·dify·ai agent·大模型应用·ai 训练
回归2722 小时前
LM Studio切换国内HF-Mirror镜像进行模型下载
人工智能