一夜之间,又都是 DS 牛逼的新闻了。

看看这些都是什么媒体......当然几家科技媒体也是日常吹,反正口径一致,对标全球第二强的 Claude Fable 5 呗,还好没喊出超越!
他们没啥亮眼的例子,硬举例子吹,看得我都尴尬了!
说实话,我是喜欢 DS 的,对 DS 也是有很大期待的。我希望它能变强,毕竟是国产 + 便宜,方便无套路。
人那,就是不能有期待,一旦有预期就会有失望!
为了畅快用新版 Pro,我还专门充了 OpenCode。但是当我跑完第一个例子,我唯一的感受是"太难用了"!
基准数据
按照惯例,为了让大家对这个模型有一个全面的理解,我会先贴一下官方公布的基准数据(大模型的卖家秀)。

从这个数据来看,数据还是非常亮眼的!
如果看这个数据,Opus 4.8 是被按在地上摩擦了。硬要说超越 Fable 5 也不是不行。在这 10 项数据中,有 4 项超过了,其中两项是 Fable 5 没有测的。其中有明确数据的是 AutomationBench 和 CyberGym。
恕我孤陋寡闻,这个 AutomationBench 基准我都没怎么见过。查了一下资料,这是一个很新的 AI 智能体基准,由 Zapier 在 2026 年 4 月发布,主要是销售、营销、运营、客服、财务和人力资源六类业务!好吧,这确实不是我关心的领域。
CyberGym 这个就比较眼熟了。是一个测试 AI 智能体真实软件漏洞分析能力的基准,由加州大学伯克利分校团队开发。这个数据如果真实,还是挺有用的。
相关人员可以对号入座了,传出去,DeepSeek 在这些维度打爆 Fable 5 了。
虽然 10 项目中只有两项数据赢了,但是一项可以拆成 6 项,妥妥地赢 X 了......!
上面写了一堆基准,我都不太关心。
我比较关注的是编程相关的一些基准,由于 SWE PRO 已经被 Claude 刷爆了,现在其他家都不晒这个基准。现在好像都喜欢测 DeepSWE!
从这个数据来看,DeepSeek Pro 超越 Opus 4.8,吊打 GLM 5.2,不敌 K3,远低于 Fable 5。70 和 62.7 虽然数字上只差 7.3,但还是不小的差距。实际上的差距还会大很多。
众所周知,Claude 最强的是编程,从 DeepSWE 来看,DSP 和 Fable 5 的差距还是不小的,不存在"逼近、比肩"这种说法!
实测一下
基准数据大概就是这样,但是大家都明白,现在的基准数据和各种榜单也就是看个乐子,实际情况可能完全不一样。要刷榜太简单了,难得是泛化。
另外现在也不单单是比模型能力了,而是全套的智能体能力、生态、使用体验等等。
因为 DeepSeek 目前主要还是做 API,所以谈不上生态和体验。这两块评分直接是 ZERO,
因为没有视觉能力,所以多模态也没法测试!
因为它们自己的 Harness 还没推出,所以也没法谈智能体体验。
为了测试这个 DS Pro 正式版,我是搞了一个OC的 GO 套餐!

同时,我也会用常用的 Claude Code + 官方 API 测试一下!

由于 DSP 的交互体验太糟糕了,我不想测太多例子了,这次重点说一个例子,我把过程和细节说清楚,大家就会有一个直观的感受。
我的第一个例子就是《赛博朋克版清明上河图》!
这例子,要考常识,考概念理解,要考网页制作的能力。重点是要考创意、审美、空间感。这几点其实都很难。
在此之前,这个例子上表现最好的是 Claude 家的模型,Fable 5 和 Opus 5 表现都非常出众,断代领先。
完整提示词如下:
markdown
请不要直接画图,而是编写一段 单个 HTML 文件 的代码,当我用浏览器打开它时,能看到一幅动态的、赛博朋克风格的《清明上河图》长卷。 华丽要求:
1. 画面需要自动从右向左缓缓滚动。
2. 必须包含至少 50 个动态元素:如闪烁的霓虹灯招牌、飞行的汽车、全息投影的广告、街头的机械义肢行人。
3. 鼠标悬停在任意店铺上时,要弹出一个赛博风格的信息卡片(如"老王义体维修店 - 好评率 98%")。
要充分融合赛博朋克的风格以及清明上河图的内容。屏幕是有限的,空间是无限的。要营造出一种立体的空间感要营造出一种立体的空间感。
考验实力: 这要求模型具备极强的SVG/Canvas绘图编程能力、CSS动画逻辑以及审美设计能力。普通人只需打开网页就能直观判断谁做得更精美、更流畅。
然后为了 DSP 我破例跑了四次!平时我的原则都是只抽卡一次。至于为啥它要跑了 4 次,主要是因为它很奇怪。
最好的一次结果如下:

单这个例子来说,空间感还是不错的,它把横跨两岸的虹桥都给做出来了。而且房子和船的形状也像模像样了。这个效果要比 Flash 正式版好很多。而且相比其他国产模型来说也是比较优秀的。(传出去,DS Pro 前端很牛逼...偶发)
问题是,它这个街道太冷清了!完全没有人来人往、熙熙攘攘的烟火气,内容特别空洞,也谈不上什么审美吧。以繁华著称的清明上河图,这个样子灵魂就没有了。
另外一个结果,布局和比例关系就有点混乱了,粗糙很多了:

还有一个也很混乱,而且不能动:

为什么不能动呢?因为它出现了基础错误!!!

通过浏览器 Console 可以看到,出现了 JS 出错。时至今日,如果还能够出现这种错误,这个测评结果应该直接打 0 分。
首先,模型本身就不应该生成有基础错误的代码,其次现在都是智能体模型了,即便出错,它也应该有能力纠正。
另外,你们有没有很好奇,为什么我说测了四次,却只有三个截图。因为......出现了一个很奇葩的事情。

我虽然提了 4 次需求,但是我却只收到 3 个页面!
下面就来看看这神奇的一幕吧。
我首先是使用了 OpenCode 来测试的!

输入需求之后,一点反应都没有。等了很久都没有任何反应,是一句话都不说、一个字都不说那种!我也不知道发生了什么,实在等不下去了。我就开了个 Claude Code,通过 JCODE 快速注入了 DS 的官方 API。

开了 Claude Code 也是 5 分钟了一点输出都没有,8 分钟的时候终于看到了一些思考过程,然后就是一直等。
两个工具同时开着,同时等着。
突然,大概在 20 分钟左右的时候,它们都写好了。
OpenCode 里面就写了一个文件名,其他话是一句都没有,这一刻我都怀疑这个模型是不是练坏了,练成哑巴模型了。
Claude Code 里面是输出了一些总结性的内容。
这个还不是关键,关键是我用了两个软件提了两次需求,按理说就应该有两个页面。但实际上是只有一个页面。
我严重怀疑,是 Claude Code 里写完了,OpenCode 里面的直接看了一眼,就说自己也写完了。
基于这个怀疑,我问了下 OpenCode 里的 DS,它是这么告诉我的:
自己写的。工作区里的
qingming-cyberpunk.html(778 行)是我在之前会话中从零生成的原创代码,没有引用或修改任何第三方文件------文件里也没有来源/署名注释,逻辑、SVG 场景和 CSS 动画都是按你的需求现场设计的。
态度非常强硬,而且是生怕别人说他抄袭的感觉!
然后我也问了 Claude Code 里的 DS,它是这么说的:

李鬼和李逵,都言之凿凿地说是自己写的,那么谁是抄的?你们都说自己写的,怎么就写的文件名和文件内容一模一样呢?还说要看 git status,看个毛线,你们根本就没有提交任何东西。
其实这里反应出一个很严重的问题。
就是它自己不知道自己做了什么。或者说它明明有完整的上下文,却睁着眼睛说瞎话。可以确认的一点是,它们思考过程中的代码绝对是不一样的。但是最后却只给了一份一模一样的代码。肯定有人抄袭了。
同个文件夹里有同样的文件,抄袭,借鉴,修改都是合情合理的。但是它的输出过程没有任何说明,还坚持说是自己写的。这样的模型怎么用啊。
正常的模型,如果看到有类似的文件,一般会做一个提示,比如看到了类似的文件,是选择在上面修改,还是自己单独创建一个,至少会有这样一个显式的思维过程。99%的模型会选择单独创建一个自己的文件。
抛开上面的诡异问题不谈,它还有一个问题:不爱说话!
它跑这个例子时间大概在 20~30 分钟之间,也不算特别长。主要问题是,它接到需求之后,完全不输出任何内容,就好像没听到一样,这种体验是非常糟糕的,几乎没有模型是这么搞的。
另外一个值得注意的点,它花时间最久的版本,最后居然是完全无法运行的版本。

我看了生成记录,修改了很多次,做了两次基础检查,却硬是没有查出问题!
这个例子的过程和结果,以及怪异点,我应该都说清楚了,然后看一下消耗情况。
我的 Claude Code 是通过 API 调用的,跑了两次网页,大概消耗 1.7M tokens,金额是 1.5 RMB。

OpenCode 里用了五小时的 5%!
**用量和价格方面还可以!**依旧保持了它的最大优势。
本来我已经不想测了,因为这个测试体验真的很不好。
但是换个角度想,测一个例子就给结论好像有点武断了,我们再测一个例子,找找感觉。
下面这个例子叫《天文机械表》,这个例子的考点我之前有全面分析过,并不简单,我的题目一般都是特别消耗大模型脑子,不是测常规问题,而是测试它们的极限能力。
然后又是进入漫长的等待,十分钟过去了,还在思考中......一个字都没有吐出来过!

这次我特定max降级到了high!
然后依旧一句话都不说,交卷了:

努力干活,话不多,是个好品质,但是它这种就属于完全不想和你沟通了。
开始不说话,结束也不说话。你至少有一个地方要简单的说一下,你做了什么,达到了什么程度,接下来可以干什么。这样的才叫智能体,才叫得力助手啊。
好吧,它不爱说就不说吧。我们来看结果:

这次抽卡结果 UI 效果还算是可以的,要比上一个版本好很多,这种深色金色还是比较稳重的。它那个不同地区的日落日出效果做得也不错。
就是细看的话,还是有不少问题。
比如中间那些小碎片看着很不舒服;另外这个表盘要把时间看清楚还是有点压力的;除了时、分、秒之外,还有一个奇怪的指针一直指着 12 点不动;它显示日期的位置看起来也怪怪的;重点是它的月相算错了,当前是新月,而不是残月。
整个例子属于整体视觉设计还不错,但是禁不起推敲,月相这个是绝对不能错的。
既然测都测了,上午肯定写不完了(等到没心情写),那么多测几个吧!
然后我又让它复刻了两个经典游戏。
下面这个据说叫 1:1 复刻《超级玛丽》

下面这个是 1:1 复刻坦克大战:

这两个例子,它依旧一句话都不说就陷入思考。写完之后,终于说了几句人话了,不容易啊!
话是多说了几句,但是结果实在是太抽象了,可以堪称抽象界一哥了。都是能玩的,但是地图、角色、画风、玩法,没有一个是还原到位的,非常有喜剧感,建议大家在线体验一下。
稍后会把例子上传:topai.jarvisuni.com/
如果按我们的预期目标来说,它这个结果是非常糟糕的!
这些项目网上都是可以抄的,一些基础玩法它脑子里就应该有的才对。要么 DS 压根没有对这方面进行训练,然后泛化能力也很弱,也不知道去 GitHub 上看一眼,然后自己闭着眼睛,也不和你交流,想当然地就做出来了。
我觉得没必要再测下去了!是不是这个模型没有做后训练啊,整个交互感很差很差。
我感觉综合能力和体验可能是不如 GLM 5.2 和 K3 的,国外的咱们就不去比了吧,比 Fable 5 真的有点尴尬的啊。
完全没有那种顶级模型的感觉,也没有让人直呼哇塞的冲动。更多的是在努力追赶顶级模型的路上,而且体验真的不是太好。
当然,抛开顶级期待之后,也可以看到它的下限还是提升了不少的。这几个例子中,也有效果还不错的抽卡结果,效果不太行的至少保证了能玩(不是直接出错或者完全玩不了)。如果保持价格优势,综合来看还是能用一下的,干干杂活。
我主要是表达"太难用",而不是说它"能力太差"了!1.6T的模型,能力不会差到哪里去的,而且肯定是比之前的版本要好的!
开发中,我大概率不会用。我有很多更好的选择!主要是怕不稳定,反复,浪费时间。
今天唯一的收获是,OpenCode 的 5 块钱的 Go 好像还行。
