DeepSeek Pro正式版太难用了!这还对标Fable5?!

一夜之间,又都是 DS 牛逼的新闻了。

看看这些都是什么媒体......当然几家科技媒体也是日常吹,反正口径一致,对标全球第二强的 Claude Fable 5 呗,还好没喊出超越!

他们没啥亮眼的例子,硬举例子吹,看得我都尴尬了!

说实话,我是喜欢 DS 的,对 DS 也是有很大期待的。我希望它能变强,毕竟是国产 + 便宜,方便无套路。

人那,就是不能有期待,一旦有预期就会有失望!

为了畅快用新版 Pro,我还专门充了 OpenCode。但是当我跑完第一个例子,我唯一的感受是"太难用了"!

基准数据

按照惯例,为了让大家对这个模型有一个全面的理解,我会先贴一下官方公布的基准数据(大模型的卖家秀)。

从这个数据来看,数据还是非常亮眼的!

如果看这个数据,Opus 4.8 是被按在地上摩擦了。硬要说超越 Fable 5 也不是不行。在这 10 项数据中,有 4 项超过了,其中两项是 Fable 5 没有测的。其中有明确数据的是 AutomationBench 和 CyberGym。

恕我孤陋寡闻,这个 AutomationBench 基准我都没怎么见过。查了一下资料,这是一个很新的 AI 智能体基准,由 Zapier 在 2026 年 4 月发布,主要是销售、营销、运营、客服、财务和人力资源六类业务!好吧,这确实不是我关心的领域。

CyberGym 这个就比较眼熟了。是一个测试 AI 智能体真实软件漏洞分析能力的基准,由加州大学伯克利分校团队开发。这个数据如果真实,还是挺有用的。

相关人员可以对号入座了,传出去,DeepSeek 在这些维度打爆 Fable 5 了

虽然 10 项目中只有两项数据赢了,但是一项可以拆成 6 项,妥妥地赢 X 了......!

上面写了一堆基准,我都不太关心。

我比较关注的是编程相关的一些基准,由于 SWE PRO 已经被 Claude 刷爆了,现在其他家都不晒这个基准。现在好像都喜欢测 DeepSWE!

从这个数据来看,DeepSeek Pro 超越 Opus 4.8,吊打 GLM 5.2,不敌 K3,远低于 Fable 5。70 和 62.7 虽然数字上只差 7.3,但还是不小的差距。实际上的差距还会大很多。

众所周知,Claude 最强的是编程,从 DeepSWE 来看,DSP 和 Fable 5 的差距还是不小的,不存在"逼近、比肩"这种说法!

实测一下

基准数据大概就是这样,但是大家都明白,现在的基准数据和各种榜单也就是看个乐子,实际情况可能完全不一样。要刷榜太简单了,难得是泛化。

另外现在也不单单是比模型能力了,而是全套的智能体能力、生态、使用体验等等。

因为 DeepSeek 目前主要还是做 API,所以谈不上生态和体验。这两块评分直接是 ZERO,

因为没有视觉能力,所以多模态也没法测试!

因为它们自己的 Harness 还没推出,所以也没法谈智能体体验。

为了测试这个 DS Pro 正式版,我是搞了一个OC的 GO 套餐!

同时,我也会用常用的 Claude Code + 官方 API 测试一下!

由于 DSP 的交互体验太糟糕了,我不想测太多例子了,这次重点说一个例子,我把过程和细节说清楚,大家就会有一个直观的感受。

我的第一个例子就是《赛博朋克版清明上河图》!

这例子,要考常识,考概念理解,要考网页制作的能力。重点是要考创意、审美、空间感。这几点其实都很难。

在此之前,这个例子上表现最好的是 Claude 家的模型,Fable 5 和 Opus 5 表现都非常出众,断代领先。

完整提示词如下:

markdown 复制代码
请不要直接画图,而是编写一段 单个 HTML 文件 的代码,当我用浏览器打开它时,能看到一幅动态的、赛博朋克风格的《清明上河图》长卷。 华丽要求:

1. 画面需要自动从右向左缓缓滚动。
2. 必须包含至少 50 个动态元素:如闪烁的霓虹灯招牌、飞行的汽车、全息投影的广告、街头的机械义肢行人。
3. 鼠标悬停在任意店铺上时,要弹出一个赛博风格的信息卡片(如"老王义体维修店 - 好评率 98%")。


要充分融合赛博朋克的风格以及清明上河图的内容。屏幕是有限的,空间是无限的。要营造出一种立体的空间感要营造出一种立体的空间感。

考验实力: 这要求模型具备极强的SVG/Canvas绘图编程能力、CSS动画逻辑以及审美设计能力。普通人只需打开网页就能直观判断谁做得更精美、更流畅。

然后为了 DSP 我破例跑了四次!平时我的原则都是只抽卡一次。至于为啥它要跑了 4 次,主要是因为它很奇怪。

最好的一次结果如下:

单这个例子来说,空间感还是不错的,它把横跨两岸的虹桥都给做出来了。而且房子和船的形状也像模像样了。这个效果要比 Flash 正式版好很多。而且相比其他国产模型来说也是比较优秀的。(传出去,DS Pro 前端很牛逼...偶发)

问题是,它这个街道太冷清了!完全没有人来人往、熙熙攘攘的烟火气,内容特别空洞,也谈不上什么审美吧。以繁华著称的清明上河图,这个样子灵魂就没有了。

另外一个结果,布局和比例关系就有点混乱了,粗糙很多了:

还有一个也很混乱,而且不能动:

为什么不能动呢?因为它出现了基础错误!!!

通过浏览器 Console 可以看到,出现了 JS 出错。时至今日,如果还能够出现这种错误,这个测评结果应该直接打 0 分。

首先,模型本身就不应该生成有基础错误的代码,其次现在都是智能体模型了,即便出错,它也应该有能力纠正。

另外,你们有没有很好奇,为什么我说测了四次,却只有三个截图。因为......出现了一个很奇葩的事情。

我虽然提了 4 次需求,但是我却只收到 3 个页面!

下面就来看看这神奇的一幕吧。

我首先是使用了 OpenCode 来测试的!

输入需求之后,一点反应都没有。等了很久都没有任何反应,是一句话都不说、一个字都不说那种!我也不知道发生了什么,实在等不下去了。我就开了个 Claude Code,通过 JCODE 快速注入了 DS 的官方 API。

开了 Claude Code 也是 5 分钟了一点输出都没有,8 分钟的时候终于看到了一些思考过程,然后就是一直等。

两个工具同时开着,同时等着。

突然,大概在 20 分钟左右的时候,它们都写好了。

OpenCode 里面就写了一个文件名,其他话是一句都没有,这一刻我都怀疑这个模型是不是练坏了,练成哑巴模型了。

Claude Code 里面是输出了一些总结性的内容。

这个还不是关键,关键是我用了两个软件提了两次需求,按理说就应该有两个页面。但实际上是只有一个页面。

我严重怀疑,是 Claude Code 里写完了,OpenCode 里面的直接看了一眼,就说自己也写完了。

基于这个怀疑,我问了下 OpenCode 里的 DS,它是这么告诉我的:

自己写的。工作区里的 qingming-cyberpunk.html(778 行)是我在之前会话中从零生成的原创代码,没有引用或修改任何第三方文件------文件里也没有来源/署名注释,逻辑、SVG 场景和 CSS 动画都是按你的需求现场设计的。

态度非常强硬,而且是生怕别人说他抄袭的感觉!

然后我也问了 Claude Code 里的 DS,它是这么说的:

李鬼和李逵,都言之凿凿地说是自己写的,那么谁是抄的?你们都说自己写的,怎么就写的文件名和文件内容一模一样呢?还说要看 git status,看个毛线,你们根本就没有提交任何东西。

其实这里反应出一个很严重的问题。

就是它自己不知道自己做了什么。或者说它明明有完整的上下文,却睁着眼睛说瞎话。可以确认的一点是,它们思考过程中的代码绝对是不一样的。但是最后却只给了一份一模一样的代码。肯定有人抄袭了。

同个文件夹里有同样的文件,抄袭,借鉴,修改都是合情合理的。但是它的输出过程没有任何说明,还坚持说是自己写的。这样的模型怎么用啊。

正常的模型,如果看到有类似的文件,一般会做一个提示,比如看到了类似的文件,是选择在上面修改,还是自己单独创建一个,至少会有这样一个显式的思维过程。99%的模型会选择单独创建一个自己的文件。

抛开上面的诡异问题不谈,它还有一个问题:不爱说话!

它跑这个例子时间大概在 20~30 分钟之间,也不算特别长。主要问题是,它接到需求之后,完全不输出任何内容,就好像没听到一样,这种体验是非常糟糕的,几乎没有模型是这么搞的。

另外一个值得注意的点,它花时间最久的版本,最后居然是完全无法运行的版本。

我看了生成记录,修改了很多次,做了两次基础检查,却硬是没有查出问题!

这个例子的过程和结果,以及怪异点,我应该都说清楚了,然后看一下消耗情况。

我的 Claude Code 是通过 API 调用的,跑了两次网页,大概消耗 1.7M tokens,金额是 1.5 RMB。

OpenCode 里用了五小时的 5%!

**用量和价格方面还可以!**依旧保持了它的最大优势。

本来我已经不想测了,因为这个测试体验真的很不好。

但是换个角度想,测一个例子就给结论好像有点武断了,我们再测一个例子,找找感觉。

下面这个例子叫《天文机械表》,这个例子的考点我之前有全面分析过,并不简单,我的题目一般都是特别消耗大模型脑子,不是测常规问题,而是测试它们的极限能力。

然后又是进入漫长的等待,十分钟过去了,还在思考中......一个字都没有吐出来过!

这次我特定max降级到了high!

然后依旧一句话都不说,交卷了:

努力干活,话不多,是个好品质,但是它这种就属于完全不想和你沟通了。

开始不说话,结束也不说话。你至少有一个地方要简单的说一下,你做了什么,达到了什么程度,接下来可以干什么。这样的才叫智能体,才叫得力助手啊。

好吧,它不爱说就不说吧。我们来看结果:

这次抽卡结果 UI 效果还算是可以的,要比上一个版本好很多,这种深色金色还是比较稳重的。它那个不同地区的日落日出效果做得也不错。

就是细看的话,还是有不少问题。

比如中间那些小碎片看着很不舒服;另外这个表盘要把时间看清楚还是有点压力的;除了时、分、秒之外,还有一个奇怪的指针一直指着 12 点不动;它显示日期的位置看起来也怪怪的;重点是它的月相算错了,当前是新月,而不是残月

整个例子属于整体视觉设计还不错,但是禁不起推敲,月相这个是绝对不能错的。

既然测都测了,上午肯定写不完了(等到没心情写),那么多测几个吧!

然后我又让它复刻了两个经典游戏。

下面这个据说叫 1:1 复刻《超级玛丽》

下面这个是 1:1 复刻坦克大战:

这两个例子,它依旧一句话都不说就陷入思考。写完之后,终于说了几句人话了,不容易啊!

话是多说了几句,但是结果实在是太抽象了,可以堪称抽象界一哥了。都是能玩的,但是地图、角色、画风、玩法,没有一个是还原到位的,非常有喜剧感,建议大家在线体验一下。

稍后会把例子上传:topai.jarvisuni.com/

如果按我们的预期目标来说,它这个结果是非常糟糕的!

这些项目网上都是可以抄的,一些基础玩法它脑子里就应该有的才对。要么 DS 压根没有对这方面进行训练,然后泛化能力也很弱,也不知道去 GitHub 上看一眼,然后自己闭着眼睛,也不和你交流,想当然地就做出来了。

我觉得没必要再测下去了!是不是这个模型没有做后训练啊,整个交互感很差很差。

我感觉综合能力和体验可能是不如 GLM 5.2 和 K3 的,国外的咱们就不去比了吧,比 Fable 5 真的有点尴尬的啊。

完全没有那种顶级模型的感觉,也没有让人直呼哇塞的冲动。更多的是在努力追赶顶级模型的路上,而且体验真的不是太好。

当然,抛开顶级期待之后,也可以看到它的下限还是提升了不少的。这几个例子中,也有效果还不错的抽卡结果,效果不太行的至少保证了能玩(不是直接出错或者完全玩不了)。如果保持价格优势,综合来看还是能用一下的,干干杂活。

我主要是表达"太难用",而不是说它"能力太差"了!1.6T的模型,能力不会差到哪里去的,而且肯定是比之前的版本要好的!

开发中,我大概率不会用。我有很多更好的选择!主要是怕不稳定,反复,浪费时间。

今天唯一的收获是,OpenCode 的 5 块钱的 Go 好像还行。

相关推荐
Anhty1 小时前
2026 实测 4 款 AI 变声器|QQ 聊天伪装声线,告别僵硬假声
人工智能·功能测试·ios·智能手机·安卓
甲维斯1 小时前
DeepSeek 官方Harness开源,一夜44.6K Star,缓存99%!
人工智能
suaizai_1 小时前
MCP 2026:AI世界的USB-C新升级
人工智能
浅安的邂逅1 小时前
免费AI生图模型 agnes-ai和智谱GLM-4V-Flash
人工智能·ai作画·ai编程·ai生图
新新学长搞科研1 小时前
【双一流高校主办 | EI快稳检索】第五届图像处理、目标检测与跟踪国际学术会议(IPODT 2026)
人工智能
Wang's Blog1 小时前
AI Agent白手起家68: 智能体优化——计划执行与反思模式实战
人工智能
刘海东刘海东1 小时前
类数据的结构型的赋予生命的加权逻辑方程结构图(简称结构图)
人工智能
a1122998211 小时前
AI搜索布局怎么选?GEO工具与SEO工具对比评测
人工智能