DeepSeek V4 Flash正式版基准亮眼,我也特别希望看到它能快速进步(其他家涨价、Tokens 少、套路多)!
但实话实说,实测结果还是不太理想!
昨晚我测试了一波,有好几个例子语法验证都没过就交差了,有一个做了一个多小时,依旧有基础错误。总体来说,上限还是很低,但时间变长了很多。可能是我的题目对它来说超纲了,不再它优化范围内。
因为 V4 Flash 没有视觉能力,像"Jarvis 的车库"这种需要参考图片进行 3D 建模的题目,我就直接放弃了。
今天主要是测了以下几个题目:赛博朋克版清明上河图、天文机械表、坦克大战、超级玛丽、3D 台球!
我就一个个给大家看一下结果,以及过程中的一些细节!
赛博朋克版清明上河图
这个题目是把清明上河图的内容和赛博朋克的风格融合在一起,不光考验模型的基础能力,还考验它的理解力、想象力,以及审美、构图、空间感。目前表现出众的只有 Claude 家的模型,然后就是 GLM 5.2 和 Kimi K3。
V4 Flash 的结果如下:

这个例子的交付总结如下:

总共用了 14 分 46 秒!
它这个页面最大的问题是太混乱了,空间感太差,里面的一些元素其实还是相对成型的,里面也有人物、烧烤摊、汽车、飞行器。还搞了一个汴京早报,也算是有点意思。但是我为啥有种狗皮膏药广告满天飞的感觉!
没有太多可以讲的地方~
继续下一个!
2、天文机械表
这个题目是全新设计的,这个题目的难点是里面有各种烧脑的功能点,脑子稍微差一点的就会顾此失彼,导致注意力不集中,最后只能完成部分工作。
完整的题目如下:
markdown
用单个 HTML 文件实现一只机械腕表风格的天文时钟,纯原生实现,不许使用任何库、框架或 CDN。要求:
1. 主表盘读取本地系统时间,秒针平滑扫秒,使用 requestAnimationFrame 驱动,且长时间运行不得累积漂移;切到其他标签页再切回来时,指针必须立即校准到正确时间。
2. 包含一个月相小表盘,根据当前日期计算并显示月相连续变化,公式需要自行实现,精度要求误差控制在 1 天内。
3. 包含一个可用的计时码表,通过子表盘指针显示,支持开始、暂停、继续、归零与计圈(lap),按钮在任意顺序点击都不能出现状态错误。
4. 日期窗显示当前日期,正确处理大小月与闰年。
5. 包含昼夜 / 日出日落指示,用户可在三到四个预设城市之间切换,并根据经纬度现场计算当地日出日落时刻。
6. 页面需要响应式,并尊重 prefers-reduced-motion:开启时秒针改为跳秒并关闭装饰动画;同时为各表盘补充 ARIA 标注。
7. 整体视觉要像一只真实的高级腕表,而不是普通练习作业。
只输出最终代码,不要解释。
核心要求如下:

结果如下:

样式还挺不错的,但是表盘没有显示出来!
没显示的核心原因是代码出错了:
javascript
Uncaught TypeError: Cannot read properties of null (reading 'addEventListener')
一般来说,我都是一次测试,不过就是不过。这次我给了它一个机会,修复了一下。
结果如下:

修复之后终于显示出来了!
我试了一下,这里面其他功能,月相,计时器,日期,地区时间这个功能应该都是对的!最大的问题是核心表盘布局崩了。
然后我们看一下它的开发过程:

它大概是想了 10 分钟,然后写了 7 秒,语法检查 2 秒,逻辑检查 7 秒!
总共花了 18 分钟,这个时间不算短。
从过程中也可以看到它确实有验证语法和逻辑的环节了。这就是公告里说的智能体能力增强吧。
核心逻辑上确实上没有太大问题!
奇怪的是,它明明有语法检查的过程,但是还是没有检查出这个 JS 的错误。
另外布局太差了!
总的来说脑子是有点的,但是结果还是差强人意,主要是直接报错和布局混乱,这看起来很糟糕。
3、坦克大战
创意和脑子考完了,下面来考考它的游戏制作和复刻能力。第一个题目是坦克大战。这个经典游戏在视觉上并不复杂,重点是地图、道具、玩法。
开发结果如下:

又报错了,报了个 Null ~~ 我还能说什么呢?
我们看看它的开发过程和时间消耗:

从报告来看,它应该是抄到代码了,而且也理解了这个规则,一切都非常清晰。
为了保证能正常通过每个关卡,做了平衡调整。
而且做了自我验证:
自动化 AI 完整通关 10 关 ✅,无崩溃、无卡死;过程中修复了若干真 bug(出生间隔未重置导致敌人瞬涌、敌人子弹凿穿砖墙直捣基地、玩家子弹误伤自家鹰徽等)。
最后也做了操作说明!
从过程来看一切很完美,但是结果就是直接打不开!
做了验证,却没有验证出基础错误,几个测试中已经遇到两次了!
这就证明脑力确实比较有限,虽然知道要验证一下,但是很多问题验证不出来!
还有一个问题,就是你浪费了这么多时间,最后却给我一个错误的结果,这个事情的效率就很低。
我后来也让它修复了一下,结果地图还原的不错,但是坦克屁股上开炮,一枪打穿所有砖墙,各种玩法都比较抽象。这个例子失败的很彻底。
4、超级玛丽
坦克大战不是很满意,下面来看看超级玛丽!
这个游戏不用介绍了吧,大家都很熟悉。
结果如下:

这个界面还是有点抽象,和原版并不是特别像。但是它能玩!
这次没有出现基础错误,游戏的基本操作和玩法都是在的!
看了它的开发过程,它确实做了很多验证和修改:

这个例子消耗了 35 分钟,大概修改了 9 次代码!
我觉得这个例子是它发挥比较好的,比较偶代表性的,充分展现了它的智能体能力!脑子不够,流程来凑。
从这里可以看出来 Flash 也在逐步接近最新主流模型的玩法,就是靠智能体和流程来提升开发质量。
5、3D 台球
最后做一个 3D 测试吧,这是一个发散性的题目,我不提供详细的提示词,而是直接和它探讨交流,然后全程让它自己实现。
结果如下:

球做得不错,视图切换效果还可以,其它就有点抽象。这个球桌就非常离谱,洞呢🕳?桌子台面和桌脚呢?
我试了一下,打了一杆之后,就再也打不动了。
这个例子我本身就对它没有抱有太大希望,它没有出现基础的代码错误,就算成功了。
我觉得通过这五个例子,大家对 DeepSeek V4 Flash 的前端开发能力应该有一个比较直观的认识了。
这些问题都是"前端技术和前端呈现",但是背后也有大量知识、逻辑、玩法在里面!
昨天我看了 Flash 的基准数据还是挺兴奋的,比 GLM 5.2 都强,接近 Opus 4.8。但是实际体验可能还是要差不少!
基准数据这个东西呢,确实和实际体验会有很大的差别,我最近看 Kimi CEO 杨植麟十个月前的访谈,它里面好几次提到了"泛化",让基准数据好看是很简单的,但是泛化就很难,小模型就更难了。所以很多模型基准很漂亮,但是实际测试就完全不是那回事儿。
Flash 毕竟是 Flash,后训练只能是针对一些常用场景做优化,提升特定场景的可控性和稳定性,但是大概率也会牺牲泛化能力。一旦遇到没见过的问题,就容易错漏百出。
总的来说:在我的几个问题上,Flash 是用了大量的时间,但是结果依旧不理想。
当然,抽卡有一定的随机性,其它方面的能力,大家有测试的话也可以反馈一下!
另外一个维度我也要强调一下,这么多测试只花了 3.86 块钱,我还能说什么呢?
"性价比"还是一个很难做的东西! 能力强的贵,便宜的能力弱,又便宜又好用确实很难。
我测了那么多模型,感觉最简单的选择还是直接选 Claude。
Haiku、Sonnet、Opus、Fable 已经覆盖了所有方面的最佳平衡。
开发质量,开发时间,开发成本,这三个维度能把控好的模型,才是最佳模型!

所有测试结果我都会发布到:topai.jarvisuni.com/
对比一下就知道不同模型之间的差距有多大了!