我对"豆姐"没有偏见,我觉得她傻傻的挺可爱的!
今天测了一把豆包最新专业版模型,有种过山车的感觉! 有些例子很符合豆包的人设,但是有些例子让我很惊讶。
我本来是不会测豆包的,但是刷了两篇文章,好像说新版豆包很厉害,我就上手来摸一摸!
我看了一下新版本还是叫 Seed2.1pro,我记得很久之前也叫这个名字。现在只是加了个 0915 的后缀。
这更新速度也是独一份了!
"豆姐"确实有点与众不同!
前段时间 A 社一口气几乎把所有国产模型都给点了!
唯独没有我豆姐!
张一鸣好像也说过,"豆包不蒸",看来真的没蒸,还是个"生包"!
就冲这一点,我也想测一测不蒸的豆包是个什么水平。
正常情况下,我们会先查看一下官方的介绍和基准信息,但是,我查了半天都没有发现新的数据,只有三个月的数据。
那我们就直接开测了!
甲维斯的车库
虽然没有详细的数据,但是大概可以确定的是,这个应该也是多模态模型。
曾经我比较过豆包和 DeepSeek 的视觉识别能力。当时是豆包赢了。
现在 DS 也推出了原生多模态,所以我也很想测一测这个新版本的多模态能力,以及 3D 建模能力。
所以我先选了甲维斯的车库这个例子。
这个例子会给两张参考图和一段提示词!
主要考察模型的网页复刻能力、世界知识、3D 建模等能力。
这个例子的结果有点惊到我了:

没想到豆姐现在也这么强,强到可怕啊!

对比原图可以看到,这个网页的还原度非常非常高。
整个页面的色彩、布局、控件都实现了高度还原。
甚至连 3D 建模,也是能看的。虽然有一些小问题,但是整体的轮廓和渲染效果还是不错的!
这个还是豆包么?豆姐你这样我害怕啊!
游戏复刻
第一个例子结果远超预期。接下来让豆姐帮我抄个《超级玛丽》出来玩玩!
这个例子跑了好久好久,我在等结果的时候,就观察了一下它的执行过程。
执行过程如下:
ini
研究经典SMB1-1地图布局、敌人位置,物理常数 & 设计单文件架构:Canvas渲染,精灵,音频。
已搜索 10 个网页
关键发现:真实的 1-1 含有地下奖励房间、坑、7 根水管等细节,我需要拿到 ROM 解码级别的精确地图数据,而不是凭记忆。继续核实:
已搜索 6 个网页
拿到了 ROM 原始关卡字节流!我再读取完整的 wiki 关卡描述,并搜索该字节序列对应的解码资料:
已读取 1 个文件,搜索 5 个网页
我用最可靠的办法:下载官方反汇编源码和 wiki 的关卡全图,直接解码 ROM 数据。先把这两个资料抓到临时目录:
已执行 2 条命令
PowerShell 把 curl 别名化了,改用 curl.exe:
已读取 1 个文件,搜索 1 次文件,执行 2 条命令
拿到了完整关卡地图缩略图和官方反汇编。现在精读反汇编里的关卡解码器与 1-1 数据(敌人+地形):
已读取 2 个文件
解码器逻辑很清晰了。继续读小物体/砖块/楼梯等处理例程,以便精确解码:
已读取 2 个文件
敌人数据也拿到了。现在查敌人对象解码格式、1-1 地形数据和地下奖励房间的数据:
已读取 1 个文件,搜索 1 次文件
现在读敌人对象解码逻辑:
已读取 1 个文件
继续查敌人 ID 常量表和群体敌人($37 组编码)的处理:
已读取 1 个文件,搜索 2 次文件
部分对象(特殊行、长度=attr+1)需要再核对。我读一下 JumpEngine 和地形头部解析,然后放大地图图片来锚定所有坐标:
已搜索 2 次文件
解码机制已完全搞清。现在用 Python 写解码器,直接把 ROM 字节渲染成网格,避免手工误算;同时准备放大地图图片做核对:
已读取 2 个文件,搜索 2 次文件
地形/场景编码已完全掌握。现在写 Python 解码器,把 ROM 字节精确展开成网格,并读取地下奖励房间数据:
已搜索 1 次文件
地下房间数据通过多个 row0e 链式子区域拼接。我需要确认地形解析器中 row0e 的处理逻辑:
已读取 4 个文件,搜索 2 次文件
现在读敌人数据解析逻辑,确认组敌人/页控制对象的精确语义:
已读取 1 个文件
直接从反汇编文件读取 1-1 敌人数据原文,避免转写错误:
已读取 1 个文件
组敌人 = 2 只地面 Goomba(共 6 组 → 12 + 4 单只 = 16 ✓)。再确认水管高度渲染和金币排长度语义:
已读取 1 个文件,搜索 4 次文件
地形页逻辑也确认一下,然后写完整解码器:
已读取 1 个文件
所有编码规则确认完毕。现在写解码器精确展开 1-1:
已执行 1 条命令
PowerShell 不支持 heredoc,把解码脚本写到临时目录运行:
已创建 1 个文件,编辑 1 个文件,执行 2 条命令
地形解码完美匹配经典布局。再解码背景装饰(山/灌木/云)的生成数据:
已读取 1 个文件,搜索 1 次文件
背景块定位规则明确(scenery=2 → 山/灌木块)。查背景精灵 metatile 表以精确绘制:
已搜索 1 次文件
地形数据完全解码。打开 1-1 全图核对(特别是出口管位置):
已读取 1 个文件
全图核对一致。查地下房间的敌人/回传数据,确认回到地上的出口管页码:
它整个执行过程还是很有节奏的,就是小步慢走,粒度很细,很清晰!
这只是它思考内容的一部分,后面还有很多很多。
然后,我看了一下生成的第一个版本,结果是"惨不忍睹"。
这个事情就很迷惑,看它的思路,好像已经掌握了核心内容。
但是看最终结果,又做得不好。
这是典型的,眼睛学会了,动手就不行!
这个例子跑了很久很久。

第一次跑,就输出内容过长被中断了,然后点了继续,又跑了几个小时,中途还自动压缩了上下文,基本也可以证明它这个上下文非常小。
在几个小时中,它一直在用浏览器截图做测试和优化。
很可惜,虽然花了很多时间,最后结果并不是太好!

整个游戏是能跑通的,这个是好的。
但是有很明显的几个问题,比如蘑菇是往后跑的,地图的背景有很多仙人掌一样的东西,然后有一部分地图造型很奇怪。按理说它都读到源码了,应该能还原才对。
可能是脑力有限,没有把源代码融会贯通!
天文机械表
这个例子的特点是,一次性给很多需求。看看大模型能否管理好自己的注意力,把所有需求一点点地实现出来。
下面是豆姐的结果:

这个配色和设计还不错。基本上该有的内容都有了。
但是这里有一个很特别的设计,之前的模型都没有这样做过。 豆姐把计时码表的按钮放在了机械表的按钮上。这是一个很有新意的设计,其他模型都是在界面上创建了几个按钮。
比较可惜的是它只实现了一半的功能,其中一个按键无法使用。导致这个计时码表功能不全。
从这个例子可以看出来,豆姐可能真的属于"自研"模型,表现非常与众不同!
赛博朋克版清明上河图
这是我常测的一个例子,主要用来考验模型的创造力、空间感、审美、概念理解和融合能力。
豆包在这方面还是不太行:

结果很粗糙,内容不够丰富,线条很简单,空间感完全没有,审美也是不存在的。
看来这种需要开放思维和创造力的项目,它还无法胜任!
创建网页模板
这次我还加了一个项目。就是让它帮我生成一批网页模板,查看它的网页设计能力。我的需求是,设计一批不同场景、不同行业、不同配色的网页。
这一步不考验脑力,它做得好像挺好的。
这是首页:

其中一个模板:

另一个模板:

有一个模板:

一次性生成了 12 个模板,差异度还可以!
图文混排,配色和布局都不错,审美在线。
豆包这个版本的 Agent 流程还是非常清晰的,很有节奏,但是能力方面有点波动,然后任务时间也变得非常久了。 好几个例子的时长都来到了 1 小时以上。
好像所有国产模型,在跑我的这些例子的时候,处理时间都会变得很长很长。它们好像都意识到了,我提出的问题的复杂性,但是由于脑力有限,所以只能用时间换效果。
而顶级的模型,能理解复杂度,也有能力解决,所以整体时间并不是很长。
整体来说,以我对豆姐的预期来说,算是超预期了!相比几个月前聪明了很多,但是不要和顶级模型比,当然她好像也没有要去比,发布新模型好像很低调,连资料都查不到。
大概就是这样吧!
所有例子我都已经上传到 topai 上了,另外我抽空把 Grok 4.6 和 HY4 的部分例子也补了一下,也有一些看点,HY4 居然做了一个很棒的清明上河图,Grok 4.6 也做了一个特色版本。