最近,国产模型又迎来一轮更新,多家厂商相继推出旗舰模型。从跑分和实际体验来看,这一轮模型的进步都很明显。
9月20日,阶跃星辰发布了新模型 Step 5 Preview。距离上一次发布 Step 3.7 Flash还不到四个月,版本号就从3.7直接跳到了5。这个跨度不小,至少从命名来看,阶跃星辰对这次升级很有信心,也把大家的期待值拉高了。
Step 5 Preview主要面向AI编程、软件工程和专业知识工作,重点处理更接近真实工作的长任务,包括读懂复杂需求、消化大量上下文、调用工具、排查问题,最后交出可以运行和检查的成果。除了代码任务,它在金融等专业知识场景也有重点投入。
模型采用稀疏MoE架构,总参数量为600B,每个Token激活27B参数。简单理解,它具备600B参数的容量,但在处理每个Token时只调用其中一部分,以此兼顾模型能力和运行效率。官方把这个方向称为新一代智能效率的「帕累托前沿

在 Artificial Analysis Intelligence Index v4.3 中,Step 5 Preview 得分44,已经进入前沿模型梯队。

该模型单任务成本仅为同等智能水平模型 GLM-5.3和Kimi K3的35%,Claude Opus 5 12.5%.

Step 5 Preview 还支持1M Token上下文和视觉输入。1M上下文让它可以一次读进很长的需求、代码和资料,视觉输入则让它能理解截图、设计稿和图表。放到开发场景里,这两项能力指向同一个目标:减少人在任务中途反复补充背景和拆解步骤的次数。
上面这些指标是不是一个好看的数字,今天就让我们来实际测试一下这个模型的表现。
怎么测试
我们的测试都在workbuddy里面测试,在实际执行任务的时候选择不同的模型。
这里有一个例外就是 测试gpt5.6 sol 这个模型的时候,选择在Codex中来执行
每个模型使用独立会话和独立目录。测试前统一工具、Skills、依赖安装权限与运行上限,无法完全一致的配置,会在结果中单独说明。
单缸四冲程汽油发动机的剖面动画
第一个测试项目是单缸四冲程汽油发动机的剖面动画。这类动画主要考验机械联动。活塞、连杆和曲轴要按照同一个曲轴角度运动,连杆长度始终不变;气门开合、火花塞点火和缸内颜色变化,也要与当前冲程一致。
这里使用简化后的教学模型。发动机依次经历进气、压缩、做功和排气,一个完整循环中曲轴旋转两周。真实发动机中的提前点火和气门重叠不在测试范围内,这里只检查四个冲程的基本联动。
我给模型提示词如下。
用 HTML、CSS、JavaScript 和 SVG 制作四冲程发动机交互动画。活塞、连杆和曲轴连续联动,气门、点火和文字说明同步。支持暂停、调速、拖动角度、切换冲程和重置,交付可直接打开的网页及操作说明。
最后网页检查的时候,我不仅需要看动画能不能播放,还可以暂停,检查连杆接头有没有脱开、做功时气门是否关闭,
还可以把角度拖到90°、270°、450°和630°。检查这四个位置都在行程中段,气门和活塞的状态是否对不对。
Step 5 Preview


GLM-5.3


DeepSeek-V4.1-Flash


结果如下。
| 模型 | 首轮结果 | 人工纠错 | 总耗时 | 冻结画面与交互观察 |
|---|---|---|---|---|
| Step 5 Preview | 通过 | 0轮 | 10分39秒 | 665°时处于排气行程,排气门开启、进气门关闭、活塞上行;角度、气门升程、活塞方向和时间轴同时显示 |
| GLM-5.3 | 通过 | 0轮 | 16分29秒 | 机械部件标注最细,曲轴、连杆、气门和火花塞的相对位置一眼可读 |
| DeepSeek-V4.1-Flash | 通过 | 0轮 | 10分35秒 | 状态面板紧凑,曲轴角、凸轮轴角、缸内容积和气门状态集中展示 |
这个测试题三款是一次性完成,中间即便有错误都是自己测试并修复,但成品的差距还是比较很明显。GLM-5.3把机械结构画得最细,曲轴、连杆、气门和火花塞的位置一眼能看懂。DeepSeek-V4.1-Flash的面板最紧凑,曲轴角、凸轮轴角、缸内容积都收在右侧。
Step 5 Preview更像一份已经排好版的教学课件。我把它停在665°,画面显示排气门开启、进气门关闭、活塞上行,右侧还列出了气门升程和本行程角度。还有就是 这个底部还有一点 没有显示出来,虽然不影响理解,看起来不太完整,另外还有一个就是 我的提示词 明确要求需要交付操作说明,只有Step 5 Preview 把这个显示到了当前页面
Step 5 Preview 用时10分39秒,只比这题最快的DeepSeek-V4.1-Flash多4秒。
三维抓娃娃机
第二测试是三维抓娃娃机。我们不提供任何素材,抓娃娃的机器、玻璃、灯带、爪子和玩偶全靠模型自己用代码搭,没有使用外部模型素材。
这题看着像在比画面,实际更容易翻车的是玩法。爪子要能移动、下落、合拢、抬升、运到取奖口再松开。中间只要一个状态没接好,就会出现抓空也加分、连续点击重复扣币,或者玩偶还在半路分数先涨了。
我给三款模型的提示词如下,提示词还是写的很简单,这个就更加考验模型的细节把握。
制作可操作的三维抓娃娃机。初始3枚代币,支持键盘和触屏控制。抓取根据爪子与玩偶的实际位置判断,展示完整抓取过程,抓空不能计分,抓取中不能重复扣币。提供固定测试布局、重新开始和旋转视角功能。
DeepSeek-V4.1-Flash


GPT-5.6 Sol


Step 5 Preview


DeepSeek-V4.1-Flash用了浅蓝玻璃柜体和高位斜视角,空间关系很清楚,整体偏干净的几何风。GPT-5.6 Sol走霓虹街机路线,第一眼最抓人,玩偶则更接近图标化的小球造型。Step 5 Preview做成了粉色实体机台,顶棚、玻璃柜体和取奖口都在。
GPT-5.6 Sol的配色,确实亮眼。Step 5 Preview胜在完整,画面里能同时看到操作说明、代币、得分、当前状态和抓取日志。
GPT-5.6 Sol最快,用了16分38秒。Step 5 Preview用了39分19秒,速度排在中间。
| 模型 | 首轮结果 | 人工纠错 | 总耗时 | 视觉与玩法观察 |
|---|---|---|---|---|
| Step 5 Preview | 通过 | 0轮 | 39分19秒 | 实体机台感较强,状态、日志、触控按钮和取奖口齐全,成功与抓空均能完整闭环 |
| GPT-5.6 Sol | 通过 | 0轮 | 16分38秒 | 霓虹街机风格最突出,信息层级清楚;玩偶和机台结构更偏图形化表达 |
| DeepSeek-V4.1-Flash | 通过 | 0轮 | 48分27秒 | 空间布局清楚,玻璃与阴影表现自然;整体视觉更克制,功能信息较简洁 |
三款抓娃娃机都都通过了我们的测试, 功能都比较完成,在抓取过程中有一个不同的点,就是DeepSeek-V4.1-Flash和GPT-5.6 Sol 在移动抓取的时候,底部会显示圆圈,可以很清楚的看到是否能抓取到娃娃,Step 5 Preview只有在按下空格,机器开始抓娃娃的时候,才能底部看到一个圆圈,增加了抓取难度。
Step 5 Preview这套最方便复核。抓中以后,分数会增加,我把爪子移到空白处再抓,右侧日志依次出现「投币成功」「到达底部,开始收爪」「判定结果,抓空,不计分」「空抓结束,爪子归位」。
写在最后
这两个测试里,所有参测模型都在首轮通过了验收。单看任务能不能完成,几款模型没有拉开明显差距,区别更多体现在最后交出来的成品上。
做发动机动画时,Step 5 Preview把运动、状态和讲解放在了同一个页面;做抓娃娃机时,它又把操作说明、代币、得分、运行状态和抓取日志都补齐了。这些内容不影响程序能不能运行,却会影响拿到成品以后,是否容易理解、演示和检查。
Step 5 Preview的速度不是最快的,视觉效果也没有全面领先。它给我留下印象最深的,是两次交付都比较完整,提示词里提到的要求基本能在成品中找到,不需要我再追着补充。它没有靠某个特别突出的单项赢下测试,但交到我手里的时候,已经比较像一个做完的产品了。
整个体验下来,我觉得Step 5 Preview完全配得上它在AA上的得分。国产第二、全球开源前三,与GLM-5.3、K3跻身新一线模型。