不只看跑分,Step 5 Preview 两个真实编程任务实测

最近,国产模型又迎来一轮更新,多家厂商相继推出旗舰模型。从跑分和实际体验来看,这一轮模型的进步都很明显。

9月20日,阶跃星辰发布了新模型 Step 5 Preview。距离上一次发布 Step 3.7 Flash还不到四个月,版本号就从3.7直接跳到了5。这个跨度不小,至少从命名来看,阶跃星辰对这次升级很有信心,也把大家的期待值拉高了。

Step 5 Preview主要面向AI编程、软件工程和专业知识工作,重点处理更接近真实工作的长任务,包括读懂复杂需求、消化大量上下文、调用工具、排查问题,最后交出可以运行和检查的成果。除了代码任务,它在金融等专业知识场景也有重点投入。

模型采用稀疏MoE架构,总参数量为600B,每个Token激活27B参数。简单理解,它具备600B参数的容量,但在处理每个Token时只调用其中一部分,以此兼顾模型能力和运行效率。官方把这个方向称为新一代智能效率的「帕累托前沿

在 Artificial Analysis Intelligence Index v4.3 中,Step 5 Preview 得分44,已经进入前沿模型梯队。

该模型单任务成本仅为同等智能水平模型 GLM-5.3和Kimi K3的35%,Claude Opus 5 12.5%.

Step 5 Preview 还支持1M Token上下文和视觉输入。1M上下文让它可以一次读进很长的需求、代码和资料,视觉输入则让它能理解截图、设计稿和图表。放到开发场景里,这两项能力指向同一个目标:减少人在任务中途反复补充背景和拆解步骤的次数。

上面这些指标是不是一个好看的数字,今天就让我们来实际测试一下这个模型的表现。

怎么测试

我们的测试都在workbuddy里面测试,在实际执行任务的时候选择不同的模型。

这里有一个例外就是 测试gpt5.6 sol 这个模型的时候,选择在Codex中来执行

每个模型使用独立会话和独立目录。测试前统一工具、Skills、依赖安装权限与运行上限,无法完全一致的配置,会在结果中单独说明。

单缸四冲程汽油发动机的剖面动画

第一个测试项目是单缸四冲程汽油发动机的剖面动画。这类动画主要考验机械联动。活塞、连杆和曲轴要按照同一个曲轴角度运动,连杆长度始终不变;气门开合、火花塞点火和缸内颜色变化,也要与当前冲程一致。

这里使用简化后的教学模型。发动机依次经历进气、压缩、做功和排气,一个完整循环中曲轴旋转两周。真实发动机中的提前点火和气门重叠不在测试范围内,这里只检查四个冲程的基本联动。

我给模型提示词如下。

用 HTML、CSS、JavaScript 和 SVG 制作四冲程发动机交互动画。活塞、连杆和曲轴连续联动,气门、点火和文字说明同步。支持暂停、调速、拖动角度、切换冲程和重置,交付可直接打开的网页及操作说明。

最后网页检查的时候,我不仅需要看动画能不能播放,还可以暂停,检查连杆接头有没有脱开、做功时气门是否关闭,

还可以把角度拖到90°、270°、450°和630°。检查这四个位置都在行程中段,气门和活塞的状态是否对不对。

Step 5 Preview

GLM-5.3

DeepSeek-V4.1-Flash

结果如下。

模型 首轮结果 人工纠错 总耗时 冻结画面与交互观察
Step 5 Preview 通过 0轮 10分39秒 665°时处于排气行程,排气门开启、进气门关闭、活塞上行;角度、气门升程、活塞方向和时间轴同时显示
GLM-5.3 通过 0轮 16分29秒 机械部件标注最细,曲轴、连杆、气门和火花塞的相对位置一眼可读
DeepSeek-V4.1-Flash 通过 0轮 10分35秒 状态面板紧凑,曲轴角、凸轮轴角、缸内容积和气门状态集中展示

这个测试题三款是一次性完成,中间即便有错误都是自己测试并修复,但成品的差距还是比较很明显。GLM-5.3把机械结构画得最细,曲轴、连杆、气门和火花塞的位置一眼能看懂。DeepSeek-V4.1-Flash的面板最紧凑,曲轴角、凸轮轴角、缸内容积都收在右侧。

Step 5 Preview更像一份已经排好版的教学课件。我把它停在665°,画面显示排气门开启、进气门关闭、活塞上行,右侧还列出了气门升程和本行程角度。还有就是 这个底部还有一点 没有显示出来,虽然不影响理解,看起来不太完整,另外还有一个就是 我的提示词 明确要求需要交付操作说明,只有Step 5 Preview 把这个显示到了当前页面

Step 5 Preview 用时10分39秒,只比这题最快的DeepSeek-V4.1-Flash多4秒。

三维抓娃娃机

第二测试是三维抓娃娃机。我们不提供任何素材,抓娃娃的机器、玻璃、灯带、爪子和玩偶全靠模型自己用代码搭,没有使用外部模型素材。

这题看着像在比画面,实际更容易翻车的是玩法。爪子要能移动、下落、合拢、抬升、运到取奖口再松开。中间只要一个状态没接好,就会出现抓空也加分、连续点击重复扣币,或者玩偶还在半路分数先涨了。

我给三款模型的提示词如下,提示词还是写的很简单,这个就更加考验模型的细节把握。

制作可操作的三维抓娃娃机。初始3枚代币,支持键盘和触屏控制。抓取根据爪子与玩偶的实际位置判断,展示完整抓取过程,抓空不能计分,抓取中不能重复扣币。提供固定测试布局、重新开始和旋转视角功能。

DeepSeek-V4.1-Flash

GPT-5.6 Sol

Step 5 Preview

DeepSeek-V4.1-Flash用了浅蓝玻璃柜体和高位斜视角,空间关系很清楚,整体偏干净的几何风。GPT-5.6 Sol走霓虹街机路线,第一眼最抓人,玩偶则更接近图标化的小球造型。Step 5 Preview做成了粉色实体机台,顶棚、玻璃柜体和取奖口都在。

GPT-5.6 Sol的配色,确实亮眼。Step 5 Preview胜在完整,画面里能同时看到操作说明、代币、得分、当前状态和抓取日志。

GPT-5.6 Sol最快,用了16分38秒。Step 5 Preview用了39分19秒,速度排在中间。

模型 首轮结果 人工纠错 总耗时 视觉与玩法观察
Step 5 Preview 通过 0轮 39分19秒 实体机台感较强,状态、日志、触控按钮和取奖口齐全,成功与抓空均能完整闭环
GPT-5.6 Sol 通过 0轮 16分38秒 霓虹街机风格最突出,信息层级清楚;玩偶和机台结构更偏图形化表达
DeepSeek-V4.1-Flash 通过 0轮 48分27秒 空间布局清楚,玻璃与阴影表现自然;整体视觉更克制,功能信息较简洁

三款抓娃娃机都都通过了我们的测试, 功能都比较完成,在抓取过程中有一个不同的点,就是DeepSeek-V4.1-Flash和GPT-5.6 Sol 在移动抓取的时候,底部会显示圆圈,可以很清楚的看到是否能抓取到娃娃,Step 5 Preview只有在按下空格,机器开始抓娃娃的时候,才能底部看到一个圆圈,增加了抓取难度。

Step 5 Preview这套最方便复核。抓中以后,分数会增加,我把爪子移到空白处再抓,右侧日志依次出现「投币成功」「到达底部,开始收爪」「判定结果,抓空,不计分」「空抓结束,爪子归位」。

写在最后

这两个测试里,所有参测模型都在首轮通过了验收。单看任务能不能完成,几款模型没有拉开明显差距,区别更多体现在最后交出来的成品上。

做发动机动画时,Step 5 Preview把运动、状态和讲解放在了同一个页面;做抓娃娃机时,它又把操作说明、代币、得分、运行状态和抓取日志都补齐了。这些内容不影响程序能不能运行,却会影响拿到成品以后,是否容易理解、演示和检查。

Step 5 Preview的速度不是最快的,视觉效果也没有全面领先。它给我留下印象最深的,是两次交付都比较完整,提示词里提到的要求基本能在成品中找到,不需要我再追着补充。它没有靠某个特别突出的单项赢下测试,但交到我手里的时候,已经比较像一个做完的产品了。

整个体验下来,我觉得Step 5 Preview完全配得上它在AA上的得分。国产第二、全球开源前三,与GLM-5.3、K3跻身新一线模型。

相关推荐
kyriewen42 分钟前
我扒了 10,221 条 JD:腾讯技术岗 75% 在要 AI
前端·人工智能·ai编程
AIGC小尼1 小时前
本地AI漫剧部署|低配8G显存实战部署MiniMax-H3|4步极速采样+低显存优化完整方案(可角色替换/视频魔改)
人工智能·stable diffusion·comfyui·ai漫剧
宿州派大星1 小时前
[NLP实战] 基于PyTorch实现N-gram词嵌入模型:输入4个词预测第5个词
人工智能·pytorch·深度学习·nlp
郑州光合科技余经理1 小时前
同城外卖小程序开发:下单成功后,后台导出能不能对上用户端状态
开发语言·前端·git·后端·uni-app·php·ai编程
qq_199886872 小时前
第8板块·第2节:统一内存的高级特性与性能调优
c++·人工智能·gpu算力·cuda
ting94520002 小时前
深度拆解Enter Pro AI原生开发平台:从底层架构到企业级落地技术实践
人工智能·架构·ai-native
lisw052 小时前
人工智能辅助科学的快与慢!
人工智能
9呀2 小时前
vscode如何打开多个codex标签页
人工智能
todoitbo2 小时前
本地图库语义搜索实战:接上蓝耘元生代,让“傍晚的海边“能搜到图
人工智能·ai·api·工具实战