导语:2026年9月,一项独立的机器人基准测试给出了一个耐人寻味的结果。在"拿积木放碗里"的任务上,GPT‑6 Astra以95%的成功率碾压Claude Fable系列的5%和40%,且成本降低了一半以上。但当任务变成"把拼图块插入凹槽"时,Astra和Fable一样卡在了最后一步------成功率只有10%。这暴露了一个被广泛忽视的真相:当前最顶尖的视觉-语言-动作模型,在自由空间操作中已经足够强,但在需要精细接触的任务中,集体失效。
一、实测设计:三个模型,双臂机器人,两项任务
这场评测使用统一的双臂机器人平台(I2RT YAM),每只机械臂6自由度,配备平行夹爪。三个模型------GPT‑6 Astra、Claude Fable 5、Fable 5.1------接入同一个智能体策略,拥有相同的观察空间(顶部相机、左腕相机、右腕相机+本体感觉状态),各自完成两项任务:
任务一(Bowl):拿起桌上的红色积木,放进碗里。
任务二(Puzzle):拿起中央有旋钮的圆形蓝色拼图块,插入板上匹配的圆形凹槽。
每项任务每个模型20次试验,由人工评分,记录每次达到的最高阶段(0=无意图接近,1=接触物体,2=将物体抬离桌面,3=定位到放入点上方,4=放置到位)。
二、碗任务:Astra的全面碾压
在"积木入碗"任务中,GPT‑6 Astra的表现是压倒性的。
成功率:Astra达到95%(19/20次),Fable 5.1为40%(8/20),Fable 5仅5%(1/20)。
效率:Astra平均每轮2.5分钟,Fable 5.1要6.8分钟,Fable 5要8.2分钟。Astra快了约2.7倍。
成本:Astra平均每次运行**0.94\*\*,Fable 5.1为2.12,Fable 5为$2.69。Astra便宜了2.3倍于Fable 5.1。
最惊人的细节在token使用量:Astra的平均输出token只有2.1k,而Fable 5.1是12.9k。这意味着Astra用极少的文本推理就完成了任务------它似乎更"清楚"每一步该做什么,不需要海量的语言思考。
从评分阶段分布看更直观:Fable 5的20次试验中,13次停留在"接触物体"阶段(阶段1)------它很多时候根本没把积木捡起来。而Astra有19次直接到达"放置到位"(阶段4)。
在自由空间抓放任务上,新一代模型的进步是实质性的------更快、更便宜、更可靠。
三、拼图任务:所有模型一起撞墙
但第二个任务让局面急转直下。
Astra的成功率是2/20(10%),Fable 5.1也是2/20(10%),Fable 5是0/20。
从阶段分布看,Astra最常见的结果是阶段3------"已将拼图块定位到凹槽上方"(9次),以及阶段1------"接触物体"(5次)。它能看到凹槽,能把拼图块举到正确位置的上方,但就是在最后插入这一步卡住了。Fable 5.1的分布模式几乎完全相同(阶段3为9次)。
一个值得注意的细节:Astra在拼图任务上的每次运行成本比碗任务高44%(1.36 vs 0.94),但两者的输出token量差别不大(2.7k vs 2.1k)。这说明模型在这个任务上进行了更多尝试和调整,但这些额外的努力没有转化为成功。
所有模型都停在同一步骤------这说明问题不在于某个模型的个体能力,而在于整个技术范式的共同盲区。
四、为什么都在"最后一步"失败?
原因一:模型缺乏接触感知
当拼图块被举到凹槽上方时,相机已经无法提供关键的接触状态信息。夹爪、拼图块和凹槽三者之间的关系常被遮挡。模型需要知道:边缘是否对齐?有没有轻微倾斜?往下压的力是否在安全范围内?
但当前的视觉-语言-动作模型的观察空间只有相机图像和本体感觉状态------没有触觉,没有力反馈。这意味着模型在插入时是"盲操作":它看到凹槽,凭视觉判断往下压,却无法感知接触是否正常、是否发生了卡滞。
这与NTU PINE Lab的Facet-0工作形成鲜明对比。Facet-0在亚毫米级装配中实现82%成功率,关键在于它引入了力/力矩预测------让模型在动作之前就"知道"这个动作会产生什么样的接触,并在部署中通过力反馈进行实时调整。而GPT‑6 Astra和Fable系列,本质上都在"盲插"。
原因二:任务从"几何问题"变成了"物理交互问题"
"抓积木放碗里"本质上是几何导航问题------识别位置、规划轨迹、到达后释放。视觉信息几乎就是所需的全部。
"拼图块插入凹槽"则本质上是物理交互问题------需要感知微小的力变化,判断插入是否顺畅,必要时进行亚毫米级的姿态微调。视觉模型能回答"在哪里",却无法回答"接触正在发生什么"。
原因三:当前VLA基准测试的评分体系掩盖了"接触"的缺失
评分标准中,"阶段3=定位到放入点上方"和"阶段4=放置到位"之间的差距,恰好是自由空间操作与精细接触操作的分水岭。当前大多数VLA基准测试都集中在阶段1-3,而阶段4------真正需要接触感知的一步------往往被当作"简单收尾"而忽略了。
这次实测的价值正在于:它用一个看似简单的任务,暴露了这个被长期忽视的"最后一毫米"问题。
五、更深的启示:大模型的"智能"快了,机器人的"皮肤"没跟上
这场实测传递了一个行业性的判断:大模型的推理能力正在快速提升,但机器人的感知能力没有同步进化。
GPT‑6 Astra可以在几秒内生成简洁、准确的决策,但它仍然无法感受接触力,无法检测滑移,无法判断插入是否顺畅。这种能力的缺失,无法通过更多的token、更强的推理来弥补------因为问题不在大脑,在皮肤。
这印证了具身智能领域正在形成的共识:视觉-语言模型把机器人带到了物理世界的门口,但要推开门,需要触觉和力觉。
在Facet-0的工作中,研究者通过"动作-力矩联合预测"让模型在动作之前预判接触后果,实现了82%的精密装配成功率。在DECO的工作中,一个插件式触觉适配器让接触密集任务的成功率提升了20个百分点。这些工作的共同指向是:下一代的机器人基础模型,必须把"接触"从被动的观测升级为主动的预测和评估对象。
当模型能够看到物体,却无法感受到物体时,它的智能是残缺的------就像一个视力正常但指尖麻木的人,能准确走到门前,却无法判断门是锁着还是虚掩着。
六、从"会看"到"会摸":具身智能的下一个分水岭
GPT‑6 Astra的这场实测,用数据告诉我们一个清晰的事实:
在自由空间任务上,大模型的进步是真实的、可量化的。95%的成功率、2.5分钟的完成时间、不到1美元的成本------这些数字在一年前都是不可想象的。
但在接触密集任务上,大模型与真实世界之间的鸿沟依然巨大。10%的成功率,与Fable系列完全相同的失败模式,说明这不是某个厂商的问题,而是整个VLA范式的共同瓶颈。
当"看到并规划"已经接近完美时,真正卡住机器人的,是"摸到并调整"。这个瓶颈,不是更大的模型能解决的------它需要新的感知模态、新的训练范式、以及把"接触"纳入学习目标的系统性重构。
视觉让机器人走到了接触的门前,但推开门的那一下,需要触觉来完成。
参考资料
-
Inspect Robots基准测试:GPT‑6 Astra on robotic manipulation(2026年9月4日)
-
Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation(arXiv:2609.01596)
-
DECO: Decoupled Multimodal Diffusion Transformer with a Plugin Tactile Adapter(ICML 2026)
