写在前面:
社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~
AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。
论文:RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?(Zhejiang University / University of Electronic Science and Technology of China / South China Normal University,EMNLP 2026)
发布时间:2026 年 9 月 4 日(arXiv v1)
作者:Zhenxuan Fan、Bo Zhang、Yutong Lin、Yuqian Yuan、Juekai Lin、Liang Liang、Zhuoyi Huang、Wenqiao Zhang、Juncheng Li、Siliang Tang、Jun Xiao、Yueting Zhuang(共 12 人)
核心一句话:RoboSPA 用 2 维度 10 类别、56 个基础任务 × 5 级难度实例化出 280 个变体、采集 527K 条轨迹;四个代表 VLA 模型在最难档 L5 的平均成功率全部 ≤25%(最强的 π0.5 仅 22.3%),机会校正指标 ONTA 显示多数模型的细粒度空间目标选择接近甚至低于随机猜测,而记忆密集型规划在 L5 的成功率对所有模型都是 0。
核心关键词
- RoboSPA(Robot Spatial-Procedural Assessment):面向"具身推理诊断"的大规模机器人操作数据集与基准,模拟环境构建、多本体、多难度、带步骤级诊断。
- 细粒度空间推理(Fine-Grained Spatial Reasoning):靠几何属性、距离、行列索引、参照关系、跨视角等细微空间线索(而非类别/颜色)锁定目标的能力。
- 长程程序规划(Long-Horizon Procedural Planning):重复执行、无序/有序完成多子目标、复合动作协调、记忆密集规划等跨多步决策的能力。
- 五级难度实例化(L1--L5):每个基础任务按"候选物体增多"或"动作序列变长"实例化为 5 个变体,用来画性能退化曲线而非单点分数。
- ONTA(Object-Normalized Target Accuracy):借鉴 Cohen's kappa 的机会校正指标,扣掉"物体数带来的随机基线",0 分即等于随机猜。
- PS(Progress Score):长程任务的子任务完成进度分,区分"完全失败"与"完成了一半才失败"。
- 步骤级评估(step-level evaluation):记录 rollout 中每个动作/子任务的完成状态,使失败可归因而非只有一个二元成败。
带着问题阅读
- 现有操作基准都在量"任务做没做成",RoboSPA 为什么说这不够?它要诊断的"推理"具体指什么?
- 五级难度是随意加的刻度,还是有控制的推理负担递增?空间任务与长程任务的"加难"方式有何不同?
- ONTA 为什么要做机会校正?不做的话,"候选物体变多导致成功率下降"会被误读成什么?
- 四个 VLA 模型在 L5 全线下滑,失败到底卡在"选错目标"还是"手不行"?错误类型分布给出了怎样的答案?
- 一个全仿真的 tabletop 基准,结论对真机与开放世界还成立吗?论文的边界在哪里?
一、核心导读
VLA 模型这两年的成绩单有一个共同底色:在结构化、短horizon、场景干净的任务上表现可喜。RT-1/RT-2/OpenVLA 把动作预测做成token生成,RDT/π0 系换上扩散或 flow-matching 连续动作头,π0.5/GR00T N1 用分层策略 bridging 高层语言与低层电机,再往后是跨本体数据与空间引导、记忆机制、未来帧预测各路增强。但把这些成绩放进日常操作场景就会露馅:桌上一堆相似杯子时"把左边第二个拿给我"靠的不是类别识别而是空间推理;"把三个瓶子收进垃圾桶再按顺序盖章"靠的不是单步反射而是程序性规划与记忆。
RoboSPA 的问题意识正在于此:现有数据集与基准主要在"预定义设置下任务是否完成"这一层做评估,对"空间与程序复杂度递增时模型如何推理、在哪里退化"几乎没有诊断力。它的回应是一套三原则设计------把细粒度空间推理与长程程序规划立为两个核心维度、把多级难度与步骤级诊断立为评估骨架、把规模(527K 轨迹、5 本体、干净+域随机场景)立为覆盖保障。
读这篇论文建议抓住一条主线:"退化曲线比单点分数更有信息"。RoboSPA 的每个结论都建立在 L1→L5 的下降斜率、ONTA 相对随机基线的位置、PS 与 SR 的差值这三条"差值证据"上:最强模型 π0.5 总体从 L1 的 55.2% 跌到 L5 的 22.3%;空间维度上多数模型的 ONTA 为负(比随机猜还差);长程维度上 PS 普遍高于 SR(说明模型"会做一半"但收不了尾),而记忆密集型规划 MIP 在 L5 的成功率对所有模型都是 0。这三组差值合起来,把"VLA 还不会推理"从印象变成了可复测的测量。
二、问题背景:VLA 评测停在"做没做成",而部署需要"为什么失败"
2.1 真实操作的三个挑战与基准的缺位
论文把日常操作对 VLA 的要求拆成三条:其一,细粒度目标消歧 ------在视觉相似候选中靠细微空间线索(而非类别或颜色)认出目标;其二,时间延展的执行 ------多步决策、时序约束、误差累积下的持续执行;其三,复杂度可扩展的具身推理------候选数、horizon、环境多样性上升时 grounding 与规划不应崩塌。这三条恰好对应"推理"的三个侧面:选对、做完、扛得住变难。
而现有基准在这三面上的供给是稀薄的。论文在引言中点了四类缺口:细粒度空间推理很少被显式评估;长程与步骤级评估有限(LIBERO、RoboTwin 2.0 偏短horizon,RoboCasa、MIKASA-Robo 缺步骤级诊断);多数工作缺乏受控的多级难度,难以分析"随复杂度上升的退化";以及规模不足------主流数据集多在 200K 轨迹以下,限制了任务、本体与场景的覆盖面。
2.2 与 15 个数据集/基准的逐维对照
下表是论文的定位表(原论文 Table 1),上半为数据集、下半为基准,最后三列加"多难度"与"场景多样性"共五个能力列。可以清楚看到:没有任何一个先前工作同时在"空间推理、长程任务、步骤级评估、多难度、场景多样性"五列全打勾,而 RoboSPA 是唯一五行全 √ 的条目;规模上 527K 轨迹也仅次于聚合型的 Open X-Embodiment(1.4M)。
| 名称 | 类别数 | 任务数 | 轨迹数 | 本体数 | 空间推理 | 长程任务 | 步骤级评估 | 多难度 | 场景多样性 |
|---|---|---|---|---|---|---|---|---|---|
| BC-Z | 3 | 100+ | 26K | 1 | ✕ | ✕ | ✕ | ||
| RT-1 | 8 | 700+ | 130K | 1 | ✕ | ✕ | √ | ||
| BridgeData V2 | - | 13 | 60.1K | 1 | ✕ | ✕ | ✕ | ✕ | √ |
| Open X-Embodiment | 527 | 160,266 | 1.4M | 22 | ✕ | ✕ | ✕ | √ | |
| DROID | - | 86 | 76K | 1 | ✕ | ✕ | ✕ | √ | |
| RLBench | - | 100 | - | 1 | ✕ | ✕ | ✕ | ||
| CALVIN | - | 34 | N/A† | 1 | ✕ | √ | ✕ | ||
| LIBERO | 4 | 130 | 6.5K | 1 | ✕ | ✕ | ✕ | √ | |
| ManiSkill2 | 4 | 20 | N/A‡ | 1 | ✕ | ✕ | ✕ | ✕ | |
| RoboCasa | - | 100 | ~100K | 1 | ✕ | ✕ | ✕ | √ | |
| SimplerEnv | - | 8 | - | 2 | ✕ | ✕ | ✕ | ✕ | √ |
| MIKASA-Robo | 12 | 32 | 32K | 1 | ✕ | √ | ✕ | √ | ✕ |
| RoboTwin 2.0 | - | 50 | ≤137.5K | 5 | ✕ | ✕ | ✕ | ✕ | √ |
| LIBERO-Pro | 4 | 40 | - | 1 | ✕ | ✕ | ✕ | ✕ | √ |
| RMBench | 2 | 9 | 450 | 1 | ✕ | ✕ | ✕ | ||
| RoboSPA(本文) | 10 | 280 | 527K | 5 | √ | √ | √ | √ | √ |
† CALVIN 以约 24 小时遥操作演示计;‡ ManiSkill2 以超过 4M 演示帧计。
需要提醒的是,这类对照表天然是"作者选择维度"的产物:五列全 √ 说明覆盖广,但不自动等于"更难"或"更好"------难度与诊断力要靠后文的退化曲线与错误分析来证明。论文自己也把证据重心放在实验而非这张表上。
2.3 两条相关研究线的交汇点
相关工作分两条线。VLA 模型线:从 RT-1/RT-2/OpenVLA 的离散 token 自回归,到 RDT/π0 的扩散与 flow-matching 连续动作,到 π0.5/GR00T N1 的分层策略与跨任务泛化,再到 AgiBot World/X-VLA 的隐式动作建模与跨本体数据,以及空间引导、记忆机制、未来帧预测等增强路线。数据集与基准线:BridgeData V2/Open X-Embodiment/DROID/AgiBot World 扩真实世界跨本体覆盖;RLBench/CALVIN/ManiSkill2/LIBERO 提供结构化技能与语言条件控制评测;新近基准进一步考察场景与能力泛化、sim-to-real、双臂与记忆依赖任务。论文的判断是:这两条线的交汇处------"以空间推理与长程规划为核心、带步骤级诊断的系统评测"------仍是空白,RoboSPA 就填在这里。
三、核心思路:把"推理负担"做成可控变量
RoboSPA 的总览如下图所示:以细粒度空间推理与长程程序规划为两个核心维度,覆盖 10 个任务类别、56 个基础任务;每个任务 5 个难度级别,共 280 个变体;527K 条轨迹、跨多本体与多场景设置,支持对空间推理、长程执行与可扩展具身推理的步骤级评估。

如图所示,这张总览图的信息密度集中在"三个乘法"上:10 类别 × 5 难度 = 280 变体(难度是设计变量而非事后标签);5 本体 × 干净/域随机两类场景(覆盖是设计变量);任务级成败 × 步骤级进度(诊断粒度是设计变量)。论文用 SAPIEN 模拟器与 RoboTwin 2.0 框架搭建全部任务,任务由专家代码定义场景、执行程序与成功条件,并复用 RoboTwin 2.0 的部分动作原语;10 名受训研究生每人负责一个能力类别设计任务,每个任务再经另外两人评审------把"基准质量"也流程化了。
这套设计背后有一个方法论主张:基准的价值不在"给出一个分数",而在"给出一个可归因的退化剖面"。因此 RoboSPA 的每个组件都服务于归因:难度分级分离"推理负担"与"模型能力",ONTA 分离"空间推理"与"随机基线",PS 分离"部分完成"与"彻底失败",错误类型分布分离"选错目标"与"执行失败"。理解了这一点,后文所有图表都是同一主张的不同切面。
四、方法展开:基准如何被造出来
4.1 能力分类学:两个维度、十个类别
RoboSPA 不把操作任务当孤立实例,而是建了一棵层级能力分类学,如下图所示:图上半为两维度十类别的分类树,图中半为"增加物体数或动作序列长度"的多难度任务设计,图下半为涵盖布局、干扰物、光照、纹理、桌面的域随机场景。

细粒度空间推理维度考察"在复杂空间配置中把指令 grounding 到正确目标",含五个类别:几何属性认知(GAC,按尺寸/高度/长度/底面积等几何属性而非类别识别物体)、空间距离估计(SDE,比较物体间或到参照物的远近)、规范位置索引(CPI,在不同计数方向与扫描顺序下按行列索引定位)、参照关系推理(RRR,按相对参照物的方向关系定位,含组合位置)、跨视角推理(CVR,从非自中心视角解读空间指令并完成视角变换)。论文称其为"首个把细粒度空间推理立为核心评估维度的 VLA 数据集"。
长程程序规划维度考察"跨多步决策完成延展操作",同样五个类别:重复程序跟随(RPF,重复指定操作指定次数并正确停止)、无序执行(OFE,灵活顺序完成多子目标、不漏不重)、有序执行(OCE,按指定顺序完成------顺序错即失败)、复合动作协调(CAC,跨阶段协调异构操作技能)、记忆密集规划(MIP,线索被遮蔽或需回忆时保留信息并指导后续动作)。
4.2 任务套件与五级难度:把推理负担做成刻度
任务套件的全量清单见下面两张表(原论文 Table 8、Table 9):空间维度 24 个基础任务、长程维度 32 个基础任务(含 MIP 5 个),合计 56 个。难度实例化的规则是维度特异的:空间任务加候选物体数,长程任务加程序步数------这保证"L5 更难"难在推理负担上,而不是难在视觉外观上。指令侧,每个任务用 GPT-5.2 生成 60 个语义受控、互不重叠的指令模板,50 个用于训练、10 个用于测试,再实例化为 100 条训练指令与 100 条不相交的评测指令------训练/评测指令严格 disjoint,堵住"背指令"的捷径。
| 类别 | 任务名 | 任务描述 |
|---|---|---|
| GAC | Pick Blocks Size | 按尺寸从多个方块中取目标方块 |
| GAC | Pick Blocks Height | 按高度从多个方块中取目标方块 |
| GAC | Pick Blocks Length | 按长度从多个方块中取目标方块 |
| GAC | Pick Blocks Area | 按底面积从多个方块中取目标方块 |
| SDE | Pick Blocks Distance | 结合颜色与相对距离线索从多个方块中取目标 |
| SDE | Pick Mugs Distance | 结合颜色与相对距离线索从多个马克杯中取目标 |
| SDE | Pick Pill Bottles Distance | 结合颜色与相对距离线索从多个药瓶中取目标 |
| SDE | Pick Mixed Objects Distance A | 在混合物体集 A 中按颜色与相对距离取目标 |
| SDE | Pick Mixed Objects Distance B | 在混合物体集 B 中按颜色与相对距离取目标 |
| CPI | Pick Blocks Canonical | 按方块在序列中的序位取目标 |
| CPI | Pick Cups Canonical | 按杯子在序列中的序位取目标 |
| CPI | Pick Rubik Cubes Canonical | 按魔方在序列中的序位取目标 |
| CPI | Pick Mixed Objects Canonical A | 在混合物体集 A 中按序位取目标 |
| CPI | Pick Mixed Objects Canonical B | 在混合物体集 B 中按序位取目标 |
| RRR | Pick Tea Box Relational | 按相对另一参照茶盒的位置取目标茶盒 |
| RRR | Pick Cans Relational | 按相对另一参照罐的位置取目标罐 |
| RRR | Pick Soaps Relational | 按相对另一参照肥皂的位置取目标肥皂 |
| RRR | Pick Mixed Objects Relational A | 在混合场景中按参照物体取目标 |
| RRR | Pick Mixed Objects Relational B | 在混合场景中按参照物体取目标 |
| CVR | Pick Sauce Can Multi View | 在给定视角下按绝对位置取目标酱罐 |
| CVR | Pick Seals Multi View | 在给定视角下按绝对位置取目标印章 |
| CVR | Pick Breads Multi View | 在给定视角下按绝对位置取目标面包 |
| CVR | Pick Mixed Objects Multi View A | 在给定视角下从混合组 A 取目标 |
| CVR | Pick Mixed Objects Multi View B | 在给定视角下从混合组 B 取目标 |
| 类别 | 任务名 | 任务描述 |
|---|---|---|
| RPF | Press Stapler Repeat | 重复按压订书机 |
| RPF | Lift Pot Repeat | 反复拿起并放下锅 |
| RPF | Lift Fan Repeat | 反复拿起风扇 |
| RPF | Click Bell Repeat | 反复点击铃铛 |
| OFE | Put Bottles Dustbin | 无固定顺序把多个瓶子放入垃圾桶 |
| OFE | Move Blocks Apart | 无固定顺序把多个方块移开 |
| OFE | Move Playing Cards Away | 无固定顺序移走多张扑克牌 |
| OFE | Place Bowls Plates | 无固定顺序把多个碗放到盘子上 |
| OFE | Separate Fries Bread | 把薯条与面包分到不同区域 |
| OFE | Rank Blocks Height | 按高度排列方块,中间顺序灵活 |
| OFE | Rank Blocks Color | 按颜色排列方块,中间顺序灵活 |
| OFE | Rank Blocks Size | 按尺寸排列方块,中间顺序灵活 |
| OCE | Hit Blocks Hammer Order | 按指定颜色顺序用锤敲击方块 |
| OCE | Click Objects Order | 按指定顺序点击多个目标 |
| OCE | Stamp Seals Order | 按指定顺序盖章 |
| OCE | Click Bell Clockwise Order | 先点铃再按顺时针序列执行 |
| OCE | Stack Blocks Color Order | 按指定颜色顺序堆叠方块 |
| OCE | Stack Blocks Size Order | 按指定尺寸顺序堆叠方块 |
| OCE | Stack Blocks Length Order | 按指定长度顺序堆叠方块 |
| CAC | Place Phone Press Stapler | 放手机、重复按压、倾倒的复合操作 |
| CAC | Place Bottle Cup | 扔瓶入桶、放杯于杯垫的复合操作 |
| CAC | Hang Mug Stack Blocks | 挂杯上架、自底向上堆方块的复合操作 |
| CAC | Place Object Scale Click | 放置、按压、归位的复合操作 |
| CAC | Place Burger Fries Click Bell | 放汉堡薯条于托盘、点铃、归位的复合操作 |
| CAC | Click Can Place Items | 点罐与放面包/药瓶交错的复合操作 |
| CAC | Stamp Seals Press Stapler | 左右印章各盖两次并按订书机的复合操作 |
| CAC | Click Bell Open Microwave Place Object | 点铃、开微波炉、相对放置交错的复合操作 |
| MIP | Observe Blocks Move Memory | 先记住展示方块颜色,遮蔽后移动桌上同色方块 |
| MIP | Observe Objects Click Memory | 先记住展示台物体顺序,遮蔽后按序点击桌上物体 |
| MIP | Remember Color Cover | 先记住方块颜色,被遮盖后按色序揭开 |
| MIP | Remember Orientation Restore | 先记住前排 T 块朝向,遮蔽后调整后排 T 块匹配 |
| MIP | Press Stapler Memory | 记住每个订书机应按次数后再按 |
下面三组图给出空间维度最难档(L5)的任务可视化,每行展示代表性 rollout 帧、任务类别、任务名与指令,可以直接看到"候选物体堆满桌面、线索只剩几何/距离/序位/关系/视角"时任务长什么样。



如图所示,空间任务的"难"不来自视觉渲染复杂度,而来自消歧线索的稀薄化:候选越多、线索越细微(底面积、序位方向、参照关系、他人视角),"看一眼就知道拿哪个"的捷径越不存在。这正是 ONTA 机会校正要度量的东西(见 4.4)。
紧接着七组图是长程维度 L5 的任务可视化,覆盖 RPF/OFE/OCE/CAC/MIP 全部五类:从"重复按订书机并按次数停止",到"无序收瓶子",到"按色序敲击/堆叠",到"点铃---开微波炉---相对放置交错",再到"先看后遮、凭记忆操作"。







对比上面两组画廊可以看出设计上的对称性:空间组加难靠"桌上东西变多",长程组加难靠"流程变长、约束变硬、线索被遮"。MIP 一类尤其苛刻------信息只在开头出现一次,之后被物理遮蔽,模型没有任何"再看一眼"的机会;后文 L5 全员 0% 的结果,在这组图里已经埋下伏笔。
4.3 场景、本体与数据规模:覆盖也是设计变量
数据采集在干净与域随机两类场景中进行:干净场景只含任务相关物体;域随机场景(如下图所示)在背景外观、桌面 clutter、桌高、光照四个方面扰动,任务语义与成功条件不变------于是同一模型可以分别被量"任务能力"与"场景鲁棒性"。

本体侧支持五种机械臂/双臂平台,如下图所示,从左到右为 Aloha-AgileX、ARX-X5、Piper、Franka、UR5:它们共享任务语义、语言指令、物体配置与成功条件,只在形态、工作空间、相机视角与执行行为上不同,用于检验模型是否超出单一本体。

规模与分布如下图所示:图左一为五条本体的轨迹分布,左二为干净/域随机场景的轨迹分布,右二为空间任务各难度的平均物体数(随难度单调上升),右一为长程任务各难度的平均轨迹长度(随难度单调上升)------后两幅子图是"难度刻度确实加在推理负担上"的直接证据。

总量上:56 基础任务 × 5 难度 = 280 变体,约 527K 条轨迹、997+ 小时交互视频、108M timesteps;物体资产来自 RoboTwin-OD 与 RMBench 资产库,共 120 个物体类别、581 个变体,完整清单见下表(原论文 Table 5)。
| 资产 | 变体数 | 资产 | 变体数 | 资产 | 变体数 | 资产 | 变体数 |
|---|---|---|---|---|---|---|---|
| bottle | 27 | olive-oil | 5 | pencup | 7 | globe | 2 |
| bowl | 7 | drill | 7 | kitchenpot | 7 | trophy | 5 |
| cover | 1 | jam-jar | 5 | battery | 6 | notebook | 3 |
| plate | 1 | screwdriver | 1 | plasticbox | 11 | brush-pen | 6 |
| fluted-block | 2 | fork | 1 | tabletrashbin | 11 | rest | 4 |
| french-fries | 4 | knife | 1 | msg | 6 | glue | 6 |
| hamburg | 6 | apple | 2 | soy-sauce | 5 | cleaner | 4 |
| T_block | 2 | cabinet | 1 | vinegar | 3 | screen | 4 |
| shoe-box | 1 | box | 1 | steamer | 3 | speaker | 6 |
| tray | 4 | milk-box | 4 | boxdrink | 4 | fan | 7 |
| kettle | 9 | mug | 13 | vagetable | 7 | seal | 6 |
| pen | 7 | rack | 1 | paymentsign | 4 | milk-tea | 6 |
| dustbin | 1 | shoe | 10 | can | 6 | roller | 3 |
| plant-pot | 5 | wooden_box | 1 | electronicscale | 5 | fruit | 7 |
| dumbbell-rack | 4 | book | 2 | rubikscube | 3 | board | 5 |
| bookcase | 4 | microwave | 2 | displaystand | 5 | sauce-can | 5 |
| laptop | 11 | sand-clock | 3 | bread | 7 | skillet | 4 |
| oven | 4 | alarm-clock | 6 | breadbasket | 5 | soap | 4 |
| calculator | 6 | mouse | 3 | phone | 5 | block | 7 |
| microphone | 4 | stapler | 7 | phonestand | 7 | hydrating-oil | 4 |
| coaster | 1 | shampoo | 7 | remotecontrol | 7 | basket | 4 |
| hammer | 1 | bell | 2 | pillbottle | 5 | callbell | 6 |
| cup | 13 | candlestick | 5 | playingcards | 3 | tea-box | 6 |
| cup-with-liquid | 1 | dumbbell | 7 | smallshovel | 4 | coffee-box | 7 |
| tissue-box | 7 | teanet | 5 | brush | 4 | perfume | 4 |
| scanner | 5 | baguette | 2 | woodenmallet | 5 | keyboard | 4 |
| chips-tub | 4 | small-speaker | 3 | gong | 6 | whiteboard-eraser | 1 |
| pet-collar | 4 | switch | 8 | woodenblock | 5 | tooth-paste | 1 |
| table-tennis | 2 | toycar | 6 | waterer | 8 | mini-chalkboard | 1 |
| roll-paper | 4 | markpen | 6 | wineglass | 5 | plant | 1 |
4.4 评估指标:SR 之外补两把"归因尺"
成功率(SR)之外,RoboSPA 为两个维度各配一个诊断指标。ONTA 借鉴 Cohen's kappa 的机会校正思想,扣除物体数带来的随机基线:
公式(1):
O N T A ( n ) = ( S R ( n ) − 1 / n 1 − 1 / n ) × 100 \mathcal{ONTA}(n)=\left(\frac{\mathcal{SR}(n)-1/n}{1-1/n}\right)\times 100 ONTA(n)=(1−1/nSR(n)−1/n)×100
其中 n 为物体数。完美选中为 100,随机猜测为 0,负值即"比随机还差"。没有这层校正,"候选变多→SR 下降"可能被误读为模型变笨,而实际上可能只是随机基线变低;ONTA 把"推理贡献"从"运气贡献"里剥出来。PS 则作用于长程维度,在 0--100 尺度上度量子任务完成进度:
公式(2):
P S = ( 1 N ∑ i = 1 N c i T ) × 100 \mathcal{PS}=\left(\frac{1}{N}\sum_{i=1}^{N}\frac{c_i}{T}\right)\times 100 PS=(N1i=1∑NTci)×100
其中 T 为子任务总数、c_i 为第 i 条 episode 完成的子任务数。SR 把"完成 90% 后失败"与"一步没动"都记 0,PS 把两者分开------这对"模型到底会不会做、卡在哪一步"的归因至关重要。加上任务脚本对每个动作/子任务完成状态的记录,RoboSPA 的评估粒度从"成败"细化到"病程"。
4.5 训练与评测协议:单任务全参微调、指令严格 disjoint
评测对象为四个代表 VLA:RDT、GO-1、π0.5、X-VLA,使用 Aloha-AgileX 本体干净场景数据训练与评估,单任务设置(每个基础任务训一个独立模型,用该任务全部五个难度的数据,再逐难度独立评测),每个任务变体 100 次 rollout。训练侧:每个难度 50 条轨迹(每基础任务 250 条);全部从官方预训练权重初始化、全参微调;统一 batch size 16、20,000 步;NVIDIA RTX PRO 6000 GPU。每个基础任务的算力预算见下表(原论文 Table 6),56 任务 × 4 模型合计约 1,568 GPU-hours------这个数字对"复现一份基准结果要多少钱"给出了直接答案。
| 模型 | 参数量 | GPU 数 | 训练时长 | GPU-hours |
|---|---|---|---|---|
| RDT | 1.2B | 1 | 2.5 h | 2.5 |
| GO-1 | 2.8B | 2 | 6 h | 12 |
| π0.5 | 3.3B | 2 | 6 h | 12 |
| X-VLA | 0.9B | 1 | 1.5 h | 1.5 |
五、实验与证据:退化剖面、机会校正与错误归因
5.1 主结果:L1→L5 全线下滑,MIP 在 L5 全员归零
下表(原论文 Table 2)报告四个模型在十个类别上 L1 与 L5 的 SR 及降幅:
| 任务 | RDT L1 | RDT L5 | 降幅 | GO-1 L1 | GO-1 L5 | 降幅 | π0.5 L1 | π0.5 L5 | 降幅 | X-VLA L1 | X-VLA L5 | 降幅 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 几何属性认知 | 10.0 | 4.8 | 5.2 | 27.8 | 11.5 | 16.3 | 42.8 | 12.5 | 30.3 | 57.8 | 25.3 | 32.5 |
| 空间距离估计 | 15.2 | 9.4 | 5.8 | 20.2 | 11.6 | 8.6 | 35.0 | 23.4 | 11.6 | 41.4 | 34.6 | 6.8 |
| 规范位置索引 | 15.0 | 8.6 | 6.4 | 22.0 | 7.2 | 14.8 | 44.0 | 23.6 | 20.4 | 31.8 | 8.8 | 23.0 |
| 参照关系推理 | 4.4 | 4.4 | 0.0 | 17.2 | 6.6 | 10.6 | 33.2 | 9.8 | 23.4 | 40.4 | 14.2 | 28.2 |
| 跨视角推理 | 3.0 | 3.4 | -0.4 | 17.4 | 16.2 | 1.2 | 41.2 | 37.6 | 3.6 | 38.2 | 36.6 | 1.6 |
| 空间维度平均 | 9.5 | 6.1 | 3.4 | 20.9 | 10.6 | 10.3 | 39.2 | 21.4 | 17.8 | 41.9 | 23.9 | 18.0 |
| 重复程序跟随 | 40.8 | 35.0 | 5.8 | 31.8 | 23.8 | 8.0 | 80.3 | 65.0 | 15.3 | 34.8 | 22.5 | 12.3 |
| 无序执行 | 20.3 | 0.8 | 19.5 | 41.1 | 5.6 | 35.5 | 85.8 | 26.1 | 59.7 | 86.0 | 43.6 | 42.4 |
| 有序执行 | 13.6 | 0.1 | 13.5 | 41.9 | 3.1 | 38.8 | 77.4 | 12.0 | 65.4 | 70.0 | 7.7 | 62.3 |
| 复合动作协调 | 27.5 | 2.4 | 25.1 | 24.2 | 2.6 | 21.6 | 58.6 | 12.5 | 46.1 | 58.9 | 5.9 | 53.0 |
| 记忆密集规划 | 18.2 | 0.0 | 18.2 | 7.6 | 0.0 | 7.6 | 54.0 | 0.0 | 54.0 | 44.6 | 0.0 | 44.6 |
| 长程维度平均 | 24.1 | 7.7 | 16.4 | 29.3 | 7.0 | 22.3 | 71.2 | 23.1 | 48.1 | 58.8 | 15.9 | 42.9 |
| 总体平均 | 16.8 | 6.9 | 9.9 | 25.1 | 8.8 | 16.3 | 55.2 | 22.3 | 32.9 | 50.4 | 19.9 | 30.5 |
三个读法。第一,最强者也不及格 :π0.5 总体 L1 55.2% 已是四模型最高,但 L5 只剩 22.3%,降幅 32.9 个百分点;X-VLA 50.4→19.9。第二,维度间不对称 :空间维度里 X-VLA 最好(41.9→23.9),长程维度里 π0.5 最好(71.2→23.1)------没有模型在两个维度同时领先,说明两种推理能力在当前架构中并未统一获得。第三,MIP 的 L5 是全表最刺眼的一行:四个模型成功率全部 0.0%,降幅 44--54 个百分点;配合 RPF 相对抗跌(π0.5 80.3→65.0),长程维度的瓶颈不在"重复"而在"记忆与顺序"。
下图把十个类别在五个难度上的 SR 趋势画成曲线,可以直观看到几乎所有曲线单调下行、且多数在 L3 之后加速下滑;再下一图则用雷达图对比 L1(左)与 L5(右)的类别剖面:L1 的雷达图尚有明显棱角与面积,L5 的雷达图整体向中心坍缩------"能力剖面"在难度上升时不是均匀缩小,而是连同形状一起塌掉。


5.2 诊断指标:空间推理"接近随机",长程执行"会做一半"
ONTA 的结果(原论文 Table 3)比 SR 更冷峻:RDT 与 GO-1 在多数类别与难度上为负值(如 RDT 在 RRR 的 L1 为 -91.2),即目标选择比随机猜还差------这通常意味着模型存在系统性偏置(例如总抓最近/最显眼的物体);π0.5 与 X-VLA 负值较少、平均 ONTA 更好(X-VLA 平均 L5 10.8),但整体仍贴着随机基线徘徊。换句话说,把"候选变多"的机会成分扣掉之后,当前 VLA 的细粒度空间推理剩余贡献非常有限。
| 任务 | RDT L1 | RDT L3 | RDT L5 | GO-1 L1 | GO-1 L3 | GO-1 L5 | π0.5 L1 | π0.5 L3 | π0.5 L5 | X-VLA L1 | X-VLA L3 | X-VLA L5 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 几何属性认知 | -80.0 | -25.0 | -14.3 | -44.5 | -7.0 | -6.2 | -14.5 | 1.3 | -5.0 | 15.5 | 11.0 | 10.3 |
| 空间距离估计 | -27.2 | -9.1 | -4.6 | -19.7 | -6.7 | -2.1 | 2.5 | 13.6 | 11.6 | 12.1 | 18.2 | 24.4 |
| 规范位置索引 | -27.5 | -4.9 | 0.3 | -17.0 | -3.3 | -1.2 | 16.0 | 10.2 | 16.7 | -2.3 | 2.2 | 0.5 |
| 参照关系推理 | -91.2 | -25.1 | -7.6 | -65.6 | -18.9 | -5.1 | -33.6 | 0.5 | -1.5 | -19.2 | 0.3 | 3.5 |
| 跨视角推理 | -45.5 | -28.8 | -28.8 | -23.9 | -14.7 | -11.7 | 11.8 | 16.0 | 16.8 | 7.3 | 17.3 | 15.5 |
| 平均 | -54.3 | -18.6 | -11.0 | -34.1 | -10.1 | -5.3 | -3.6 | 8.3 | 7.7 | 2.7 | 9.8 | 10.8 |
PS 的结果(原论文 Table 4)则给出长程维度的"病程":PS 普遍高于同格 SR,说明模型往往能完成程序的一部分,败于误差累积、顺序错误或后段执行不完整;π0.5 平均完成率最高(L1 71.2),X-VLA 次之,但 MIP 在高难度依旧疲软(π0.5 从 L1 54.0 跌到 L5 11.4)。"会做一半但收不了尾"与"空间上接近随机"合起来,构成了论文对现状的完整诊断:低层执行有部分能力,高层推理与记忆是短板。
| 任务 | RDT L1 | RDT L3 | RDT L5 | GO-1 L1 | GO-1 L3 | GO-1 L5 | π0.5 L1 | π0.5 L3 | π0.5 L5 | X-VLA L1 | X-VLA L3 | X-VLA L5 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 重复程序跟随 | 40.8 | 46.3 | 44.5 | 31.8 | 35.0 | 32.0 | 80.3 | 78.7 | 77.3 | 34.8 | 34.8 | 31.9 |
| 无序执行 | 20.3 | 33.0 | 24.9 | 41.1 | 39.7 | 25.7 | 85.8 | 75.0 | 62.1 | 86.0 | 84.4 | 73.9 |
| 有序执行 | 13.6 | 25.3 | 14.7 | 41.9 | 24.1 | 14.8 | 77.4 | 44.3 | 28.0 | 70.0 | 51.1 | 25.1 |
| 复合动作协调 | 27.5 | 32.5 | 26.5 | 24.2 | 26.2 | 22.7 | 58.6 | 60.5 | 48.0 | 58.9 | 49.0 | 40.1 |
| 记忆密集规划 | 18.2 | 5.0 | 3.6 | 7.6 | 4.9 | 6.0 | 54.0 | 18.7 | 11.4 | 44.6 | 12.2 | 7.3 |
| 平均 | 24.1 | 28.4 | 22.8 | 29.3 | 26.0 | 20.2 | 71.2 | 55.4 | 45.4 | 58.8 | 46.3 | 35.7 |
5.3 对照实验:基础 grounding 任务"太简单",反证难度设计的必要
论文另设三个基础 grounding 变体作为下界参照(颜色 grounding、自中心位置 grounding、简单序数索引),物体类别与候选数与对应 RoboSPA 任务对齐,只把线索换成"颜色/自中心位置/固定计数方向"这类浅线索。结果(原论文 Table 7)是三个变体在五个难度上都有 67.8--87.0% 的成功率、且几乎不随难度下滑------浅线索任务根本暴露不出当前 VLA 的推理缺陷。这一对照是全文方法论上最干净的一块证据:它说明 L1→L5 的下滑确实来自"推理负担"而非"任务复杂度"的笼统效应,也说明若基准停留在浅线索层,VLA 的空间能力会被系统性高估。
| 任务 | L1 | L2 | L3 | L4 | L5 |
|---|---|---|---|---|---|
| 颜色 grounding | 80.6 | 77.8 | 79.8 | 71.2 | 74.0 |
| 自中心位置 grounding | 67.8 | 69.4 | 74.8 | 72.2 | 72.4 |
| 简单序数索引 | 87.0 | 86.8 | 83.8 | 87.0 | 84.8 |
5.4 失败分析:空间败在"选错",长程败在"做坏、记忘、排错序"
论文定义六种失败模式:空间维度为目标执行错误(选对但抓失败)、无接触抓取错误(没碰到任何物体)、目标 grounding 错误(选错对象);长程维度复用 grounding 错误并另加操作错误(子任务低层执行失败)、记忆错误(未保留前步信息)、时序顺序错误(子任务顺序错)、冗余重复错误(重复已完成动作而不推进)。下图给出六类失败的代表性案例,可以看到不同类别任务的失败形态差异明显------这正是基准"区分度"的定性证据。

量化分布见下面两图(分别为 π0.5 与 X-VLA):空间维度上目标 grounding 错误占全部错误的 70% 以上 ,执行类错误次之、无接触抓取极少------即空间任务的瓶颈在"推理选目标"而非"手";其中 CPI 的 grounding 错误占比最高、CVR 的执行错误占比相对更大。长程维度上错误更多元:操作错误约占 50% ,其余四类大致均布;类别层面,RPF 以冗余重复错误为主(模型疑似只凭当前视觉观测决定下一步、缺乏进度跟踪),OFE/CAC 以操作错误为主,OCE 除操作错误外以时序顺序错误为主,MIP 以记忆错误为主------每类任务的 dominant 错误类型与其设计意图一一对应,说明能力分类学与错误分类学确实咬合,基准具备良好的任务区分度。


5.5 统计不确定性与跨本体一致性
为排除有限样本噪声,论文对 L5 平均成功率报告 bootstrap 95% 置信区间(原论文 Table 10):区间宽度约 ±1--1.6 个百分点,远小于模型间差距与 L1--L5 降幅,主结论在计入统计不确定性后不变。
| 模型 | 空间维度 L5 平均 | 长程维度 L5 平均 | 总体 L5 平均 |
|---|---|---|---|
| RDT | 6.1 5.2, 7.1 | 7.7 6.8, 8.5 | 6.9 6.3, 7.5 |
| GO-1 | 10.6 9.4, 11.8 | 7.0 6.2, 7.7 | 8.8 8.1, 9.5 |
| π0.5 | 21.4 19.8, 22.9 | 23.1 21.9, 24.3 | 22.3 21.3, 23.2 |
| X-VLA | 23.9 22.3, 25.5 | 15.9 14.8, 17.0 | 19.9 18.9, 20.8 |
跨本体侧,论文在五个本体上各选每类别一个代表任务、独立训练并评测 X-VLA(原论文 Table 11、12)。绝对性能随本体差异明显(如 UR5 普遍偏高、Franka 偏低),但每个任务×每个本体上 L5 都低于 L1------难度梯度不依赖特定本体成立;MIP-3 在全部五个本体上 L5 均为 0、L3 也仅 0--16,与主实验的记忆瓶颈结论互证。
| 本体 | GAC-1 L1/L3/L5 | SDE-5 L1/L3/L5 | CPI-4 L1/L3/L5 | RRR-3 L1/L3/L5 | CVR-4 L1/L3/L5 |
|---|---|---|---|---|---|
| Aloha-AgileX | 48/22/16 | 48/31/27 | 29/13/7 | 43/31/14 | 41/30/22 |
| ARX-X5 | 51/18/11 | 36/29/26 | 32/14/7 | 50/24/13 | 28/11/13 |
| Piper | 48/34/16 | 18/20/17 | 40/18/10 | 40/18/20 | 50/44/39 |
| Franka | 22/12/8 | 14/10/10 | 38/18/8 | 48/18/14 | 12/8/7 |
| UR5 | 74/43/25 | 52/41/34 | 67/35/26 | 58/45/38 | 59/55/49 |
| 本体 | RPF-1 L1/L3/L5 | OFE-1 L1/L3/L5 | OCE-5 L1/L3/L5 | CAC-6 L1/L3/L5 | MIP-3 L1/L3/L5 |
|---|---|---|---|---|---|
| Aloha-AgileX | 49/30/27 | 79/55/28 | 99/67/18 | 54/37/24 | 100/8/0 |
| ARX-X5 | 54/46/40 | 64/59/27 | 100/54/22 | 99/53/29 | 99/12/0 |
| Piper | 74/66/40 | 96/9/0 | 100/16/9 | 52/31/19 | 99/0/0 |
| Franka | 66/40/24 | 26/20/11 | 92/18/0 | 98/40/0 | 100/0/0 |
| UR5 | 83/58/49 | 99/24/5 | 93/33/17 | 100/51/48 | 100/16/0 |
六、这篇工作的边界与可复现性
论文自述三条局限:全部任务在仿真中构建,sim-to-real 缺口可能限制向真机的直接迁移;基准聚焦 tabletop 操作,未必覆盖真实环境的开放与多样;变形体操作、人机交互、开放式指令等更广设定尚未探索。在此之上,还有几点值得读者自行校准。其一,单任务微调协议意味着结果度量的是"模型在该任务上的可塑性"而非"通用策略零样本能力",两者都是有用口径,但不可混读;其二,主实验只用 Aloha-AgileX 干净场景数据,域随机轨迹与其余四本体数据在主结果中未消耗(跨本体实验仅 X-VLA、每类一任务),"527K 轨迹"的规模红利在主表里并未完全兑现;其三,指令模板由 GPT-5.2 生成后人工校验,语言多样性受模板族限制,"100 条 disjoint 评测指令"对语言泛化的覆盖仍属有限;其四,仿真 rollout 在同 checkpoint 同 seed 下基本确定,随机性主要来自场景/布局 seed,bootstrap CI 覆盖的是这一层,不覆盖模拟器本身的系统偏差。
可复现性方面这篇做得相对足:代码、数据、任务脚本以 MIT 许可发布;训练配置统一(batch 16、20k 步、官方预训练权重全参微调);算力账目公开(每任务 1.5--12 GPU-hours、合计约 1,568 GPU-hours);评测 100 trials/变体且指令 disjoint。对一个仿真基准而言,这已把"复现门槛"压到一台多卡工作站量级。
七、如果继续研究/落地,应该关注什么
对模型研究者,RoboSPA 的错误分布已经把改进方向写成清单:空间侧补 object-centric grounding 与关系感知(70%+ 的 grounding 错误是最大单点收益),长程侧补进度跟踪、执行监控与记忆机制(RPF 的冗余重复、OCE 的时序错误、MIP 的记忆错误各自对应明确机制缺位)。对基准研究者,三个可扩展面已经 visible:把域随机轨迹纳入主评测轴(目前只作为数据存在)、把跨本体从"每类一任务"扩到全任务、以及引入真机子集校准 sim-to-real。对工程落地者,最实用的读法是"用 ONTA/PS 做模型选型尺":在候选物体多的拣选场景,SR 会系统性高估能力,ONTA 才反映真实 grounding 水平;在多步作业场景,PS 与 SR 的差值提示"失败前完成了多少",直接决定人工接管的成本。
八、术语与概念速查
| 类别 | 术语 | 一句话定位 |
|---|---|---|
| 基线模型 | RDT | 1.2B 扩散式 VLA 基线,本基准上整体最弱(L5 6.9%) |
| 基线模型 | GO-1 | 智元 2.8B 分层 VLA 基线,长程略好于空间 |
| 基线模型 | π0.5 | Physical Intelligence 3.3B 开放世界 VLA,本基准总体最强(L5 22.3%) |
| 基线模型 | X-VLA | 0.9B 跨本体 VLA,空间维度最强、长程记忆弱 |
| 仿真设施 | SAPIEN | 物理仿真平台,RoboSPA 全部任务的构建环境(Apache 2.0) |
| 仿真设施 | RoboTwin 2.0 | 双臂仿真数据生成器/基准,RoboSPA 复用其框架与部分动作原语、资产 |
| 任务类别 | GAC/SDE/CPI/RRR/CVR | 空间维度五类:几何属性/距离估计/规范索引/参照关系/跨视角 |
| 任务类别 | RPF/OFE/OCE/CAC/MIP | 长程维度五类:重复跟随/无序执行/有序执行/复合协调/记忆密集 |
| 评测概念 | bootstrap 95% CI | 对 L5 均值的有限样本不确定度量化,区间 ±1--1.6 个百分点 |
| 评测概念 | 单任务设置 | 每基础任务独立微调一个模型、逐难度评测,度量任务可塑性而非零样本通用性 |
| 场景概念 | 域随机化 | 背景/clutter/桌高/光照四类扰动,任务语义不变,用于量场景鲁棒性 |
| 场景概念 | sim-to-real gap | 仿真到真机的迁移缺口,本文全部结论的首要适用边界 |
| 数据概念 | 指令模板 disjoint | 训练 50/评测 10 模板不相交,阻断背指令捷径 |
九、拓展思考:值得继续扩展研究与思考的创新点
RoboSPA 把"基准即诊断仪器"这件事做成了范式,也留下若干可生长的接口。第一,难度刻度的理论化 :L1--L5 目前是任务特异的手工刻度(加物体/加步骤),若能把"推理负担"形式化(如候选熵、程序深度、记忆负载),难度轴就能跨任务可比、甚至可外推预测 L6+ 的表现------这是把基准从"量表"升级为"标度律"的机会。第二,ONTA 思想的推广 :机会校正在空间维度极有效,同样的"扣除基线"思路可以搬到长程维度(例如以"贪心只完成易子任务"为基线校正 PS),使两个维度的诊断尺同构。第三,记忆瓶颈的机制研究 :MIP 在 L5 全员 0% 是全文最硬的负结果,它指向的不是"再多数据"而是架构问题------显式记忆模块、状态跟踪头、或分层 planner 与 VLA 的耦合,都可以在 MIP 上做受控对照,MIP 有望成为"具身记忆"的标准试金石。第四,从诊断到训练的闭环 :RoboSPA 的错误类型标注与步骤级记录天然是课程学习与失败挖掘的原料,按 dominant 错误类型加权采样训练、或把 PS 作为密集奖励做 RL 微调,是基准数据反哺模型的直接路径。第五,语言与视角的再随机化 :指令由模板族实例化、视角固定于本体相机,若叠加开放式指令改写与第三人称/手持相机输入,基准可以进一步逼近"人在现场随口指挥"的真实分布。回到标题之问------VLA 能否走出简单场景与短horizon任务?RoboSPA 给出的答案是:在当前架构与训练范式下,走出得有限且可测量 ;而它真正的长期价值,是为"下一代模型是否真的走出去了"提供了一把带刻度、可归因、可复测的尺子。
最硬的负结果,它指向的不是"再多数据"而是架构问题------显式记忆模块、状态跟踪头、或分层 planner 与 VLA 的耦合,都可以在 MIP 上做受控对照,MIP 有望成为"具身记忆"的标准试金石。第四,从诊断到训练的闭环 :RoboSPA 的错误类型标注与步骤级记录天然是课程学习与失败挖掘的原料,按 dominant 错误类型加权采样训练、或把 PS 作为密集奖励做 RL 微调,是基准数据反哺模型的直接路径。第五,语言与视角的再随机化 :指令由模板族实例化、视角固定于本体相机,若叠加开放式指令改写与第三人称/手持相机输入,基准可以进一步逼近"人在现场随口指挥"的真实分布。回到标题之问------VLA 能否走出简单场景与短horizon任务?RoboSPA 给出的答案是:在当前架构与训练范式下,走出得有限且可测量;而它真正的长期价值,是为"下一代模型是否真的走出去了"提供了一把带刻度、可归因、可复测的尺子。