【论文解读】 一篇读懂VLA具身推理诊断基准RoboSPA:从细粒度空间消歧到长程程序规划,五级难度把VLA量到“不如随机猜“

写在前面:

社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~

AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。


论文:RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?(Zhejiang University / University of Electronic Science and Technology of China / South China Normal University,EMNLP 2026)

发布时间:2026 年 9 月 4 日(arXiv v1)

作者:Zhenxuan Fan、Bo Zhang、Yutong Lin、Yuqian Yuan、Juekai Lin、Liang Liang、Zhuoyi Huang、Wenqiao Zhang、Juncheng Li、Siliang Tang、Jun Xiao、Yueting Zhuang(共 12 人)

核心一句话:RoboSPA 用 2 维度 10 类别、56 个基础任务 × 5 级难度实例化出 280 个变体、采集 527K 条轨迹;四个代表 VLA 模型在最难档 L5 的平均成功率全部 ≤25%(最强的 π0.5 仅 22.3%),机会校正指标 ONTA 显示多数模型的细粒度空间目标选择接近甚至低于随机猜测,而记忆密集型规划在 L5 的成功率对所有模型都是 0。

核心关键词

  • RoboSPA(Robot Spatial-Procedural Assessment):面向"具身推理诊断"的大规模机器人操作数据集与基准,模拟环境构建、多本体、多难度、带步骤级诊断。
  • 细粒度空间推理(Fine-Grained Spatial Reasoning):靠几何属性、距离、行列索引、参照关系、跨视角等细微空间线索(而非类别/颜色)锁定目标的能力。
  • 长程程序规划(Long-Horizon Procedural Planning):重复执行、无序/有序完成多子目标、复合动作协调、记忆密集规划等跨多步决策的能力。
  • 五级难度实例化(L1--L5):每个基础任务按"候选物体增多"或"动作序列变长"实例化为 5 个变体,用来画性能退化曲线而非单点分数。
  • ONTA(Object-Normalized Target Accuracy):借鉴 Cohen's kappa 的机会校正指标,扣掉"物体数带来的随机基线",0 分即等于随机猜。
  • PS(Progress Score):长程任务的子任务完成进度分,区分"完全失败"与"完成了一半才失败"。
  • 步骤级评估(step-level evaluation):记录 rollout 中每个动作/子任务的完成状态,使失败可归因而非只有一个二元成败。

带着问题阅读

  1. 现有操作基准都在量"任务做没做成",RoboSPA 为什么说这不够?它要诊断的"推理"具体指什么?
  2. 五级难度是随意加的刻度,还是有控制的推理负担递增?空间任务与长程任务的"加难"方式有何不同?
  3. ONTA 为什么要做机会校正?不做的话,"候选物体变多导致成功率下降"会被误读成什么?
  4. 四个 VLA 模型在 L5 全线下滑,失败到底卡在"选错目标"还是"手不行"?错误类型分布给出了怎样的答案?
  5. 一个全仿真的 tabletop 基准,结论对真机与开放世界还成立吗?论文的边界在哪里?

一、核心导读

VLA 模型这两年的成绩单有一个共同底色:在结构化、短horizon、场景干净的任务上表现可喜。RT-1/RT-2/OpenVLA 把动作预测做成token生成,RDT/π0 系换上扩散或 flow-matching 连续动作头,π0.5/GR00T N1 用分层策略 bridging 高层语言与低层电机,再往后是跨本体数据与空间引导、记忆机制、未来帧预测各路增强。但把这些成绩放进日常操作场景就会露馅:桌上一堆相似杯子时"把左边第二个拿给我"靠的不是类别识别而是空间推理;"把三个瓶子收进垃圾桶再按顺序盖章"靠的不是单步反射而是程序性规划与记忆。

RoboSPA 的问题意识正在于此:现有数据集与基准主要在"预定义设置下任务是否完成"这一层做评估,对"空间与程序复杂度递增时模型如何推理、在哪里退化"几乎没有诊断力。它的回应是一套三原则设计------把细粒度空间推理与长程程序规划立为两个核心维度、把多级难度与步骤级诊断立为评估骨架、把规模(527K 轨迹、5 本体、干净+域随机场景)立为覆盖保障。

读这篇论文建议抓住一条主线:"退化曲线比单点分数更有信息"。RoboSPA 的每个结论都建立在 L1→L5 的下降斜率、ONTA 相对随机基线的位置、PS 与 SR 的差值这三条"差值证据"上:最强模型 π0.5 总体从 L1 的 55.2% 跌到 L5 的 22.3%;空间维度上多数模型的 ONTA 为负(比随机猜还差);长程维度上 PS 普遍高于 SR(说明模型"会做一半"但收不了尾),而记忆密集型规划 MIP 在 L5 的成功率对所有模型都是 0。这三组差值合起来,把"VLA 还不会推理"从印象变成了可复测的测量。

二、问题背景:VLA 评测停在"做没做成",而部署需要"为什么失败"

2.1 真实操作的三个挑战与基准的缺位

论文把日常操作对 VLA 的要求拆成三条:其一,细粒度目标消歧 ------在视觉相似候选中靠细微空间线索(而非类别或颜色)认出目标;其二,时间延展的执行 ------多步决策、时序约束、误差累积下的持续执行;其三,复杂度可扩展的具身推理------候选数、horizon、环境多样性上升时 grounding 与规划不应崩塌。这三条恰好对应"推理"的三个侧面:选对、做完、扛得住变难。

而现有基准在这三面上的供给是稀薄的。论文在引言中点了四类缺口:细粒度空间推理很少被显式评估;长程与步骤级评估有限(LIBERO、RoboTwin 2.0 偏短horizon,RoboCasa、MIKASA-Robo 缺步骤级诊断);多数工作缺乏受控的多级难度,难以分析"随复杂度上升的退化";以及规模不足------主流数据集多在 200K 轨迹以下,限制了任务、本体与场景的覆盖面。

2.2 与 15 个数据集/基准的逐维对照

下表是论文的定位表(原论文 Table 1),上半为数据集、下半为基准,最后三列加"多难度"与"场景多样性"共五个能力列。可以清楚看到:没有任何一个先前工作同时在"空间推理、长程任务、步骤级评估、多难度、场景多样性"五列全打勾,而 RoboSPA 是唯一五行全 √ 的条目;规模上 527K 轨迹也仅次于聚合型的 Open X-Embodiment(1.4M)。

名称 类别数 任务数 轨迹数 本体数 空间推理 长程任务 步骤级评估 多难度 场景多样性
BC-Z 3 100+ 26K 1
RT-1 8 700+ 130K 1
BridgeData V2 - 13 60.1K 1
Open X-Embodiment 527 160,266 1.4M 22
DROID - 86 76K 1
RLBench - 100 - 1
CALVIN - 34 N/A† 1
LIBERO 4 130 6.5K 1
ManiSkill2 4 20 N/A‡ 1
RoboCasa - 100 ~100K 1
SimplerEnv - 8 - 2
MIKASA-Robo 12 32 32K 1
RoboTwin 2.0 - 50 ≤137.5K 5
LIBERO-Pro 4 40 - 1
RMBench 2 9 450 1
RoboSPA(本文) 10 280 527K 5

† CALVIN 以约 24 小时遥操作演示计;‡ ManiSkill2 以超过 4M 演示帧计。

需要提醒的是,这类对照表天然是"作者选择维度"的产物:五列全 √ 说明覆盖广,但不自动等于"更难"或"更好"------难度与诊断力要靠后文的退化曲线与错误分析来证明。论文自己也把证据重心放在实验而非这张表上。

2.3 两条相关研究线的交汇点

相关工作分两条线。VLA 模型线:从 RT-1/RT-2/OpenVLA 的离散 token 自回归,到 RDT/π0 的扩散与 flow-matching 连续动作,到 π0.5/GR00T N1 的分层策略与跨任务泛化,再到 AgiBot World/X-VLA 的隐式动作建模与跨本体数据,以及空间引导、记忆机制、未来帧预测等增强路线。数据集与基准线:BridgeData V2/Open X-Embodiment/DROID/AgiBot World 扩真实世界跨本体覆盖;RLBench/CALVIN/ManiSkill2/LIBERO 提供结构化技能与语言条件控制评测;新近基准进一步考察场景与能力泛化、sim-to-real、双臂与记忆依赖任务。论文的判断是:这两条线的交汇处------"以空间推理与长程规划为核心、带步骤级诊断的系统评测"------仍是空白,RoboSPA 就填在这里。

三、核心思路:把"推理负担"做成可控变量

RoboSPA 的总览如下图所示:以细粒度空间推理与长程程序规划为两个核心维度,覆盖 10 个任务类别、56 个基础任务;每个任务 5 个难度级别,共 280 个变体;527K 条轨迹、跨多本体与多场景设置,支持对空间推理、长程执行与可扩展具身推理的步骤级评估。

如图所示,这张总览图的信息密度集中在"三个乘法"上:10 类别 × 5 难度 = 280 变体(难度是设计变量而非事后标签);5 本体 × 干净/域随机两类场景(覆盖是设计变量);任务级成败 × 步骤级进度(诊断粒度是设计变量)。论文用 SAPIEN 模拟器与 RoboTwin 2.0 框架搭建全部任务,任务由专家代码定义场景、执行程序与成功条件,并复用 RoboTwin 2.0 的部分动作原语;10 名受训研究生每人负责一个能力类别设计任务,每个任务再经另外两人评审------把"基准质量"也流程化了。

这套设计背后有一个方法论主张:基准的价值不在"给出一个分数",而在"给出一个可归因的退化剖面"。因此 RoboSPA 的每个组件都服务于归因:难度分级分离"推理负担"与"模型能力",ONTA 分离"空间推理"与"随机基线",PS 分离"部分完成"与"彻底失败",错误类型分布分离"选错目标"与"执行失败"。理解了这一点,后文所有图表都是同一主张的不同切面。

四、方法展开:基准如何被造出来

4.1 能力分类学:两个维度、十个类别

RoboSPA 不把操作任务当孤立实例,而是建了一棵层级能力分类学,如下图所示:图上半为两维度十类别的分类树,图中半为"增加物体数或动作序列长度"的多难度任务设计,图下半为涵盖布局、干扰物、光照、纹理、桌面的域随机场景。

细粒度空间推理维度考察"在复杂空间配置中把指令 grounding 到正确目标",含五个类别:几何属性认知(GAC,按尺寸/高度/长度/底面积等几何属性而非类别识别物体)、空间距离估计(SDE,比较物体间或到参照物的远近)、规范位置索引(CPI,在不同计数方向与扫描顺序下按行列索引定位)、参照关系推理(RRR,按相对参照物的方向关系定位,含组合位置)、跨视角推理(CVR,从非自中心视角解读空间指令并完成视角变换)。论文称其为"首个把细粒度空间推理立为核心评估维度的 VLA 数据集"。

长程程序规划维度考察"跨多步决策完成延展操作",同样五个类别:重复程序跟随(RPF,重复指定操作指定次数并正确停止)、无序执行(OFE,灵活顺序完成多子目标、不漏不重)、有序执行(OCE,按指定顺序完成------顺序错即失败)、复合动作协调(CAC,跨阶段协调异构操作技能)、记忆密集规划(MIP,线索被遮蔽或需回忆时保留信息并指导后续动作)。

4.2 任务套件与五级难度:把推理负担做成刻度

任务套件的全量清单见下面两张表(原论文 Table 8、Table 9):空间维度 24 个基础任务、长程维度 32 个基础任务(含 MIP 5 个),合计 56 个。难度实例化的规则是维度特异的:空间任务加候选物体数,长程任务加程序步数------这保证"L5 更难"难在推理负担上,而不是难在视觉外观上。指令侧,每个任务用 GPT-5.2 生成 60 个语义受控、互不重叠的指令模板,50 个用于训练、10 个用于测试,再实例化为 100 条训练指令与 100 条不相交的评测指令------训练/评测指令严格 disjoint,堵住"背指令"的捷径。

类别 任务名 任务描述
GAC Pick Blocks Size 按尺寸从多个方块中取目标方块
GAC Pick Blocks Height 按高度从多个方块中取目标方块
GAC Pick Blocks Length 按长度从多个方块中取目标方块
GAC Pick Blocks Area 按底面积从多个方块中取目标方块
SDE Pick Blocks Distance 结合颜色与相对距离线索从多个方块中取目标
SDE Pick Mugs Distance 结合颜色与相对距离线索从多个马克杯中取目标
SDE Pick Pill Bottles Distance 结合颜色与相对距离线索从多个药瓶中取目标
SDE Pick Mixed Objects Distance A 在混合物体集 A 中按颜色与相对距离取目标
SDE Pick Mixed Objects Distance B 在混合物体集 B 中按颜色与相对距离取目标
CPI Pick Blocks Canonical 按方块在序列中的序位取目标
CPI Pick Cups Canonical 按杯子在序列中的序位取目标
CPI Pick Rubik Cubes Canonical 按魔方在序列中的序位取目标
CPI Pick Mixed Objects Canonical A 在混合物体集 A 中按序位取目标
CPI Pick Mixed Objects Canonical B 在混合物体集 B 中按序位取目标
RRR Pick Tea Box Relational 按相对另一参照茶盒的位置取目标茶盒
RRR Pick Cans Relational 按相对另一参照罐的位置取目标罐
RRR Pick Soaps Relational 按相对另一参照肥皂的位置取目标肥皂
RRR Pick Mixed Objects Relational A 在混合场景中按参照物体取目标
RRR Pick Mixed Objects Relational B 在混合场景中按参照物体取目标
CVR Pick Sauce Can Multi View 在给定视角下按绝对位置取目标酱罐
CVR Pick Seals Multi View 在给定视角下按绝对位置取目标印章
CVR Pick Breads Multi View 在给定视角下按绝对位置取目标面包
CVR Pick Mixed Objects Multi View A 在给定视角下从混合组 A 取目标
CVR Pick Mixed Objects Multi View B 在给定视角下从混合组 B 取目标
类别 任务名 任务描述
RPF Press Stapler Repeat 重复按压订书机
RPF Lift Pot Repeat 反复拿起并放下锅
RPF Lift Fan Repeat 反复拿起风扇
RPF Click Bell Repeat 反复点击铃铛
OFE Put Bottles Dustbin 无固定顺序把多个瓶子放入垃圾桶
OFE Move Blocks Apart 无固定顺序把多个方块移开
OFE Move Playing Cards Away 无固定顺序移走多张扑克牌
OFE Place Bowls Plates 无固定顺序把多个碗放到盘子上
OFE Separate Fries Bread 把薯条与面包分到不同区域
OFE Rank Blocks Height 按高度排列方块,中间顺序灵活
OFE Rank Blocks Color 按颜色排列方块,中间顺序灵活
OFE Rank Blocks Size 按尺寸排列方块,中间顺序灵活
OCE Hit Blocks Hammer Order 按指定颜色顺序用锤敲击方块
OCE Click Objects Order 按指定顺序点击多个目标
OCE Stamp Seals Order 按指定顺序盖章
OCE Click Bell Clockwise Order 先点铃再按顺时针序列执行
OCE Stack Blocks Color Order 按指定颜色顺序堆叠方块
OCE Stack Blocks Size Order 按指定尺寸顺序堆叠方块
OCE Stack Blocks Length Order 按指定长度顺序堆叠方块
CAC Place Phone Press Stapler 放手机、重复按压、倾倒的复合操作
CAC Place Bottle Cup 扔瓶入桶、放杯于杯垫的复合操作
CAC Hang Mug Stack Blocks 挂杯上架、自底向上堆方块的复合操作
CAC Place Object Scale Click 放置、按压、归位的复合操作
CAC Place Burger Fries Click Bell 放汉堡薯条于托盘、点铃、归位的复合操作
CAC Click Can Place Items 点罐与放面包/药瓶交错的复合操作
CAC Stamp Seals Press Stapler 左右印章各盖两次并按订书机的复合操作
CAC Click Bell Open Microwave Place Object 点铃、开微波炉、相对放置交错的复合操作
MIP Observe Blocks Move Memory 先记住展示方块颜色,遮蔽后移动桌上同色方块
MIP Observe Objects Click Memory 先记住展示台物体顺序,遮蔽后按序点击桌上物体
MIP Remember Color Cover 先记住方块颜色,被遮盖后按色序揭开
MIP Remember Orientation Restore 先记住前排 T 块朝向,遮蔽后调整后排 T 块匹配
MIP Press Stapler Memory 记住每个订书机应按次数后再按

下面三组图给出空间维度最难档(L5)的任务可视化,每行展示代表性 rollout 帧、任务类别、任务名与指令,可以直接看到"候选物体堆满桌面、线索只剩几何/距离/序位/关系/视角"时任务长什么样。

如图所示,空间任务的"难"不来自视觉渲染复杂度,而来自消歧线索的稀薄化:候选越多、线索越细微(底面积、序位方向、参照关系、他人视角),"看一眼就知道拿哪个"的捷径越不存在。这正是 ONTA 机会校正要度量的东西(见 4.4)。

紧接着七组图是长程维度 L5 的任务可视化,覆盖 RPF/OFE/OCE/CAC/MIP 全部五类:从"重复按订书机并按次数停止",到"无序收瓶子",到"按色序敲击/堆叠",到"点铃---开微波炉---相对放置交错",再到"先看后遮、凭记忆操作"。

对比上面两组画廊可以看出设计上的对称性:空间组加难靠"桌上东西变多",长程组加难靠"流程变长、约束变硬、线索被遮"。MIP 一类尤其苛刻------信息只在开头出现一次,之后被物理遮蔽,模型没有任何"再看一眼"的机会;后文 L5 全员 0% 的结果,在这组图里已经埋下伏笔。

4.3 场景、本体与数据规模:覆盖也是设计变量

数据采集在干净与域随机两类场景中进行:干净场景只含任务相关物体;域随机场景(如下图所示)在背景外观、桌面 clutter、桌高、光照四个方面扰动,任务语义与成功条件不变------于是同一模型可以分别被量"任务能力"与"场景鲁棒性"。

本体侧支持五种机械臂/双臂平台,如下图所示,从左到右为 Aloha-AgileX、ARX-X5、Piper、Franka、UR5:它们共享任务语义、语言指令、物体配置与成功条件,只在形态、工作空间、相机视角与执行行为上不同,用于检验模型是否超出单一本体。

规模与分布如下图所示:图左一为五条本体的轨迹分布,左二为干净/域随机场景的轨迹分布,右二为空间任务各难度的平均物体数(随难度单调上升),右一为长程任务各难度的平均轨迹长度(随难度单调上升)------后两幅子图是"难度刻度确实加在推理负担上"的直接证据。

总量上:56 基础任务 × 5 难度 = 280 变体,约 527K 条轨迹、997+ 小时交互视频、108M timesteps;物体资产来自 RoboTwin-OD 与 RMBench 资产库,共 120 个物体类别、581 个变体,完整清单见下表(原论文 Table 5)。

资产 变体数 资产 变体数 资产 变体数 资产 变体数
bottle 27 olive-oil 5 pencup 7 globe 2
bowl 7 drill 7 kitchenpot 7 trophy 5
cover 1 jam-jar 5 battery 6 notebook 3
plate 1 screwdriver 1 plasticbox 11 brush-pen 6
fluted-block 2 fork 1 tabletrashbin 11 rest 4
french-fries 4 knife 1 msg 6 glue 6
hamburg 6 apple 2 soy-sauce 5 cleaner 4
T_block 2 cabinet 1 vinegar 3 screen 4
shoe-box 1 box 1 steamer 3 speaker 6
tray 4 milk-box 4 boxdrink 4 fan 7
kettle 9 mug 13 vagetable 7 seal 6
pen 7 rack 1 paymentsign 4 milk-tea 6
dustbin 1 shoe 10 can 6 roller 3
plant-pot 5 wooden_box 1 electronicscale 5 fruit 7
dumbbell-rack 4 book 2 rubikscube 3 board 5
bookcase 4 microwave 2 displaystand 5 sauce-can 5
laptop 11 sand-clock 3 bread 7 skillet 4
oven 4 alarm-clock 6 breadbasket 5 soap 4
calculator 6 mouse 3 phone 5 block 7
microphone 4 stapler 7 phonestand 7 hydrating-oil 4
coaster 1 shampoo 7 remotecontrol 7 basket 4
hammer 1 bell 2 pillbottle 5 callbell 6
cup 13 candlestick 5 playingcards 3 tea-box 6
cup-with-liquid 1 dumbbell 7 smallshovel 4 coffee-box 7
tissue-box 7 teanet 5 brush 4 perfume 4
scanner 5 baguette 2 woodenmallet 5 keyboard 4
chips-tub 4 small-speaker 3 gong 6 whiteboard-eraser 1
pet-collar 4 switch 8 woodenblock 5 tooth-paste 1
table-tennis 2 toycar 6 waterer 8 mini-chalkboard 1
roll-paper 4 markpen 6 wineglass 5 plant 1

4.4 评估指标:SR 之外补两把"归因尺"

成功率(SR)之外,RoboSPA 为两个维度各配一个诊断指标。ONTA 借鉴 Cohen's kappa 的机会校正思想,扣除物体数带来的随机基线:

公式(1):

O N T A ( n ) = ( S R ( n ) − 1 / n 1 − 1 / n ) × 100 \mathcal{ONTA}(n)=\left(\frac{\mathcal{SR}(n)-1/n}{1-1/n}\right)\times 100 ONTA(n)=(1−1/nSR(n)−1/n)×100

其中 n 为物体数。完美选中为 100,随机猜测为 0,负值即"比随机还差"。没有这层校正,"候选变多→SR 下降"可能被误读为模型变笨,而实际上可能只是随机基线变低;ONTA 把"推理贡献"从"运气贡献"里剥出来。PS 则作用于长程维度,在 0--100 尺度上度量子任务完成进度:

公式(2):

P S = ( 1 N ∑ i = 1 N c i T ) × 100 \mathcal{PS}=\left(\frac{1}{N}\sum_{i=1}^{N}\frac{c_i}{T}\right)\times 100 PS=(N1i=1∑NTci)×100

其中 T 为子任务总数、c_i 为第 i 条 episode 完成的子任务数。SR 把"完成 90% 后失败"与"一步没动"都记 0,PS 把两者分开------这对"模型到底会不会做、卡在哪一步"的归因至关重要。加上任务脚本对每个动作/子任务完成状态的记录,RoboSPA 的评估粒度从"成败"细化到"病程"。

4.5 训练与评测协议:单任务全参微调、指令严格 disjoint

评测对象为四个代表 VLA:RDT、GO-1、π0.5、X-VLA,使用 Aloha-AgileX 本体干净场景数据训练与评估,单任务设置(每个基础任务训一个独立模型,用该任务全部五个难度的数据,再逐难度独立评测),每个任务变体 100 次 rollout。训练侧:每个难度 50 条轨迹(每基础任务 250 条);全部从官方预训练权重初始化、全参微调;统一 batch size 16、20,000 步;NVIDIA RTX PRO 6000 GPU。每个基础任务的算力预算见下表(原论文 Table 6),56 任务 × 4 模型合计约 1,568 GPU-hours------这个数字对"复现一份基准结果要多少钱"给出了直接答案。

模型 参数量 GPU 数 训练时长 GPU-hours
RDT 1.2B 1 2.5 h 2.5
GO-1 2.8B 2 6 h 12
π0.5 3.3B 2 6 h 12
X-VLA 0.9B 1 1.5 h 1.5

五、实验与证据:退化剖面、机会校正与错误归因

5.1 主结果:L1→L5 全线下滑,MIP 在 L5 全员归零

下表(原论文 Table 2)报告四个模型在十个类别上 L1 与 L5 的 SR 及降幅:

任务 RDT L1 RDT L5 降幅 GO-1 L1 GO-1 L5 降幅 π0.5 L1 π0.5 L5 降幅 X-VLA L1 X-VLA L5 降幅
几何属性认知 10.0 4.8 5.2 27.8 11.5 16.3 42.8 12.5 30.3 57.8 25.3 32.5
空间距离估计 15.2 9.4 5.8 20.2 11.6 8.6 35.0 23.4 11.6 41.4 34.6 6.8
规范位置索引 15.0 8.6 6.4 22.0 7.2 14.8 44.0 23.6 20.4 31.8 8.8 23.0
参照关系推理 4.4 4.4 0.0 17.2 6.6 10.6 33.2 9.8 23.4 40.4 14.2 28.2
跨视角推理 3.0 3.4 -0.4 17.4 16.2 1.2 41.2 37.6 3.6 38.2 36.6 1.6
空间维度平均 9.5 6.1 3.4 20.9 10.6 10.3 39.2 21.4 17.8 41.9 23.9 18.0
重复程序跟随 40.8 35.0 5.8 31.8 23.8 8.0 80.3 65.0 15.3 34.8 22.5 12.3
无序执行 20.3 0.8 19.5 41.1 5.6 35.5 85.8 26.1 59.7 86.0 43.6 42.4
有序执行 13.6 0.1 13.5 41.9 3.1 38.8 77.4 12.0 65.4 70.0 7.7 62.3
复合动作协调 27.5 2.4 25.1 24.2 2.6 21.6 58.6 12.5 46.1 58.9 5.9 53.0
记忆密集规划 18.2 0.0 18.2 7.6 0.0 7.6 54.0 0.0 54.0 44.6 0.0 44.6
长程维度平均 24.1 7.7 16.4 29.3 7.0 22.3 71.2 23.1 48.1 58.8 15.9 42.9
总体平均 16.8 6.9 9.9 25.1 8.8 16.3 55.2 22.3 32.9 50.4 19.9 30.5

三个读法。第一,最强者也不及格 :π0.5 总体 L1 55.2% 已是四模型最高,但 L5 只剩 22.3%,降幅 32.9 个百分点;X-VLA 50.4→19.9。第二,维度间不对称 :空间维度里 X-VLA 最好(41.9→23.9),长程维度里 π0.5 最好(71.2→23.1)------没有模型在两个维度同时领先,说明两种推理能力在当前架构中并未统一获得。第三,MIP 的 L5 是全表最刺眼的一行:四个模型成功率全部 0.0%,降幅 44--54 个百分点;配合 RPF 相对抗跌(π0.5 80.3→65.0),长程维度的瓶颈不在"重复"而在"记忆与顺序"。

下图把十个类别在五个难度上的 SR 趋势画成曲线,可以直观看到几乎所有曲线单调下行、且多数在 L3 之后加速下滑;再下一图则用雷达图对比 L1(左)与 L5(右)的类别剖面:L1 的雷达图尚有明显棱角与面积,L5 的雷达图整体向中心坍缩------"能力剖面"在难度上升时不是均匀缩小,而是连同形状一起塌掉。

5.2 诊断指标:空间推理"接近随机",长程执行"会做一半"

ONTA 的结果(原论文 Table 3)比 SR 更冷峻:RDT 与 GO-1 在多数类别与难度上为负值(如 RDT 在 RRR 的 L1 为 -91.2),即目标选择比随机猜还差------这通常意味着模型存在系统性偏置(例如总抓最近/最显眼的物体);π0.5 与 X-VLA 负值较少、平均 ONTA 更好(X-VLA 平均 L5 10.8),但整体仍贴着随机基线徘徊。换句话说,把"候选变多"的机会成分扣掉之后,当前 VLA 的细粒度空间推理剩余贡献非常有限。

任务 RDT L1 RDT L3 RDT L5 GO-1 L1 GO-1 L3 GO-1 L5 π0.5 L1 π0.5 L3 π0.5 L5 X-VLA L1 X-VLA L3 X-VLA L5
几何属性认知 -80.0 -25.0 -14.3 -44.5 -7.0 -6.2 -14.5 1.3 -5.0 15.5 11.0 10.3
空间距离估计 -27.2 -9.1 -4.6 -19.7 -6.7 -2.1 2.5 13.6 11.6 12.1 18.2 24.4
规范位置索引 -27.5 -4.9 0.3 -17.0 -3.3 -1.2 16.0 10.2 16.7 -2.3 2.2 0.5
参照关系推理 -91.2 -25.1 -7.6 -65.6 -18.9 -5.1 -33.6 0.5 -1.5 -19.2 0.3 3.5
跨视角推理 -45.5 -28.8 -28.8 -23.9 -14.7 -11.7 11.8 16.0 16.8 7.3 17.3 15.5
平均 -54.3 -18.6 -11.0 -34.1 -10.1 -5.3 -3.6 8.3 7.7 2.7 9.8 10.8

PS 的结果(原论文 Table 4)则给出长程维度的"病程":PS 普遍高于同格 SR,说明模型往往能完成程序的一部分,败于误差累积、顺序错误或后段执行不完整;π0.5 平均完成率最高(L1 71.2),X-VLA 次之,但 MIP 在高难度依旧疲软(π0.5 从 L1 54.0 跌到 L5 11.4)。"会做一半但收不了尾"与"空间上接近随机"合起来,构成了论文对现状的完整诊断:低层执行有部分能力,高层推理与记忆是短板

任务 RDT L1 RDT L3 RDT L5 GO-1 L1 GO-1 L3 GO-1 L5 π0.5 L1 π0.5 L3 π0.5 L5 X-VLA L1 X-VLA L3 X-VLA L5
重复程序跟随 40.8 46.3 44.5 31.8 35.0 32.0 80.3 78.7 77.3 34.8 34.8 31.9
无序执行 20.3 33.0 24.9 41.1 39.7 25.7 85.8 75.0 62.1 86.0 84.4 73.9
有序执行 13.6 25.3 14.7 41.9 24.1 14.8 77.4 44.3 28.0 70.0 51.1 25.1
复合动作协调 27.5 32.5 26.5 24.2 26.2 22.7 58.6 60.5 48.0 58.9 49.0 40.1
记忆密集规划 18.2 5.0 3.6 7.6 4.9 6.0 54.0 18.7 11.4 44.6 12.2 7.3
平均 24.1 28.4 22.8 29.3 26.0 20.2 71.2 55.4 45.4 58.8 46.3 35.7

5.3 对照实验:基础 grounding 任务"太简单",反证难度设计的必要

论文另设三个基础 grounding 变体作为下界参照(颜色 grounding、自中心位置 grounding、简单序数索引),物体类别与候选数与对应 RoboSPA 任务对齐,只把线索换成"颜色/自中心位置/固定计数方向"这类浅线索。结果(原论文 Table 7)是三个变体在五个难度上都有 67.8--87.0% 的成功率、且几乎不随难度下滑------浅线索任务根本暴露不出当前 VLA 的推理缺陷。这一对照是全文方法论上最干净的一块证据:它说明 L1→L5 的下滑确实来自"推理负担"而非"任务复杂度"的笼统效应,也说明若基准停留在浅线索层,VLA 的空间能力会被系统性高估。

任务 L1 L2 L3 L4 L5
颜色 grounding 80.6 77.8 79.8 71.2 74.0
自中心位置 grounding 67.8 69.4 74.8 72.2 72.4
简单序数索引 87.0 86.8 83.8 87.0 84.8

5.4 失败分析:空间败在"选错",长程败在"做坏、记忘、排错序"

论文定义六种失败模式:空间维度为目标执行错误(选对但抓失败)、无接触抓取错误(没碰到任何物体)、目标 grounding 错误(选错对象);长程维度复用 grounding 错误并另加操作错误(子任务低层执行失败)、记忆错误(未保留前步信息)、时序顺序错误(子任务顺序错)、冗余重复错误(重复已完成动作而不推进)。下图给出六类失败的代表性案例,可以看到不同类别任务的失败形态差异明显------这正是基准"区分度"的定性证据。

量化分布见下面两图(分别为 π0.5 与 X-VLA):空间维度上目标 grounding 错误占全部错误的 70% 以上 ,执行类错误次之、无接触抓取极少------即空间任务的瓶颈在"推理选目标"而非"手";其中 CPI 的 grounding 错误占比最高、CVR 的执行错误占比相对更大。长程维度上错误更多元:操作错误约占 50% ,其余四类大致均布;类别层面,RPF 以冗余重复错误为主(模型疑似只凭当前视觉观测决定下一步、缺乏进度跟踪),OFE/CAC 以操作错误为主,OCE 除操作错误外以时序顺序错误为主,MIP 以记忆错误为主------每类任务的 dominant 错误类型与其设计意图一一对应,说明能力分类学与错误分类学确实咬合,基准具备良好的任务区分度。

5.5 统计不确定性与跨本体一致性

为排除有限样本噪声,论文对 L5 平均成功率报告 bootstrap 95% 置信区间(原论文 Table 10):区间宽度约 ±1--1.6 个百分点,远小于模型间差距与 L1--L5 降幅,主结论在计入统计不确定性后不变。

模型 空间维度 L5 平均 长程维度 L5 平均 总体 L5 平均
RDT 6.1 5.2, 7.1 7.7 6.8, 8.5 6.9 6.3, 7.5
GO-1 10.6 9.4, 11.8 7.0 6.2, 7.7 8.8 8.1, 9.5
π0.5 21.4 19.8, 22.9 23.1 21.9, 24.3 22.3 21.3, 23.2
X-VLA 23.9 22.3, 25.5 15.9 14.8, 17.0 19.9 18.9, 20.8

跨本体侧,论文在五个本体上各选每类别一个代表任务、独立训练并评测 X-VLA(原论文 Table 11、12)。绝对性能随本体差异明显(如 UR5 普遍偏高、Franka 偏低),但每个任务×每个本体上 L5 都低于 L1------难度梯度不依赖特定本体成立;MIP-3 在全部五个本体上 L5 均为 0、L3 也仅 0--16,与主实验的记忆瓶颈结论互证。

本体 GAC-1 L1/L3/L5 SDE-5 L1/L3/L5 CPI-4 L1/L3/L5 RRR-3 L1/L3/L5 CVR-4 L1/L3/L5
Aloha-AgileX 48/22/16 48/31/27 29/13/7 43/31/14 41/30/22
ARX-X5 51/18/11 36/29/26 32/14/7 50/24/13 28/11/13
Piper 48/34/16 18/20/17 40/18/10 40/18/20 50/44/39
Franka 22/12/8 14/10/10 38/18/8 48/18/14 12/8/7
UR5 74/43/25 52/41/34 67/35/26 58/45/38 59/55/49
本体 RPF-1 L1/L3/L5 OFE-1 L1/L3/L5 OCE-5 L1/L3/L5 CAC-6 L1/L3/L5 MIP-3 L1/L3/L5
Aloha-AgileX 49/30/27 79/55/28 99/67/18 54/37/24 100/8/0
ARX-X5 54/46/40 64/59/27 100/54/22 99/53/29 99/12/0
Piper 74/66/40 96/9/0 100/16/9 52/31/19 99/0/0
Franka 66/40/24 26/20/11 92/18/0 98/40/0 100/0/0
UR5 83/58/49 99/24/5 93/33/17 100/51/48 100/16/0

六、这篇工作的边界与可复现性

论文自述三条局限:全部任务在仿真中构建,sim-to-real 缺口可能限制向真机的直接迁移;基准聚焦 tabletop 操作,未必覆盖真实环境的开放与多样;变形体操作、人机交互、开放式指令等更广设定尚未探索。在此之上,还有几点值得读者自行校准。其一,单任务微调协议意味着结果度量的是"模型在该任务上的可塑性"而非"通用策略零样本能力",两者都是有用口径,但不可混读;其二,主实验只用 Aloha-AgileX 干净场景数据,域随机轨迹与其余四本体数据在主结果中未消耗(跨本体实验仅 X-VLA、每类一任务),"527K 轨迹"的规模红利在主表里并未完全兑现;其三,指令模板由 GPT-5.2 生成后人工校验,语言多样性受模板族限制,"100 条 disjoint 评测指令"对语言泛化的覆盖仍属有限;其四,仿真 rollout 在同 checkpoint 同 seed 下基本确定,随机性主要来自场景/布局 seed,bootstrap CI 覆盖的是这一层,不覆盖模拟器本身的系统偏差。

可复现性方面这篇做得相对足:代码、数据、任务脚本以 MIT 许可发布;训练配置统一(batch 16、20k 步、官方预训练权重全参微调);算力账目公开(每任务 1.5--12 GPU-hours、合计约 1,568 GPU-hours);评测 100 trials/变体且指令 disjoint。对一个仿真基准而言,这已把"复现门槛"压到一台多卡工作站量级。

七、如果继续研究/落地,应该关注什么

对模型研究者,RoboSPA 的错误分布已经把改进方向写成清单:空间侧补 object-centric grounding 与关系感知(70%+ 的 grounding 错误是最大单点收益),长程侧补进度跟踪、执行监控与记忆机制(RPF 的冗余重复、OCE 的时序错误、MIP 的记忆错误各自对应明确机制缺位)。对基准研究者,三个可扩展面已经 visible:把域随机轨迹纳入主评测轴(目前只作为数据存在)、把跨本体从"每类一任务"扩到全任务、以及引入真机子集校准 sim-to-real。对工程落地者,最实用的读法是"用 ONTA/PS 做模型选型尺":在候选物体多的拣选场景,SR 会系统性高估能力,ONTA 才反映真实 grounding 水平;在多步作业场景,PS 与 SR 的差值提示"失败前完成了多少",直接决定人工接管的成本。

八、术语与概念速查

类别 术语 一句话定位
基线模型 RDT 1.2B 扩散式 VLA 基线,本基准上整体最弱(L5 6.9%)
基线模型 GO-1 智元 2.8B 分层 VLA 基线,长程略好于空间
基线模型 π0.5 Physical Intelligence 3.3B 开放世界 VLA,本基准总体最强(L5 22.3%)
基线模型 X-VLA 0.9B 跨本体 VLA,空间维度最强、长程记忆弱
仿真设施 SAPIEN 物理仿真平台,RoboSPA 全部任务的构建环境(Apache 2.0)
仿真设施 RoboTwin 2.0 双臂仿真数据生成器/基准,RoboSPA 复用其框架与部分动作原语、资产
任务类别 GAC/SDE/CPI/RRR/CVR 空间维度五类:几何属性/距离估计/规范索引/参照关系/跨视角
任务类别 RPF/OFE/OCE/CAC/MIP 长程维度五类:重复跟随/无序执行/有序执行/复合协调/记忆密集
评测概念 bootstrap 95% CI 对 L5 均值的有限样本不确定度量化,区间 ±1--1.6 个百分点
评测概念 单任务设置 每基础任务独立微调一个模型、逐难度评测,度量任务可塑性而非零样本通用性
场景概念 域随机化 背景/clutter/桌高/光照四类扰动,任务语义不变,用于量场景鲁棒性
场景概念 sim-to-real gap 仿真到真机的迁移缺口,本文全部结论的首要适用边界
数据概念 指令模板 disjoint 训练 50/评测 10 模板不相交,阻断背指令捷径

九、拓展思考:值得继续扩展研究与思考的创新点

RoboSPA 把"基准即诊断仪器"这件事做成了范式,也留下若干可生长的接口。第一,难度刻度的理论化 :L1--L5 目前是任务特异的手工刻度(加物体/加步骤),若能把"推理负担"形式化(如候选熵、程序深度、记忆负载),难度轴就能跨任务可比、甚至可外推预测 L6+ 的表现------这是把基准从"量表"升级为"标度律"的机会。第二,ONTA 思想的推广 :机会校正在空间维度极有效,同样的"扣除基线"思路可以搬到长程维度(例如以"贪心只完成易子任务"为基线校正 PS),使两个维度的诊断尺同构。第三,记忆瓶颈的机制研究 :MIP 在 L5 全员 0% 是全文最硬的负结果,它指向的不是"再多数据"而是架构问题------显式记忆模块、状态跟踪头、或分层 planner 与 VLA 的耦合,都可以在 MIP 上做受控对照,MIP 有望成为"具身记忆"的标准试金石。第四,从诊断到训练的闭环 :RoboSPA 的错误类型标注与步骤级记录天然是课程学习与失败挖掘的原料,按 dominant 错误类型加权采样训练、或把 PS 作为密集奖励做 RL 微调,是基准数据反哺模型的直接路径。第五,语言与视角的再随机化 :指令由模板族实例化、视角固定于本体相机,若叠加开放式指令改写与第三人称/手持相机输入,基准可以进一步逼近"人在现场随口指挥"的真实分布。回到标题之问------VLA 能否走出简单场景与短horizon任务?RoboSPA 给出的答案是:在当前架构与训练范式下,走出得有限且可测量 ;而它真正的长期价值,是为"下一代模型是否真的走出去了"提供了一把带刻度、可归因、可复测的尺子。

最硬的负结果,它指向的不是"再多数据"而是架构问题------显式记忆模块、状态跟踪头、或分层 planner 与 VLA 的耦合,都可以在 MIP 上做受控对照,MIP 有望成为"具身记忆"的标准试金石。第四,从诊断到训练的闭环 :RoboSPA 的错误类型标注与步骤级记录天然是课程学习与失败挖掘的原料,按 dominant 错误类型加权采样训练、或把 PS 作为密集奖励做 RL 微调,是基准数据反哺模型的直接路径。第五,语言与视角的再随机化 :指令由模板族实例化、视角固定于本体相机,若叠加开放式指令改写与第三人称/手持相机输入,基准可以进一步逼近"人在现场随口指挥"的真实分布。回到标题之问------VLA 能否走出简单场景与短horizon任务?RoboSPA 给出的答案是:在当前架构与训练范式下,走出得有限且可测量;而它真正的长期价值,是为"下一代模型是否真的走出去了"提供了一把带刻度、可归因、可复测的尺子。

相关推荐
陈天伟教授2 小时前
具身数据采集黑话(4)
人工智能·windows·具身智能
_张一凡3 小时前
【AIGC面试面经第12期】具身智能算法工程师面试面经相关问题汇总
aigc·具身智能·面试面经
木木学AI15 小时前
2026主流大模型电话机器人系统解析:技术架构、业务执行与企业落地实践
架构·系统架构·机器人
工业机器人视觉检测设备16 小时前
工序全流程自动化升级!云汇智能打造汽车天窗多机器人集成产线
机器人·自动化·汽车
米糕闯编程19 小时前
鱼香ros2(三)Linux操作总结
linux·机器人·ros2
行如流水20 小时前
自进化来了,Zeva:面向泛化具身操作的上下文因果学习
具身智能
@嵌入式扫地僧21 小时前
国产 RISC-V 机器人关节 MCU 量产落地解析:硬件 EtherCAT 支持与进口替代完整指南
机器人·risc-v·ethercat·国产化替代·机器人关节mcu
风合星语1 天前
2026 机器人行业观察(一):现在入局机器人还来得及吗?——机会、门槛与技术人的切入点
网络·人工智能·机器人
willhu20081 天前
ROS2:Microban 机器人仿真搭建
机器人