【阅读笔记11】机器人操作的数据金字塔《Data Pyramid for Embodied Manipulation》

本篇位置 :本批第 11 篇。它和第 12 篇(搜狐·42号电波)解读的是同一篇综述 ------北大、南洋理工、港科大、新加坡国立、上交、上海AI Lab 等十余家机构近 30 位研究者 2026-07-28 联合发布的 72 页长文《Data Pyramid for Embodied Manipulation: A Survey》(arXiv:2607.24744,通讯作者北大仉尚航)。两篇的分工:第 12 篇是媒体概览(发布次日写的快评),这一篇是技术深读版(8-11 发布,十个章节逐层拆)。要快速知道"综述说了什么"看第 12 篇;要拿它当工作手册用,看这一篇。


一、亮点速读(一段话看懂这篇)

这篇解读把综述拆成"一个隐喻、两条主轴、四个维度、五层数据、三类模型、六个开放问题"。一个隐喻就是数据金字塔:塔尖是真实机器人数据,塔基是互联网通用数据。两条主轴是全文的灵魂------可扩展性 (这份数据能多容易越攒越多)和机器人对齐 (这份数据能多直接地帮真机学会执行动作),二者负相关 :越贴近真机执行的数据越贵越难扩量,越容易海量获取的数据对"怎么动真家伙"的指引越间接。四个维度是质量、多样性、可复用性、物理保真度------注意质量被排在第一位,"光堆量没用"。五层从塔尖到塔基依次是真实机器人数据、UMI 风格数据、第一/第三人称数据、仿真数据、通用数据,每层都给了"长什么样、怎么采、优缺点"。三类模型(具身大脑/VLA/世界动作模型)对数据的胃口不同:具身大脑吃无动作数据建世界知识,VLA 以带动作数据为核心监督、无动作数据靠 latent action/几何表征/中间监督三条路利用, WAM 两类都要。最后六个开放问题里,触觉数据缺失被点名为金字塔"最大的结构性缺口",而"数据配方"(各层比例怎么配)被称为"整个领域最被低估的问题"。对数采岗位来说,这篇综述等于把"我们采的数据在行业坐标系里排第几层、缺哪层、怎么配"第一次变成了可以公开讨论的公共语言。

二、阅读笔记

1. 金字塔的骨架:两轴四维,而不是五层名单

很多人(包括第 12 篇)把这篇综述读成"五层名单",但解读版强调名单只是结果,骨架才是贡献:

  • 可扩展性(Scalability):取决于对硬件、人力、环境重置、安全监督、边际生成成本的依赖程度;

  • 机器人对齐(Robot Alignment):数据能否直接帮机器人在真实物理世界学会执行动作;

  • 两轴负相关,所以不存在"最好的数据",只存在"在你的预算和任务下最合适的层";

  • 四个评价维度:质量(有效、一致、信息量大、任务相关;重复轨迹/错误标注/信号没对齐都是"虚胖")、多样性(任务/物体/场景/视角/ 指令 /具身形态/传感配置/行为方式/结果的覆盖面,决定分布偏移时稳不稳)、可复用性(能否跨任务/环境/本体/模型家族迁移)、物理保真度(接触、摩擦、柔顺、传感噪声、执行延迟、物体运动是否被忠实捕捉)。

这条骨架直接可用:以后对内汇报数据规划,可以不说"我们要采 X 万小时",而说"我们在金字塔第几层补多少、四个维度上各打几分"。

2. 塔尖第一层:真实机器人数据的三种采集范式(最实用的一节)

综述把真机数据的来源归成三类,比第 10 篇(2024-12)的"两大类"分得更细:

① 脚本化采集(不靠人一条条操控):规则执行(检测→选位姿→接近→抓取,IK+运动规划自动生成,适合规整工作空间但多样性有限);轨迹回放(录好的成功轨迹换摆放换环境重播+扰动,省人力但对环境变化敏感);自主策略 rollout(RL/IL 训出的策略自己跑,QT-Opt、MT-Opt 路线,能覆盖失败-恢复行为但带策略偏见、产大量低质轨迹)。

② 遥操作(人实时操控,最适合接触密集的精细行为),细分六种手法:动觉示教(直接用手掰 机械臂 ,适合固定底座);主从式(小号 同构 臂当手柄------ALOHA、GELLO 都是这条,对双臂协调友好);集成主从(操控臂与受控机器人合二为一,如 ARX AC-One,有直观力反馈,代价是"人的手会入镜"导致部署时画面分布漂移);设备介导(VR/XR 手柄、手机、SpaceMouse,跨平台方便但精度和延迟是短板);视觉遥操(从 RGB/RGB-D 估人手动作再重定向,HumanPlus、DexPilot,成本低但怕遮挡和快速运动);可穿戴/动捕重定向(数据手套、惯性服、外骨骼,高维稳定,标定和重定向成本高)。

③ 人在回路增强(把失败变成养料):部署中遇到难搞或要失败的状态时人介入接管、记录纠错动作。谱系从 DAgger → ThriftyDAgger(只在新奇/高风险状态求助)→ Fleet-DAgger(多机并行)→ DexCap(灵巧手接管)→ CR-DAgger(不打断自主执行、只做柔顺增量纠错)。

对数采岗的三条直接挂钩 :主从式那行就是知识库里 ALOHA/Gello 条目的学术归类;"集成主从手会入镜"是选设备时一个很具体的坑;人在回路 = 知识库 5.5"部署后 free 数据回流通道"的学术名字------我们规划回流通道时可以直接引用 DAgger 这条谱系做依据。

3. 第二层 UMI:关键在"相对末端轨迹"这个动作表示

解读版把 UMI 的技术要点讲得比第 10 篇透:UMI 不记录"某个机器人专属的关节角",而是用腕部相机+IMU+视觉惯性 SLAM 估手持夹爪的 6D 位姿轨迹和开合状态;动作用"相对当前末端的下一步目标"表示------避免全局坐标系漂移、减少误差累积,同时给出一个"和具体身体无关"的动作空间,部署时再经标定/IK/低层控制器映射到不同机器人。

演化谱系:单臂夹爪(UMI、FastUMI、LEGATO)→ 双臂/灵巧手(DexWild、DexUMI)→ 移动平台(UMI on Legs)→ 多视角/3D 感知/触觉力感知(ViTaMIn、FreeTacMan、exUMI);规模从几百条到 FastUMI-100K、RealOmni、Daimon-Infinity 的十万至几十万条。

综述的结论很清醒:UMI 是真实机器人数据的可扩展补充,而非替代------具身差距(视角、末端几何、运动学、动力学、接触条件)并未完全消除,且缺机器人专属的本体感知和驱动动力学。

4. 第三层 第一/第三人称:硬件矩阵与"监督怎么造"

  • 为什么排中间:比仿真真(真实物理、灵巧手、日常多样性),比 UMI 离机器人远(镜头跟人走、手遮接触区、身体场景出画);

  • 采集硬件三类:视觉(单目 RGB/双目 RGB-D/事件相机,各自的怕点:无深度怕模糊遮挡/标定和纹理要求/稀疏);运动姿态追踪(IMU 怕漂移/手部穿戴传感器精度高但受干扰/头显 inside-out 动捕便携但依赖专有管线);辅助交互传感(注视与音频/肌电 EMG 被遮挡也有效但依赖贴片/指尖力触觉阵列直接给接触证据);

  • 监督四类 × 三条构建路线:语义、几何、多模态、机器人导向四类监督,每类都有"人工标注/模型预测+拟合/传感器直接捕捉"三条路,成本和误差来源各不相同;

  • 根本局限:局部可观性问题 + 缺机器人本体感知/驱动动力学/可直接执行动作,"人-机身体差距"未解决。采集上是权衡:无设备录制好扩量但缺精确标签,穿戴传感更准但受成本/耐用性/负担限制。

5. 第四层 仿真:基础设施、四种生成法、世界模型当模拟器

  • 三大基础设施 :具身与传感系统(URDF/MJCF/USD 描述文件);物体与场景资产(不只要好看的网格,还要碰撞几何、质量惯性、材质、抓取/铰接标注------ShapeNet/Objaverse 给形状多样性,Google Scanned Objects/OmniObject3D 提真实感,PartNet-Mobility 给铰接,PhysXNet/PhysX-Mobility 给"物理感知即插即用",ManiTwin 用 AIGC 生成 10 万+ 物体扩池子);物理与渲染后端(MuJoCo 刚体接触/Isaac Gym·Lab GPU 并行/SAPIEN 铰接/PyBullet 轻量/SoftGym 可形变/Genesis·Newton 多物理可微)------引擎本身决定数据能长什么样;

  • 合成演示四种生成法 :人在仿真里执行(保真但受人力限制,常作种子);规则执行(可复现、边际成本低,但表达力受限于写死的专家);轨迹回放与扩展(MimicGen、DexMimicGen、RoboCasa,少量种子在新物体/场景复用);自主/生成式 rollout( RL / IL 策略、 LLM /VLM 生成任务程序、世界模型批量产数据------GenSim、RoboGen、RoboTwin、InternData 系列);

  • 世界模型当模拟器(综述里很新的一块):三种角色------策略训练的虚拟环境(World4RL 等)、策略评估器(WorldGym、WorldEval)、合成数据引擎(GigaWorld-0、DreamGen);好处是不用手搓资产、能建模时序演化,坏处是产出"看起来合理但物理上不成立"的轨迹,需过滤和真数据校准;

  • Sim-to-Real 两类不匹配 :观测不匹配(纹理、光照、材质、深度噪声、触觉响应);交互不匹配(再分运动学差距 ------形态/关节限位/坐标系/控制频率,和动力学差距 ------执行延迟、柔顺、摩擦、接触、形变只被部分建模)。综述的原话级判断:核心问题不是"能造多少",而是"造的数据是否抓住了决定真机部署成败的感官变化和不可约的动力学不确定性";

  • 规模≠多样性:综述用 InternData-A1 举例------技能受限的生成会让动作关键点挤在一小块区域,大量重复。

和知识库 RoboTwin 条目对读 :综述把 RoboTwin 归在"LLM/VLM 生成任务程序"的自主 rollout 一支,与 GenSim、RoboGen、InternData 同列;结合解读版提到的英伟达 SimFoundry、字节 TableVerse,可以看到一条清晰的趋势线------仿真数据生成正从"人类手写专家策略"转向"LLM 驱动的自动生成",RoboTwin 正是这条线上的代表工作。

6. 第五层 通用数据:按"能贡献什么能力"分七类

视觉-语言(语义与常识推理,LLaVA 系列等);分割与定位(把语义落到空间区域,SA-1B、RefCOCO、RoboPoint 等,是"从认出杯子到知道抓哪"的接口);3D(深度/点云/重建/空间问答,给"几何脑");规划(目标拆步骤,ALFRED、EgoPlan-IT、ShareRobot,语义到执行的中间推理层);视频与时序("感知记忆",Ego4D NLQ、Moment-10M);物理/因果/失败推理(CLEVRER、IntPhys、RoboFail);抓取(GraspNet-1Billion、DexGraspNet 2.0,指定末端"在哪、怎么接触")。结论:当宽泛的"感知-语义-推理先验"用,再由更贴近机器人的层去接地到物理执行。

7. 异质数据怎么被基座模型吃进去:配方、动作空间、三类家族

数据配方四个趋势 :从单一真机轨迹走向异质混合(但最优配方未定论------纯机器人数据训的 LingbotVLA、DreamZero 也很强,没有证据表明"塞越多源越好");预训练规模跨入"十万小时"时代(Qwen-RobotManip 约 3.81 万小时多源语料、Xiaomi-Robotics-1 超 10 万小时 UMI 轨迹);第一人称数据地位上升(从辅助源变成介于通用网数据和具身轨迹之间的预训练基底,HumanScale 最高 5000 小时精选、EgoScale 扩到 2 万+ 小时带动作标签);对低质量数据容忍度上升(π0.7:配足够清晰的提示时低质量轨迹也有用------可能预示从"猛过滤"转向"显式标注轨迹质量与意图")。

动作空间对齐(跨具身训练的技术核心),两个层面:

  • 结构对齐三法:具身特定投影(保留各自动作接口、适配器映射到共享骨干,GR00T N1、Octo);固定维度零填充(统一向量长度、空闲维填零+有效性掩码,π0、Qwen-VLA);语义动作槽(共享向量每个维度固定物理含义,如 Qwen-RobotManip 的 80 维"规范状态-动作向量",不同机器人只填相关子集------对齐最强);

  • 几何对齐三坐标系:机器人中心、相机中心(让视觉相似动作数值更一致)、手腕中心(手部局部关节与全局腕部运动解耦,METIS、LDA-1B)。综述直言:现有研究对各坐标约定的受控消融太少,哪种最好仍不清楚。

三类模型家族的数据胃口:具身大脑(重理解不重出动作;无动作数据建世界知识,带动作数据转成 affordance/抓取位姿/路点/子任务标签等可迁移监督);VLA(带动作数据是直接监督------RT-2 离散 action token 自回归,或 π0/GR00T/RDT 的扩散头、π0.5/SmolVLA 的流匹配头;无动作数据靠 latent action 代理(LAPA、UniVLA)、显式几何表征(Track2Act、General Flow)、层级中间监督(CoT 式)三条路);WAM(带动作数据对齐"未来演化↔可执行动作",无动作数据只做观测级未来预测;常见两阶段配方:大规模无动作预训练打动力学底+动作条件后训练接地)。

8. 六个开放挑战(综述的"未来押注清单")

按"收集什么/怎么收集/怎么用"三条线:① 触觉数据缺失 ------金字塔"缺了一层接触信息",RoboMIND 2.0、Humanoid Everyday 已开始纳入但仍未成标准模态;② 失败与恢复数据 ------现有数据集严重偏向成功专家演示,需要更丰富的失败标注(前因、发生时刻、类别、原因、恢复动作、最终结果);③ 跨金字塔层的可扩展采集管线 ------穿戴多传感设备仍不成熟(怕遮挡、漂移、标定麻烦),未来要更轻、无线、模块化、低侵入+自动跨设备标定;④ 跨具身状态-动作对齐 ------坐标约定、标定参数、控制器模式应作为一等公民元数据 记录;⑤ 第一人称先验用于灵巧手 ------把人视频当"结构化交互先验"而非精确动作标签,再用机器人数据接地;⑥ 数据配方本身------各层最优比例、采样比、分阶段分配远未确定,且缺"计算量匹配"的受控消融。

和知识库第五部分"六件事"的对读 :综述的④(坐标/标定元数据一等公民)≈ 我们的 5.4;②(失败数据保留)≈ 我们的 5.5 回流通道;⑥(配方与消融)≈ 我们的 5.1 KPI 与 5.6 评价指标。我们半年前自己推出来的几条工作原则,和这篇 30 人综述的开放清单高度重合------这不是巧合,是同一个瓶颈的两面。对内汇报时可以直接引用综述给我们的规划背书。

9. 质量警告:综述把"质量"放在四个补充评估维度之首

解读版结尾转述了综述的警惕:其一,自动标注的质量稀释 ------VLM 自动生成的标注可能含幻觉对象、错误关系、模板化语言,"自动标注通常需要经过置信度估计、一致性检查或人工验证才能使用";其二,多样性与质量的权衡 ------高多样性数据来自不可控的实验室外,高质量数据来自可控的实验室里。"包括信息密度、标注可信度、物理一致性等指标在内的数据质量评估体系,可能是比 Scaling Law 本身更紧迫的基础设施建设"------这句和知识库 5.6"把缺评价指标当成机会"是同一句话的两种说法。

三、重点名词解析

  • 机器人对齐(Robot Alignment):数据能多直接地帮机器人在真实物理世界学会执行动作。金字塔的纵轴之一,与可扩展性负相关。

  • 特权标签(Privileged Labels):仿真白送的、真机几乎拿不到同等精度的标签------每个物体的 6D 姿态、每个接触点的力分布、每步关节精确状态、任务成功与否。仿真数据的真正价值之一。

  • 反事实数据生成:真机只能记录"发生了什么",仿真可以可控地生成"可能发生什么"(结构化探索),用于学鲁棒策略。

  • 语义动作槽(Semantic Action Slot):跨具身结构对齐三法中最强的一种------共享动作向量的每个维度固定物理含义,不同机器人只填自己相关的子集(Qwen-RobotManip 的 80 维规范状态-动作向量)。

  • 潜在动作代理(Latent Action Proxy):从无标注视频学习"动作相关"的隐式表征(LAPA、UniVLA),优势是可规模化,仍需少量真机演示落地。

  • 人在回路(Human-in-the-Loop)/ DAgger 谱系:部署中失败或临界状态由人接管并记录纠错动作,把失败转成恢复数据。DAgger → ThriftyDAgger → Fleet-DAgger → DexCap → CR-DAgger。

  • 局部可观性(第一人称):第一人称视角下手会遮挡接触区、身体场景出画,导致观测不完整,需第三人称相机或后处理补。

  • 数据配方(Data Recipe):各层数据的组合、采样比例、分阶段分配策略。综述称其为"整个领域最被低估的问题"。

  • 世界-动作模型(WAM):以"世界如何演化、动作如何改变世界"为主目标的模型家族,可当学出来的模拟器、规划器、策略评估器、合成数据引擎。与具身大脑(重理解)、VLA(重出动作)并列三类。

四、数字速查表

数字 含义 档 口径说明
72 页 / 近 30 位作者 / 十余家机构 综述本体规模 🟢 arXiv:2607.24744,2026-07-28 发布;通讯作者北大仉尚航
RT-1:13 万条 / 700+ 任务 真机数据集规模 🟢 综述转引原论文口径
RoboMIND:107K 条 / 479 任务;RoboMIND 2.0:31 万条 / 739 任务 / 超 1000 小时 真机数据集规模 🟢 综述转引
AgiBot World Beta:100 万条轨迹 / 近 3000 小时 真机数据集规模 🟢 综述转引;与知识库既有口径一致
Open X-Embodiment:超 200 万条轨迹 跨机构聚合真机数据 ⚠️ 本篇(知乎)写"超 200 万",第 12 篇(搜狐)写"240 万条 / 22 种平台",两篇都转引自同一综述,数字不一致,引用前需回 arXiv 原文核对
EgoScale:1,000 → 20,000 小时,性能持续提升未见天花板 自我中心数据预训练缩放实验 🟡 英伟达披露,综述转引;是"方向性 Scaling Law 线索",不是已证实的 Scaling Law
Xiaomi-Robotics-1:10 万小时 UMI 预训练 + 1 万小时跨具身后训练(含 7,200 小时自有真机 + 1,000 小时指令标注 UMI) 两阶段训练配方 🟡 厂商报告,综述转引
HumanScale:最高 5000 小时精选 第一人称数据规模 🟡 综述转引
EgoDex:829 小时(Apple Vision Pro 采集) 第一人称手部交互数据 🟢 综述转引原论文
DexGraspNet 2.0:4.27 亿抓取样本 仿真/抓取数据规模 🟢 综述转引
SA-1B:11M 图像 / 1.1B 分割掩码 通用数据规模 🟢 综述转引原论文
Qwen-RobotManip:约 3.81 万小时多源语料 预训练规模 🟡 厂商报告,综述转引
ManiTwin:10 万+ AIGC 生成物体 仿真资产池 🟢 综述转引

六、原文

  • 原文入口:https://zhuanlan.zhihu.com/p/2070472232380392009 (知乎专栏,作者"叶子",2026-08-11 发布)

  • 被解读的一手文献:《Data Pyramid for Embodied Manipulation: A Survey》,arXiv:2607.24744,2026-07-28。

  • 短评述性引用(均出自解读原文,加引号标注):

    • 论两轴矛盾:"和真实机器人执行最贴合的数据(每一条动作都能直接在真机上跑),往往最贵、最难扩大规模;而能轻松海量扩产的数据(比如网上的图片文字),对'怎么动真家伙'的指引却很间接、很模糊。"

    • 论仿真价值:"核心问题不是'能造多少',而是'造的数据是否抓住了决定真机部署的那些感官变化和不可约的动力学不确定性'。"

    • 论质量基建:"包括信息密度、标注可信度、物理一致性等指标在内的数据质量评估体系可能是比 Scaling Law 本身更紧迫的基础设施建设。"

  • 图片一律未搬运。解读中的图 1(数据金字塔)即本批用户附图所示的五层结构;图 2---4 为两轴空间示意、三类采集范式、三类模型家族取数差异,如需请回原链接。

相关推荐
光锥智能1 小时前
OpenAI、Meta、Manus同时下注,智能体 2.0 来了
人工智能
揽秀亭长1 小时前
视频转脚本技术拆解:语音识别与文本处理流程
人工智能·音视频·语音识别
跨境联盟1 小时前
科普|小区落地社区健康驿站,普通居民可以获得哪些服务?
大数据·人工智能·健康医疗·健康管理·精准营养
IT_陈寒1 小时前
Python的GIL锁让我把多线程代码全重写了!
前端·人工智能·后端
高升说1 小时前
户外强光下的深度相机:940nm 窄带与曝光策略
人工智能·数码相机
Zootopia6261 小时前
美国载人飞船Crew-13明晚发射!
人工智能·算法·机器学习·数学建模·无人机·创业创新·信息与通信
艾莉丝努力练剑1 小时前
【AI大模型接入SDK】ChatSDK 集成测试概述
jvm·c++·人工智能·学习·面试·集成测试·sdk
探客木木夕1 小时前
AI伦理体系核心价值观声明
大数据·人工智能·机器学习
明志数科1 小时前
具身智能训练数据分布设计:为什么分布比数量更关键
人工智能·深度学习·机器学习