【阅读笔记】具身操作的数采方案概览

本篇位置 :本批第 10 篇。它是今天三篇里唯一的非新闻稿 ------一篇写于 2024 年 12 月、2025 年 1 月更新的技术综述,作者本人就在这个行业里做数采。前两篇(36 氪的行业评论、钛媒体的深度访谈)讨论的所有设备名词------ALOHA、UMI、Ego、外骨骼、动捕手套------这一篇是它们的技术底图。

为什么值得读一篇"旧文":因为第 8、9 篇是 2026 年的"结论",而这一篇记的是 2024 年的"前提"。把它和第 9 篇对读,你能看到这个领域两年内答案被整个翻转的过程------这也是本批材料里我认为最有价值的一条线。


一、亮点速读(一段话看懂这篇)

这是一篇从业者写的数采方案地图 ,把"机器人操作数据从哪来"这件事从工业界到学术界完整盘了一遍。工业界部分拆解了三家:特斯拉(VR 眼镜 + 动捕手套,视野与机器人对齐)、Physical Intelligence(1 万小时数据、7 到 8 种本体,用 ALOHA/Mobile ALOHA 同构遥操)、智元(VR 头盔挂胸前只做定位 + 仿真规模化生成)。学术界部分盘了四家团队的工作:清华高阳组用 UMI 采了 4 万组数据并给出三条 Scaling 结论(最著名的是"多样性远比绝对数量重要")、清华朱军组的 RDT-1B、上交卢策吾组的 RH20T、北京人形的 RoboMIND。然后他把所有采集方案归成两大类并逐一讲原理:依赖 机械臂 本体的遥操 (ALOHA 同构遥操、VR/AR 的 retargeting 遥操)和 In the wild 开放环境采集 (UMI 及其一众改进版、DexCAP 动捕手套、ACE/AirEXO 外骨骼),最后补了一章光学动捕 vs 惯性动捕 的选型对比。全篇最有价值的是作者给出的两条"痛点清单"------学术界最稀缺的数据是末端 力传感器 、Depth 信息和手眼标定 位姿 ,而 UMI 这类方案最大的问题是没有评价指标,导致"采了一堆数据之后,不知道是数据的问题还是模型的问题"。

二、阅读笔记

1. 一个前提:本文只讨论操作任务

作者开篇划了边界,这个划界很关键,避免了很多比较上的混乱:

  • 具身智能是自动驾驶的升维问题------硬件本体构型和形态、算法模型的输入输出都还在"百花齐放的萌芽状态";

  • 具身领域很青睐 VLA 端到端大模型方案,但端到端自动驾驶该遇到的问题一个也逃不掉;

  • 具身还有更棘手的数据问题:没有现成大规模部署好的具身本体,所以"如何高效地大规模采集机械臂数据用作模仿学习算法的燃料"是核心课题。

重要限定 :运动控制大部分用强化学习(RL)训练,所以本文只讨论操作任务面向模仿学习/行为 克隆 的数采方式。这个边界请记住,后面所有结论都只在这个范围内成立。

2. 第一章:数据金字塔(正文只有一张图)

第一章标题是"具身数据的数据金字塔",但正文没有文字展开,只有一张配图 。这一点我要如实说明------本篇笔记无法从文字里还原它的定义。补充说明:本批第 8 篇(36 氪)也提到了"数据金字塔",并强调它是动态的、取决于场景,同样没有给出完整定义。

想要一个清晰的分层定义,可能需要回到更早的原始资料。这是本篇的一个信息缺口,不是我的疏漏。

3. 工业界三家的数采现状

3.1 特斯拉:VR 眼镜 + 动捕手套

从特斯拉放出的视频看,Optimus 的数据来自VR 遥操 + 动捕 手套:

  • 操作员戴 VR 眼镜,用于和机器人的视野对齐;

  • 动捕手套捕捉的手指运动转发到 Optimus 的灵巧手上。

作者的观察补充:从 We Robot 发布会看,Optimus 的上肢行为"应该是遥操",但其 locomotion(移动)能力以及整机遥操的丝滑程度都很强。他还提到前几天放出的接球 Demo"看着也有点像是遥操",进一步证明遥操延时很低,而且 retargeting 的映射做得很好。

这条观察值得留意:它和第 8 篇里"特斯拉灵巧手参与度不高"的说法并不矛盾------本处讨论的是遥操演示的技术完成度,第 8 篇讨论的是落地生产场景里的实际使用。两件事。

3.2 Physical Intelligence:把 1 万小时当作实验室来做

作者把 PI 归类到学术界也行(因为论文里展示的 1 万小时数据实在不像学校实验室),但实际它是公司。

关键信息:

  • PI 不做自己的本体;

  • 大模型 π0 发布了论文,已有国内公司在合作,各具身实验室和企业都在复现,参考价值高;

  • π0 用了 1 万小时数据,共 7 种或 8 种本体构型;

  • 数采方式是 ALOHA 或 Mobile ALOHA ,即"最为直接的同构映射数采方案"------作者补了一句:"不过成本也是更加大的,可以想象到 1 万小时数据的数采成本。"

本节最有价值的是后半段------PI 团队自己解释了为什么不选其他路线(来源标注为王建明老师的文章和 Sergey Levine 的报告):

  • 不使用模拟数据:与真实世界场景的互动难以准确建模,存在分布偏移;

  • 不使用视频数据 :视频数据也存在分布偏移,同时缺乏任务特定性;并担心"视频数据已经被 VLM 预训练方法挖掘殆尽";结论是"视频数据有用,但可能不足以单独实现机器人任务的性能和泛化";

  • 为什么是真实数据 :跨本体训练是关键 ------等机器人真的部署到全球,那时候收集真实世界数据将变得容易;预训练阶段只要求数据是多样化的,微调阶段才需要更专业和更高质量的数据。

这条引述是本篇与第 8、9 篇最尖锐的冲突点。 PI(2024 年)说视频数据"已被 VLM 预训练挖掘殆尽"、不足以单独支撑性能;而第 9 篇(2026 年)说"人类数据正在成为预训练主流"、英伟达都在大规模采购人类视频。**同一家公司体系的判断(Sergey Levine 是 PI 联合创始人)在两年前后完全不同。**具体怎么看待这个翻转,见第七节"主线一"。

3.3 智元机器人:并行走两条路

从智元官方视频可以看到,它至少在并行两条数采方式,且主要展示的是夹爪任务,不是灵巧手:

  • VR 遥操 :和特斯拉不同,操作员把 VR 头盔挂在胸前,而不是戴在头上 。所以头盔只用作控制器的定位,不做视野对齐;

  • 仿真生成 :视频里机器人在仿真中把鸡蛋放到碗里,除了机器人本体和交互对象(鸡蛋和碗)之外,周围环境与物体资产一直在变。作者判读这是一种 Scale Up 流程------"如果能在仿真环境中生成一个轨迹,可以规模化地扩充和生成若干条轨迹"。

3.4 工业界为什么都选遥操(作者的思考,三条)
  1. 机器人商业阶段:还没到降本增效的时候。遥操数据质量最高,而遥操的采集成本可以接受------"在早期阶段,需要先把高质量数据玩明白才去继续往下来";

  2. 遥操反哺机器人本体设计 :智元和特斯拉都自己做本体,遥操系统可用于反哺硬件设计------"如果人能完成的行为,人形机器人不能丝滑的完成,可能哪些硬件设计还可以做改进";

  3. 遥操辅助机器人进入场景 :遥操不只是数采手段,一个低成本的遥操系统可以先让机器人进入危险作业场景 ;"当机器人真的用起来之后,才是 free 的数据"。而且和自动驾驶汽车一样,特斯拉可以把影子模式等经验复用,用有效数据反哺模型。

4. 学术界四家团队

4.1 清华高阳组:Data Scaling Laws(用 UMI 采 4 万组)

论文用 UMI 收集了 超过 40k 组数采数据,三条结论(作者原文给了英文短语,我按语义译出):

  • Simple power laws :Policy 的泛化性能与环境交互对象的数量大致遵循幂律关系;

  • Diversity is all you need :环境和物体的多样性远比 demonstration 的绝对数量重要;

  • Generalization is easier than expected :在尽可能多的环境(例如 32 个环境)中,每个环境一个单独的操作对象加 50 组示例数据,训练出的 Policy 能在新环境 + 新物体上泛化得比较好。

附加结论:一旦环境或交互对象的 demonstration 数量达到一定阈值,额外的数据就只能带来微乎其微的收益了。

作者单独拎出的数采细节(这两条很实用):

  • UMI 依赖 SLAM 来捕获末端位姿(EE Pose),纹理缺乏的环境中 SLAM 算法可能失效 ,所以采集的 demonstration 大约 90% 是有效的;

  • 摘要中提到:四名数据收集者工作了一下午 ,采集到足够的数据,使两项任务的策略在具有看不见物体的新环境 中实现约 90% 的成功率。

注意"一个下午 + 四个人 → 90% 成功率"这个效率数字。它是 UMI 路线最有力的广告。

4.2 清华朱军组:RDT-1B
  • 开源双臂操作大模型,近期关注度高;

  • 从 46 个开源数据集 整合了 1M episodes (100 万条),再自己搜集 6k episodes,可以在一些长时序和需要灵巧控制的任务中完成任务;

  • 自采数据的方式是 ALOHA/Mobile ALOHA,"通过主从同构映射和转发来实现遥操,是一种搜集高质量示例数据的数采方式"。

4.3 上交卢策吾组:RH20T
  • 在业界口碑不错的高质量数据集;

  • 采集方式:用额外控制器 (看起来像 sigma.7 力反馈设备)遥操机械臂,配多视角相机;

  • 论文中专门强调了标定信息和末端力传感器;

  • 作者的延伸观察:卢老师组在 Grasp 和操作方向上很关注 3D 信息的利用 ,而 3D 信息比较依赖标注;另外该组对触觉和力位混合投入很多,刮胡子的 Demo"确实蛮惊艳的"。

4.4 北京人形:RoboMIND(多本体 + 多方式组合)

论文采集了多本体的各种数据,结合多种数采方式,并在 ACT、RDT-1B 等工作上做了丰富验证:

  • 用自带的 ALOHA 操作平台遥操 Agelix 机械臂;

  • 用 Gello 遥操 Franka 和 UR5 机械臂;

  • 用 Xsense 动捕手套 + Gello 来控制人形机器人。

4.5 学术界的总结:喜欢什么方式,还缺什么数据

学术界青睐什么数采方式:

  • 对于夹爪和末端位姿 :用 ALOHA、Gello 或额外控制器等同构映射设备做遥操;或用 UMI 这类设备采图像 + SLAM 生成末端位置;

  • 对于灵巧手 :用动捕设备采集人手关节的映射。

学术界有什么、还缺什么(这是本节最有价值的一条):

  • 大部分数据集都包含图像数据 + 本体感受(proprioception);

  • 比较稀缺的是:末端力传感器、Depth(深度)信息、手眼标定位姿;

  • 这三者分别对应力位混合的感知 以及 3D 信息的使用。

这条"稀缺清单"请记住。 第 9 篇(2026 年)里陈源培给出的感知模态优先级是"**精准 3D 位姿 > 触觉模态 > 2D 图像特征**"------**两篇相隔一年半、体裁立场完全不同,却在"缺什么"上高度一致。**独立信源的收敛是最可信的结论。

5. 遥操数采 vs In the wild 数采

作者先把方案归成四类,然后明确划掉了两类不做讨论:

  • 基于仿真的数采------依赖仿真环境的 ready ,对光照、物体材质、物理交互特性影响都很大;仿真中训练 work 后还面临 Sim2Real 问题;

  • 从人类操作的视频数据中学习------需要面临的清洗数据的工作量庞大。

作者说明:"我还没有深入看和实际操作过这两块的内容,不纳入讨论范围。"所以本文实际只讨论遥操数采 和 In the wild 数采。

5.1 依赖机械臂本体的遥操方案

ALOHA 为代表的同构遥操(细节很扎实)

  • 构型:桌面尺寸 48"×30"(约 121.92 cm × 76.2 cm),四条机械臂 + 四个相机;

  • 人控制的臂叫主臂(leader) ,实际操作物体的臂叫从臂(follower);

  • 相机排布:两个从臂上装手臂相机、一个桌面仰视相机、一个支架上的俯视相机,型号都是 D405;

  • 夹爪采用低摩擦力设计,能省力;

  • 主从臂可以是不同型号------主臂可以便宜一些,从臂性能需要高一点,但需要同构。

一个很容易被忽略的训练细节 :数采时采集员操作主臂,控制信号从主臂转发到从臂完成任务。模型训练时,Paper 提到要用主臂状态作为训练数据 ------因为转发过程中从臂状态会耦合一个 PID 过程 去 follow 主臂状态,而主臂状态才只有(人类)视觉反馈的控制信号。

作者还提到一条"名场面"级别的提醒:年初 ALOHA/Mobile ALOHA 的遥操 Demo 被自媒体改编后虚构说成是自主完成的,拉高了公众对具身落地的预期。

基于 ALOHA 的扩展工作:

  • ACT 算法:ALOHA 配套算法,低延迟、易训练,常用于做 Demo;

  • ALOHA Unleashed (2024 年 10 月在 arXiv 更新):全面拥抱了 Diffusion Policy,作者评价"也算是一种模型侧的信号";

  • Mobile ALOHA :ALOHA 加可移动底盘,做移动双臂任务,也是 π0 做移动任务的数采方式;

  • RoboCrowd :以众包方式采集数据并写了 Report,作者认为这足以说明 ALOHA 系统的易用性和可 Scale Up 的潜力;

  • Gello :针对"硬件成本较高(需单独两根从臂)或老机械臂不支持拖动示教"的问题,是一种廉价同构映射方案。

VR/AR 的 retargeting-based 遥操

  • 动机:ALOHA 系需要单独配主臂用于人类控制,成本较高。另一种思路是用额外控制器------常见的有 VR(如方舟的采集系统) 和 AR(如 Open-TeleVision);

  • 原理:与 ALOHA 的转发控制信号类似,但控制器配合 VR 头盔可以定位末端位姿(EE Pose),中间需要多一步逆运动学(IK)解算到关节角度;

  • 关键局限 :由于臂的可达空间以及 IK 解不唯一 ,可能会出现"控制器可达而机械臂不可达"的不跟手情况,需要对特定机械臂做平滑处理。

VR 的两种用法(作者的分析很到位):

  • 特斯拉式 :操作员佩戴 VR 头盔,头盔视野与机械臂视野完全对齐 ------从数据质量上说效果应当更好,但"佩戴舒适度不够的情况下极易疲劳";

  • 智元式 :头盔只用于辅助手柄定位,视野未与相机采集视角对齐。ALOHA 的相机排布同样面临视角对不齐的问题,"且只能用减小相机盲区尽可能缓解这种问题,不能解决视角对不齐的问题"。

作者对智元方案的评价:"更是一种无奈的折中之举吧,从质和量上达到一种 Balance。"

5.2 In the wild(开放环境)数采方案

动机很实际:上述遥操方案都依赖机械臂,所以环境可能不太能泛化------例如要采集火锅店或厨房的数据,就需要一台设备真的进入场景中采集。

5.2.1 UMI/Fast-UMI 为代表的夹爪方案

UMI 由 Diffusion Policy 的作者 Cheng Chi 提出。作者的评价很高:用 GoPro + 3D 打印件构成一版开放环境的采集系统,"不得不说真是算法能力和硬件设计能力拉满的一位大佬"。系统设定:

  • 用 GoPro 获取图像以及 IMU,IMU 可用于跑 SLAM 算法来获得末端位姿;

  • 用夹爪上附着的 marker 来获取夹爪的宽度;

  • 边缘的两个小镜子用于获得隐式的深度信息以及一对虚拟的左右相机;

  • 应用简单的基于运动学的数据过滤,为不同的机械臂选择有效轨迹。

UMI 的改进与变体(作者依次列了五家,其中两家是国内团队的硬件改进):

变体 关键改动
Fast-UMI 添加触觉压敏传感器 获得触觉信息;使用 T265 的 IMU(比 GoPro 质量好,双目 + 高质量 IMU 可以 handle 短暂视觉缺失 ,在视觉遮挡场景下表现更好,作者提到在铰链任务 上验证效果较好);可获得末端位姿和关节状态两种数据 。作者也坦承 IK 解算这步比较难做,很容易解算出与环节碰撞的关节状态,未来考虑优化
上海国地共建中心 定位相机改为 D435i ;夹爪换成电动夹爪,可读取电机数据获得力反馈
ReadAir-LAB 使用非常高精度的专用 IMU 传感器,在仿真里非常跟手
iPhone + UMI 利用 iPhone 的 IMU 做末端位姿跟踪,可进行机械臂遥操

UMI 的优点(作者总结四条):

  1. 采集效率够高 ------相对于 ALOHA 等遥操采集能提升 3 倍以上;

  2. 可以在非特定环境中采集;

  3. 不依赖具体硬件------"可以一次采集,做多次 Retarget 操作映射到不同机械臂上进行训练";

  4. 足够便宜,且有丰富的可扩展性(原版其实没有力反馈,后续改进方案可以加)。

UMI 的问题(作者总结三条,第一条最要命):

  1. 在不同任务下,EE Pose 的精度也有待考证,没有一套评价指标 ------"容易导致采了一堆数据之后,不知道是数据的问题还是模型的问题";

  2. 只有手部相机,没有全局相机,有些任务不好学习;

  3. 关节角度解算(IK)这一步需要花比较大的功夫。

第 1 条是我认为全篇最有洞察力的一句话。它和第 9 篇"缺乏统一 Benchmark"的抱怨是同一个问题的两个面。

5.3 灵巧手的两条路

以 DexCAP/ARCap 为代表的动捕手套方案

  • 这两个工作都是 Li Fei-Fei 老师组提出的,有一定延续性;

  • 思路:通过动捕手套做灵巧手的映射;

  • 硬件形态:背包中放了 NUC 和 PowerBank 用于供电(这个细节说明它是可穿戴、可移动的)。

以 ACE/AirEXO 为代表的外骨骼数采方案

  • 两者外骨骼构型类似,需要对特定机械臂做适配;

  • 外骨骼的好处是可以安装一个全局视野的相机 ,弥补了 UMI 的缺陷。

有意思的对照:第 8 篇(2026 年)里的 DexCap 是灵巧智能公司的产品 ,而本文(2024 年)里的 DexCAP 是 Li Fei-Fei 组的学术工作。同名但不同主体,读的时候注意区分。

5.4 总结与思考
  • 学术界在 Robot 数采上"下足了功夫",在机械臂本体、数采方式都没有完全收敛的情况下,各种方案百花齐放;

  • In the wild 方案不受环境限制,应该来说更有前景;

  • "做一个数采系统需要质量和效率之间的 Tradeoff ,才是能够 Scale Up 的关键,需要非常强大的工程能力";

  • 从现阶段看,机械臂的遥操数据依然是质量最高的数据 ,但受限于对机械臂的依赖,只能在特定实验环境下采集;In the wild 方案可以拓展到开放环境中去;

  • 补充一句:如果把 retargeting 的延迟做到足够小,In the wild 设备也可以做遥操的事情。

作者还简短讨论了仿真里的数采 两条思路:一是数据回放 (把真实采集的数据在仿真环境中回放,可以复用真实数据,难点在环境搭建和交互,数字孪生是一种思路);二是环境 ready 时直接遥操采集(把控制信号转发的对象变为仿真环境中的机械臂即可)。

6. 光学动捕 vs 惯性动捕

这一章是 2025 年 1 月 17 日补充的(作者在开头写了"更新第五章节的动捕方案",来源标注为诺亦腾的文章)。

为什么动捕重要 :如果想把动作做得拟人和自然,捕捉人体动作是一条非常重要的路------"狗行走的类狗性,人行走和操作时的类人性,都会依赖人的操作数据"。而且动捕和 In the wild 方案有一个共同优势:一次采集,经过 Retargeting 之后可以应用到不同的本体上。

光学动捕 惯性动捕
原理 多相机捕捉标记点 穿戴式 IMU 传感器
精度 很高,技术成熟 相对较差
优势 影视游戏行业广泛应用 便携灵活,不受光照和空间限制
短板 多相机布置难以避免遮挡 ,常用于室内;需搭建专用场地 + 多相机同步校准,成本较高 长时间使用会产生漂移(作者注:这应该是 IMU 传感器的常见问题)
代表厂商 OptiTrack (电影《钢铁侠》《蜘蛛侠》《封神》,游戏《刺客信条》);国内青瞳视觉(《凡人修仙传》)、NOKOV(度量)(科研领域) XSense(电影《阿凡达》《敦刻尔克》《X 战警》)

作者的两条判断:

  • 动捕在灵巧手的数采中已经用得较多 ,在 Fast-UMI 这类工作中也会用作轨迹真值来进行校验;

  • 但由于成本较高,落地的情况还不太多;

  • 展望:"但如果动捕能做到穿戴无感,成本降低,还不会影响日常生活的话,是一种从工厂采集进入到日常采集的好思路。 自动驾驶数据多是因为车辆已经融入了自然生活了,如果某一天,人类习惯了身穿动捕服 or 外骨骼去做日常生活的活动,具身数采这件事也会变得自然起来,数量将不再是头疼的问题,数据质量会更受到关注。"

这段展望写于 2024 年底,而第 9 篇(2026 年)讲的恰恰就是"外骨骼数据采集规模化"正在发生。这是本篇最有预见性的一段。

7. 作者的收尾:一个从业者的坦白

  • 具身是一个工程能力很强的学科,"从数采到算法的闭环,中间有很多坑要采";

  • 不能像在 ImageNet、COCO、Nuscenes 的 Benchmark 上刷榜那么简单了,做出工作的周期也变长了很多,比 CV 更需要"踏踏实实做好闭环";

  • "事实上,我们也更加缺乏一个 Benchmark 来统一评价大家的算法,成功率这个指标因环境而异。"

  • "一个成熟的研究组以及实验环境能够助力很多很多事情。"

他还推荐了两位信息源(王建明老师的 Robot Data 系列访谈、泓杰 Talk),并附了一段关于"物理 AI vs 虚拟 AI"的个人观点,属于作者本人的"暴论"(他自己这么说的),这里不展开,感兴趣可直接看原文末尾。

三、重点名词解析

ALOHA / Mobile ALOHA 一句话:一台"四臂桌面机器人"------你用两只手操作两根便宜的"主臂",旁边两根"从臂"照着做同样的动作,动作被完整录下来当数据。加上轮子能移动,就是 Mobile ALOHA。 准确定义:一种低成本双臂遥操作硬件平台。桌面尺寸 48 英寸 × 30 英寸(约 121.92 × 76.2 cm),配四条机械臂(两条主臂 leader、两条从臂 follower,同构)和四个 D405 相机(两手臂 + 一桌面仰视 + 一支架俯视),夹爪采用低摩擦设计。训练要用主臂状态而非从臂状态------因为从臂会耦合一个 PID 过程去跟随主臂,只有主臂状态才携带人类视觉反馈的控制信号。配套算法为 ACT,后续有 ALOHA Unleashed(转向 Diffusion Policy)、Mobile ALOHA(加移动底盘)、RoboCrowd(众包采集)、Gello(廉价替代方案)等扩展。

主臂 / 从臂(leader / follower) 一句话:主臂是你手里操作的"遥控臂",从臂是真正干活的"执行臂"。 准确定义:同构遥操作系统的两端。主从臂型号可以不同(主臂可便宜、从臂性能需高),但必须同构,以保证映射关系直接。

同构映射 vs Retargeting(重定向) 一句话:同构是"手臂对着手臂"直接映射;retargeting 是"用别的东西(手柄、手套、手机)控制机器人手臂",中间需要换算。 准确定义:同构映射指主从设备结构一致、关节一一对应,信号可直接转发;retargeting 指用不同结构的控制设备(VR 手柄、动捕手套、IMU)驱动目标本体,需要经过逆运动学(IK) 解算或映射学习。本文指出 retargeting 的典型问题是IK 解不唯一导致"控制器可达但机械臂不可达"的不跟手现象。

IK(Inverse Kinematics,逆运动学) 一句话:我知道手要伸到哪个位置,但需要反推出各个关节该转到什么角度。 准确定义:由末端位姿求解关节角度的数学问题。难点在于解通常不唯一,且可能出现解与环境碰撞的情况,工程上需要额外的平滑与筛选处理。

SLAM(Simultaneous Localization and Mapping) 一句话:一边走一边画地图,同时知道自己在地图里的哪个位置。 准确定义:同步定位与建图技术。本文中它的作用是从 UMI 手持设备的相机 + IMU 数据反推末端的位姿(EE Pose)。注意其局限:在纹理缺乏的环境中可能失效,这是 UMI 采集有效率约 90% 的原因之一。

EE Pose(End-Effector Pose,末端位姿) 一句话:夹爪(或手)此刻在空间里的位置 + 朝向。 准确定义:机器人末端执行器在笛卡尔空间中的六自由度状态(三轴位置 + 三轴姿态)。它是模仿学习最核心的学习目标之一,也是 UMI 路线的精度瓶颈所在。

UMI(Universal Manipulation Interface) 一句话:把夹爪做成一个手持道具,人拿着它在真实场景里干活,GoPro 负责录------不占用任何机器人,也能采到"真实的操作数据"。 准确定义:Diffusion Policy 作者 Cheng Chi 提出的无本体数据采集与策略学习框架 。硬件为 GoPro + 3D 打印件;技术要点包括用 IMU 跑 SLAM 复原末端位姿、用夹爪 marker 读开合宽度、用边缘两个小镜子提供隐式深度与一对虚拟左右相机、以及基于运动学的数据过滤来为不同机械臂筛选有效轨迹。核心价值是一次采集、多次 retarget 。相对 ALOHA 等遥操采集,效率可提升 3 倍以上。

Fast-UMI 一句话:UMI 的"加强版",加了触觉传感器、换了更好的定位传感器,还能同时输出末端位姿和关节状态。 准确定义:UMI 的改进方案。新增触觉压敏传感器;定位改用 T265 (双目 + 高质量 IMU,可在短暂视觉缺失即遮挡场景下工作,在铰链任务上验证效果较好);可同时获得末端位姿和关节状态两种数据。已知局限是 IK 解算难度大,容易解算出与环境碰撞的关节状态。

Gello 一句话:老机械臂不支持拖动示教、又买不起第二根从臂?Gello 是一个廉价的"手动遥控臂"替代方案。 准确定义:一种通用、低成本、直观的遥操作框架,用于解决 ALOHA 类方案硬件成本高(需单独两根从臂)以及部分老机械臂不支持拖动示教的问题。

In the wild 数采(开放环境采集) 一句话:不让机器人待在实验室里,而是把采集设备带到火锅店、厨房这些真实场景里采数据。 准确定义:不绑定固定实验环境的采集范式,以 UMI 系便携设备为代表。优势是环境泛化性好;代价是精度不如下有本体的遥操,且对 IK 解算和数据过滤的工程要求更高。

动捕(Motion Capture) 一句话:给真人身上贴标记点或穿上传感器,把他的一举一动数字化记录下来,再映射到机器人身上。 准确定义:捕捉并记录人体运动的技术,本文分光学与惯性两大类。核心价值是"一次采集,经过 retargeting 后可应用到不同本体",被作者视为动作拟人化与自然度的关键路径。在灵巧手数采中应用已较多,也常用作轨迹真值来校验其他采集方案。

光学动捕 一句话:多台相机围着你看,靠识别身上的反光标记点算出你的姿势------精度最高,但必须在搭好的场地里、还不能被挡住。 准确定义:基于多相机同步与标记点的运动捕捉。精度高、技术成熟,广泛用于影视游戏;短板是遮挡问题、需专用场地与多相机同步校准,成本较高。代表厂商 OptiTrack、青瞳视觉、NOKOV。

惯性动捕 一句话:穿一身带陀螺仪的衣服,走哪采哪,不用搭场地------但精度差些,时间长了会"跑偏"。 准确定义:基于可穿戴 IMU 的运动捕捉。便携灵活、不受光照与空间限制;但精度相对光学方案较低,且长时间使用会产生漂移(IMU 传感器的常见问题)。代表厂商 XSense。

Retargeting(重定向) 一句话:同一个人在 A 设备上做的动作,翻译成 B 机器人身体能做的动作。 准确定义:把源本体(人手、手持设备、控制手柄)的运动轨迹映射到目标本体(不同构型的机械臂或人形机器人)的过程。动捕与 In the wild 方案的核心优势就在于采一次可以 retarget 到多个本体,从而摊薄采集成本。

ACT / Diffusion Policy 一句话:两种把"看画面 → 出动作"学出来的算法;ACT 又好训又快,Diffusion Policy 更能处理复杂的多模态动作。 准确定义:ACT 是 ALOHA 配套的低延迟、易训练的动作分块(action chunking)模仿学习算法,常用于做 Demo;Diffusion Policy 是以扩散模型生成动作序列的策略学习算法。ALOHA Unleashed 从 ACT 转向 Diffusion Policy,被本文作者视为一个"模型侧的信号"。

π0(pi-zero) 一句话:Physical Intelligence 做的机器人基础模型,用 1 万小时、七八种不同机器人本体的数据训练,是业界复现的热门对象。 准确定义:Physical Intelligence 发布的视觉-语言-动作流匹配(flow matching)模型,用 ALOHA/Mobile ALOHA 采集的 1 万小时数据训练,覆盖 7~8 种本体构型,是跨本体训练的代表性工作。PI 明确表示预训练阶段只要求数据多样化,微调阶段才需要更专业、更高质量的数据。

DexCAP / ARCap 一句话:戴上动捕手套、背个背包,在真实场景里用手干活,把灵巧手的动作录下来。 准确定义:Li Fei-Fei 组提出的可穿戴灵巧手数据采集工作,通过动捕手套映射人手关节运动,背包内置 NUC 与移动电源供电。两者有延续性。

ACE / AirEXO 一句话:和动捕手套类似,但用的是"外骨骼"结构,好处是能顺便装个全局相机。 准确定义:外骨骼式数据采集工作,构型类似,需要对特定机械臂做适配。相对 UMI 的关键优势是可安装全局视野相机,弥补了 UMI 只有手部相机的缺陷。

数据金字塔 一句话:把所有能用来训练机器人的数据按来源分成几层,越往上越贴近真实机器人、越贵越少。 准确定义:一个被广泛使用但非正式的分类框架,通常自下而上包括公开互联网数据/人类视频、仿真数据、遥操作真机数据、真机自主运行数据。注意:本篇第一章标题虽为"具身数据的数据金字塔",但正文只有一张配图没有文字展开 ,本笔记无法给出该文的具体分层口径。第 8 篇(36 氪)也提到过它,强调它是动态的、取决于场景,同样未给完整定义。

RoboCrowd 一句话:把 ALOHA 数据采集众包出去,让更多人帮着采。 准确定义:基于 ALOHA 硬件的众包数据采集工作,附有技术 Report。本文作者用它来论证 ALOHA 系统的易用性和 Scale Up 潜力。

四、数字速查表

数字 含义 口径与我的核对
48"×30"(约 121.92 × 76.2 cm) ALOHA 桌面尺寸 论文资料,属硬件规格,可直接引用
4 臂 + 4 相机 ALOHA 构型 同上;相机型号 D405
1 万小时 π0 训练数据量 PI 论文口径(2024 年);覆盖 7~8 种本体构型
超过 40k 组 清华高阳组用 UMI 采集的数据量 论文口径
90% UMI 采集的 demonstration 有效率 作者转述论文,归因于 SLAM 在缺纹理环境可能失效
4 名采集者 / 一个下午 / 约 90% 成功率 高阳组的数据效率 论文摘要口径;指两项任务在含未见物体的新环境中的成功率
32 个环境 / 每环境 50 组 高阳组泛化实验的设定 论文口径
1M episodes RDT-1B 从 46 个开源数据集整合的规模 论文口径;另有自采 6k episodes
6k episodes RDT-1B 自采数据量 论文口径
提升 3 倍以上 UMI 相对 ALOHA 等遥操采集的效率提升 作者判断,原文未附出处;属体验性对比,建议谨慎引用
2024-12-23 / 2025-01-17 本文发布 / 更新日期 发布信息;更新补充了第五章动捕方案

五、我的追问

1. 这篇最有价值的不是方案盘点,而是它诚实标注了自己的盲区。

作者明确说仿真数采和"从人类视频学习"这两块"我还没有深入看和实际操作过""不纳入讨论范围"。而恰恰是这两块,在后面两年成了行业主线 ------第 9 篇(2026 年)讲的"人类数据成为预训练主流",正是本文划到范围外的那一类。作者写这话时(2024 年底)这本是合理的自我限定,现在回看却成了一次精准的时代注脚:当时被认为"非主流、先不讨论"的方向,两年后成了主角。

2. "没有评价指标"这个问题,两年后仍然没解决。

本文说 UMI 的问题是"EE Pose 精度有待考证、没有一套评价指标",导致"采了一堆数据之后,不知道是数据的问题还是模型的问题"。第 9 篇(2026 年)里,无问智科说需要"数据 + 工具链 + 测评体系"三层,缺一不可;作者在文末也说"我们也更加缺乏一个 Benchmark 来统一评价大家的算法,成功率这个指标因环境而异"。

这是跨越一年半的一条未解问题。 如果说今天的数据之争有什么"真正的瓶颈",我认为这条比"成本"更根本------成本高可以砸钱,没有尺子就不知道钱砸得对不对。

3. "遥操反哺本体设计"这条理由被严重低估了。

作者列的三条工业界选遥操的理由里,第二条(遥操可反哺硬件设计)最容易被当作附带好处,但我认为它可能才是本体厂商的真实动机 :如果人能完成某个动作而人形机器人不能丝滑完成,那就是硬件设计的改进信号。这是一条免费的、真实物理世界给出的设计反馈回路。 第 9 篇里范永说"大脑最终要附生到本体上才有落地的市场",两句话指向同一个方向:本体和数据是绑在一起的,分不开。

4. PI 那句"视频数据已被 VLM 预训练挖掘殆尽",两年后被事实推翻了。

这是全篇最值得单独标出的一处。2024 年 PI(Sergey Levine 是联合创始人)明确表示不用视频数据,理由包括分布偏移、缺乏任务特定性和"视频数据可能已经被 VLM 预训练方法挖掘殆尽"。而第 9 篇记录的是:2026 年 2 到 3 月英伟达发布 EgoScale 与 DreamDojo 大规模使用人类视频,成为路线转折的关键信号;智在无界 20 万小时、灵初近 10 万小时、Generalist 27 万小时都建立在人类数据上。

这不是 PI 判断错了那么简单 ------PI 说的是"不足以单独 实现机器人任务的性能和泛化",而 2026 年的人类数据路线定位是预训练表征学习 ,两者并不完全互斥。真正被推翻的是那个隐含前提:**"视频数据没剩多少可挖的了"。**事实证明,人类第一人称的操作视频,和 VLM 预训练用的通用视频,价值维度并不相同。

5. 一个读法建议:把本篇当"名词典"用。

今天三篇里,第 8 篇提了 UMI、Ego、外骨骼但没解释;第 9 篇提了外骨骼触觉手套、MolmoSpaces、RoboCasa 但没有设备原理。本篇是唯一把 ALOHA、UMI、Fast-UMI、Gello、DexCAP、ACE、动捕这些都讲清楚原理和取舍的一篇。 建议的用法是:先读第 8、9 篇了解 2026 年的局面,遇到不懂的设备名再回本篇查------它是一本 2024 年出版、但硬件原理至今大部分仍然有效的词典。

6. 一处需要留意的主体混淆。

本篇提到的 DexCAP 是 Li Fei-Fei 组的学术工作 (2024 年);第 8 篇提到的 DexCap 是灵巧智能公司的产品(2026 年)。中文名与英文名高度接近,但主体、年份、形态都不同。读到"DexCap"时务必确认是哪一篇的哪个东西。

六、原文

原文入口

  • 标题:《具身操作的数采方案概览》

  • 作者:Muyun99(南京航空航天大学 工学硕士),收录于知乎专栏「具身智能基建」

  • 首次发布:2024-12-23;更新:2025-01-17(补充第五章动捕方案)

  • 链接:https://zhuanlan.zhihu.com/p/14109860960

  • 数据:171 人赞同

本文的结构(供你按需跳读)

  1. 具身数据的数据金字塔(正文仅配图,无文字展开)

  2. 工业界具身数采现状(Tesla、Physical Intelligence、智元 + 总结思考)

  3. 学术界大规模数采现状(清华高阳组、清华朱军组、上交卢策吾组、北京人形 + 总结思考)

  4. 遥操数采与 In the wild 数采(ALOHA 同构遥操、VR/AR retargeting、UMI 系、DexCAP/ARCap、ACE/AirEXO)

  5. 光学动捕与惯性动捕(2025-01-17 更新补充)

  6. 一些思考(工程能力、缺统一 Benchmark、"物理 AI vs 虚拟 AI"的个人观点)

关键摘录(以下为原文引语,已标注出处,仅作评述引用)

"如果人能完成的行为,人形机器人不能丝滑的完成,可能哪些硬件设计还可以做改进。"
"也不乏自媒体改编后虚构说是自主完成的,拉高了公众对于具身落地的预期。"------谈 ALOHA/Mobile ALOHA 的遥操 Demo 被演绎
"容易导致采了一堆数据之后,不知道是数据的问题还是模型的问题。"------谈 UMI 缺少 EE Pose 的评价指标
"事实上,我们也更加缺乏一个 Benchmark 来统一评价大家的算法,成功率这个指标因环境而异。"
"做一个数采系统需要质量和效率之间的 Tradeoff,才是能够 Scale Up 的关键,需要非常强大的工程能力。"
"但如果动捕能做到穿戴无感,成本降低,还不会影响日常生活的话,是一种从工厂采集进入到日常采集的好思路......如果某一天,人类习惯了身穿动捕服 or 外骨骼去做日常生活的活动,具身数采这件事也会变得自然起来,数量将不再是头疼的问题,数据质量会更受到关注。"

版权提示 :以上仅为短句评述性引用;原文含大量设备图片与论文链接,图片请勿搬运。如需引用请回到原链接并注明作者与出处。

七、延伸阅读与横向关系

与本批三篇的关系

第 8 篇(36 氪) 第 9 篇(钛媒体) 第 10 篇(本篇)
体裁 产业媒体评论(带厂商案例) 深度访谈 + 行业观察 技术综述博客
时间 约 2025 年末~2026 年初 2026-07-17 2024-12-23(2025-01-17 更新)
角色 问题清单 现场访谈/主样本 技术底图
回答"缺什么数据" 缺灵巧手末端操作数据 任务多样性 > 物体多样性 > 场景多样性 末端力传感器、Depth、手眼标定位姿最稀缺
回答"谁会成为主流" 协同论:设备互补不取代 分工论:人类数据占预训练、真机退到精细微调 记录 2024 年答案:机械臂遥操数据质量最高

三条主线(本篇提供的是"起点")

主线一|两年内答案翻转,本篇提供的是翻转前的版本。

这是我认为今天最值得写出来的一条线:

时间 "最好的数据是什么"
2024-12(本篇) 机械臂遥操数据质量最高;PI 明确不用仿真与视频数据(理由是分布偏移、缺任务特定性、视频数据已被 VLM 预训练挖掘殆尽)
2025-07 ~ 2026-01 人类第一人称视频路线从"几乎没有关注者"走到"还不是主流"
2026-02/03 转折点:英伟达发布 EgoScale 与 DreamDojo,被第 9 篇点名为"关键的验证信号"
2026-07(第 9 篇) 人类数据在预训练层面成为主流,真机数据退到精细微调

两年,同一个问题的答案从"非真机不可"变成了"真机采不起"。 这不是谁犯错,而是问题的定位变了------2024 年问的是"什么数据能让策略学会一项技能",2026 年问的是"什么数据能支撑 Scaling"。同一个词"质量",在两个问题里的含义不同。

主线二|"采集容易、消化难"这条线,本篇给的是最早的一次预警。

  • 本篇(2024-12):说"需要非常强大的工程能力"、说"缺乏统一 Benchmark"、说 UMI 采完"不知道是数据的问题还是模型的问题";

  • 第 8 篇(2026 年初):说"数据质量问题堆砌到后期,而这个阶段会付出很高的成本";

  • 第 9 篇(2026-07):给出了最硬的证据------10 万小时筛完只剩约 5417 小时。

一年多以前被当作"工程上的麻烦"来提的问题,今天已经变成了行业级的瓶颈。 这条线的价值在于:它提醒我们,当时无人重视的那句"需要非常强大的工程能力",可能比任何技术路线判断都更接近真相。

主线三|信源平衡度:本篇是今天最客观的一篇。

第 8 篇的案例方、第 9 篇的主要访谈对象都偏外骨骼路线。而本篇作者是独立从业者写技术综述 ,不推销任何具体产品,盘点时同时覆盖学术工作与工业实践,还主动声明了自己没深入的两块。在今天三篇里,本篇的立场最中性,可以作为前两篇的"校准尺"来用。

需要后续核实的事项

  1. "数据金字塔"的定义 ------ 本篇只有图无文字、第 8 篇只提概念,两篇都没给完整定义。需要回到更原始的出处(可能是英文资料)确认分层口径。

  2. UMI 相对 ALOHA 效率提升"3 倍以上" ------ 作者未附出处,属体验性判断,对外引用需谨慎。

  3. V-JEPA 的"100 万小时以上视频" ------ 见第 9 篇待办,需回 Meta 原论文确认口径。

  4. 文末"物理 AI vs 虚拟 AI"的个人观点 ------ 作者自称"暴论",属个人立场,本笔记未展开,建议直接读原文并当作观点而非结论。

  5. 本篇引用的论文清单 ------ 原文附了约 40 条参考文献(arXiv 论文、B 站视频、知乎专栏、微信公众号文章),是一份很好的延伸阅读清单。如需按图索骥,建议直接从原文链接进入,本笔记不复制链接列表以免出现失效与转写错误。

相关推荐
喵个咪1 小时前
GoWind Admin|风行 — 开箱即用的企业级全栈中后台框架:脚本系统实战
javascript·后端·go
茉莉玫瑰花茶1 小时前
GO [ 并发 ]
开发语言·后端·golang
喵个咪1 小时前
GoWind Admin|风行 — 开箱即用的企业级全栈中后台框架:通知域实战
后端·go
小小张说故事1 小时前
SHAP 可解释性入门:模型为什么这么判?Python 实战 + 4 个最常见的误读
后端·python·机器学习
喵个咪1 小时前
GoWind Admin|风行 — 开箱即用的企业级全栈中后台框架:认证与会话管理实战
后端·go
喵个咪2 小时前
GoWind Admin|风行 — 开箱即用的企业级全栈中后台框架:六类审计日志与等保合规
后端·安全·go
Sam_Deep_Thinking2 小时前
什么是CountDownLatch?
java·后端·面试·程序员
小蒜学长2 小时前
基于SpringBoot和Vue的低卡食品销售系统的设计与实现(代码+数据库+LW)
java·后端·springboot·健康管理·低卡食品销售系统
白起那么早2 小时前
idea 插件-把数据库的表画出来
数据库·后端·intellij idea