RoboPocket——从UMI式被动采集到无机器人即时策略迭代:基于iPhone与AR视觉前瞻的实时闭环数采系统(无需离线SLAM后处理)

前言

过去一年,具身数采这个话题一直热度不断,特别是umi、ego这类数采模式

  • 我司最早在24年就帮不少企业/高校复现过原装umi
  • 也看到过很多国内发布的umi数采产品/工具
    当然,截止到26年8月份:大部分都太贵(这里的贵特指:压根就没有啥性价比可言)、而且大部分不好用(比如精度有限),相信后续会不断好转

故我个人一直在关注兼具「性价比和好用」的umi方案,比如

  1. 此文《OpenHLM------全身VLA下的行走-操作:sonic作为运控底层,π0.5作为VLA的初始化策略(且基于umi改造出可以做全身数采的HuMI)》中介绍过的HuMI
    算是全身umi
  2. 本文要介绍的RoboPocket

当然,只是探索路上 关注到了这两,不代表这两 就完美兼具"性价比和好用"了

第一部分 RoboPocket: Improve Robot Policies Instantlywith Your Phone

1.1 引言与相关工作

1.1.1 引言

如原论文所说,与互联网规模的文本和图像不同,具身数据必须通过真实物理交互来执行、采集并加以验证。尽管近期出现的"无本体"手持式接口 5,45,46 在物理层面上将数据收集与机器人硬件解耦,但它们尚未解决学习流程中固有的认知瓶颈问题

目前,机器人学习的工作流程存在显著的专业壁垒,将整个流程割裂开来(见图 1 左)。这一过程通常需要三个不同的角色:

  1. Data Collector(数据采集者),需要能够直观把握运动学约束;
  2. Trainer(训练者),负责处理分布偏移
  3. 以及 Tester(测试者),必须在物理环境中监督机器人以识别失效模式

在实践中,这些角色往往被强加到同一个具备博士水平的专家身上。只有这样的专家才具备隐性知识,知道如何扩展状态覆盖范围,或者到哪里去收集纠正数据以缓解分布偏移 43。对这类高度专业人士的依赖使得大规模数据收集在根本上难以扩展;毕竟无法指望众包劳工具备机器人学研究人员那样的判断力。包括事实上,以前的大规模数据收集工作已经强调了专家用户与新手用户在数据质量上的显著差异 28,30

在本文介绍的这项工作中,作者认为,要实现机器人学习的规模化,就必须将这种专家直觉"导出"到工具本身之中。即作者提出了一种从被动数据记录到计算引导学习的范式转变。通过利用商品设备(例如 iPhone)强大的本地计算能力,可以将传统上分离的采集者、训练者和测试者等角色统一起来,从而实质性地普及创建稳健机器人策略的能力

为实现这一愿景,作者提出了 RoboPocket(见图 1 右),这是一个系统,它将智能手机不仅作为传感器使用,更将其作为贯穿整个策略生命周期的智能副驾驶

具体而言,RoboPocket 解决了当前范式中两个关键脱节问题

  1. 首先,作者通过在手持端界面中集成设备端视觉反馈和快速验证机制,提高了数据采集的可靠性
    与将质量检查推迟到后处理阶段的被动记录工具(例如 UMI 5)不同,*RoboPocket提供诸如 SLAM稳定性和运动学可行性等实时反馈,使用户能够即时验证数据质量。*这一反馈闭环鼓励用户自我纠正并持续采集高质量示教数据,从而降低使用门槛,并提升整体数据采集过程的成功率

  2. 其次,更为重要的是,作者通过 AR 视觉前瞻(AR Visual Foresight)来弥补策略迭代(Policy Iteration)中的反馈缺口

    传统上,识别一个策略的薄弱环节需要将模型部署到真实机器人上并观察其失败过程,这一流程缓慢、危险且严重依赖具体场地
    RoboPocket 则能够以虚拟方式即时达成同一目标。通过将观测流式传输到推理服务器,并利用增强现实(Augmented Reality, AR)35 将策略的预期轨迹投影回用户屏幕,让用户能够在现实环境中"看见"机器人的"大脑"

    与此同时,数据上传与模型训练并行进行,最新模型会实时同步给用户

    这些能力共同实现了"无机器人即时策略迭代"(Robot-free InstantPolicy Iteration):用户可以在 AR 中可视化某种失败模式,立刻采集针对性的纠正数据,策略则用这些数据即时在线更新,全程无需接触任何实体机器人

1.1.2 相关工作

首先,对于操作任务的数据收集

  1. 遥操作仍然是获取高精度操作数据的主要范式。主从式系统(如 ALOHA 52,12 和 GELLO 48)通过耦合的硬件来记录细粒度的关节数据,而近期基于视觉的接口 39,4,7,49 则将操作员从笨重的主控制臂中解耦出来

    尽管这些方法可以确保高质量的执行,但它们本质上受制于机器人必须物理在场这一前提。高昂的硬件成本和缺乏便携性,使得将数据采集扩展到多样化、非结构化的"野外"环境面临巨大门槛,从而限制了所学习策略的泛化潜力 5

  2. 为克服以机器人为中心设置的局限性,近期研究逐渐转向以人为中心、面向真实环境(in-the-wild)的方法

    可穿戴外骨骼 9,10,8 和手持式夹爪44,5,25,26,3,47,45,46 消除了对实体机器人的依赖,使得在多样化环境中的可扩展数据采集成为可能

    值得注意的是,UMI 5 及其变体 25, 26 通过将基于 SLAM 的跟踪与柔顺夹爪相结合,建立了一种稳健范式,从而确保末端执行器位姿的高精度估计
    然而,一个关键鸿沟依然存在:这些便携式方案在很大程度上主要以开环(open-loop)方式运行。与机器人遥操作中操作者能够即时获得机器人执行反馈不同,当前的手持接口主要作为数据记录设备(例如,离线 SLAM 5 或开环记录 44

    缺乏实时策略反馈使得操作者无法进行交互式干预------而这正是纠正分布偏移的关键机制。相较之下,RoboPocket 引入了一种闭环(closed-loop)手持接口来弥合这一鸿沟,使得在真实环境中进行实时策略评估和高交互性的数据采集成为可能

其次,对于交互式策略学习与纠正

  1. 尽管行为克隆(Behavior Cloning, BC)能够有效利用离线数据进行扩展,但它从根本上受到协变量偏移(covariate shift)43 的限制,因此必须通过交互式纠正来应对分布外(Out-Of-Distribution,OOD)状态

  2. 诸如 DAgger 43,21,51,31,15 和真实世界强化学习(real-world RL)19,32,33,38,17,27,22 等方法在一定程度上闭合了这一循环,但在安全性和可扩展性两方面都面临一个根本性的"部署悖论"

    与可以轻松众包的被动数据集采集不同,交互式学习严格依赖于物理硬件。这导致了一个严重的瓶颈:收集纠正数据需要机器人无处不在地部署,然而,将尚未充分打磨的策略部署到多样且无结构的真实环境中,在后勤上几乎不可行,并且由于潜在硬件损坏风险过高而在安全上难以接受18

    因此,高频率的策略迭代被局限在结构化的实验室环境中,无法进行实现稳健泛化所需的大规模"野外"数据采集

    此外,现有的干预机制在策略意图方面缺乏透明度。在标准的共享自主控制 13,41 或交互式模仿学习 29,24,23 中,操作员无法看到策略所规划的轨迹。这迫使人类处于一种"观望"的角色:通常只有在机器人已经明显偏离轨迹或即将发生碰撞时才会触发干预。这种反馈滞后使得用户无法在错误发生之前纠正策略,从而++错失在关键决策时刻获取精确数据++的机会

  3. RoboPocket 通过将策略迭代与实体机器人解耦,打破了这种对硬件的依赖。通过在手持设备上以AR(视觉前瞻,Visual Foresight)的方式可视化策略的轨迹预测 ,作者的系统将纠正过程从对机器人的被动安全防护,转变为不依赖机器人的策略迭代

    由此解决了部署悖论:它使得在多样化环境中大规模收集富含交互的纠正数据成为可能,而无需一支实体机器人队伍,从而使用户能够在真实世界部署之前,主动发现并修复策略弱点

1.2 RoboPocket的系统设计

1.2.1 硬件架构

要从被动的数据记录过渡到由计算引导的学习,硬件必须扮演两个截然不同的角色:

  1. 一方面,它必须充当智能副驾驶,能够运行实时验证算法;
  2. 另一方面,它必须作为机器人的高保真"化身",以最大限度缩小领域差异

因此,作者的硬件设计遵循三个体系结构原则:

  1. 实时交互接口,用于实现主动引导
  2. 硬件同构性,用于确保物理一致性
  3. 感知完备性,用于获取策略学习所需的完整传感器信息

首先,对于实时交互界面

  1. 作者认为,封闭式闭环范式的基石在于从"记录"到"计算"的范式转变。故,作者使用一部商用的 iPhone Pro,不仅仅把它当作传感器的载体,而是作为高性能的边缘计算枢纽(Edge-Compute Hub)

    不同于 UMI 5 使用的 GoPro 等被动记录设备,iPhone 提供了运行同时进行的VIO(视觉---惯性里程计)、运动学求解所需的充足FLOPs(浮点运算能力),以及以 60Hz 频率进行的 AR 渲染

  2. 这部分富余的计算能力正是实现第 I 节中讨论的认知引导的关键:设备不仅仅记录用户行为,而且还能在实时过程中主动提供反馈。此外,高带宽网络与直观 UI 的原生集成,将采集端转变为一个自洽的工作站,无需连接 PC 即可完成远程策略推理与可视化

如原论文附录D所述,遵循数据缩放律 16,作者搭建了一套自定义的可移动升降工作台。如图 14 所示,该装置采用一台 FlexivRizon 4 机械臂 11,末端安装 Robotiq 2F-85 自适应夹爪 42,并通过一个 90 度转接头连接

  • 为保证与手持设备在物理结构上的同形性并维持自适应抓取性能,作者在机械夹爪上安装了与 RoboPocket 相同的 TPU 软指尖采集器
  • 值得注意的是,在数据缩放定律实验中(参见第V-B节和图6),作者使用了 DH-ROBOTICSAG-160-95 夹爪以及与之同构的手持采集器

    此外,在夹爪上安装了一个 iPhone 支架,通过 RoboPocket APP 将摄像头画面实时串流到工作站
  • 该工作站搭载Intel Core i9-12900K CPU 和 NVIDIA GeForce RTX3090 GPU,置于桌子下层的搁板上
    同时,该工作站也充当数据服务节点和训练服务器。整个系统由EcoFlow DELTA 3 MAX 便携式电源站供电。对于双手操作任务,可以并排布置两套此类平台,以支持双臂操作

至于在无机器人即时策略迭代过程中,作者使用另一台工作站作为推理服务器,其配置为 Intel Core i9-13900KCPU 和 NVIDIA GeForce RTX 4090 GPU

其次,对于同构自适应夹爪

以往的手持接口通常依赖于通用、体积庞大的平行夹爪 5,而作者的设计则面向 Robotiq 2F-85 42 自适应夹爪。且作者提出了一种以严格硬件同构为核心的设计,以尽可能减小在视觉和物理两个域中的具身差距

  1. 首先,为了在富接触交互过程中保证物理一致性,作者复现了夹爪的欠驱动动力学。不同于刚性手持工具,在远端关节中集成了一个预压缩的扭转弹簧,用以重现真实硬件中特定的被动自由度(DoF)
    这一设计使得采集到的数据能够自然而然地包含被动的手指形变------例如在非预期的表面碰撞或顺应性抓取过程中产生的形变------从而在推理时,使手持设备的动力学与机器人实际物理行为保持一致
  2. 其次,为了便于严格且大规模的数据采集,作者引入了一种基于杠杆的联动机制。该结构能够放大人手手指的输入,使用户在无疲劳的情况下,轻松施加并保持足够的抓握力

通过将这种在运动学上的高保真性与在视觉几何上与机器人精确网格完全匹配的设计相结合,作者确保所采集到的轨迹在视觉和动力学上都可以无缝迁移到目标硬件,而无需复杂的领域自适应。整个组件可以使用标准FDM工艺进行打印(物料清单成本约为70美元)

最后,对于感知完备性

机器人学习算法需要的传感器信息是标准智能手机无法完全提供的。作者对 iPhone 进行了增强,从两个关键维度上实现了"感知完备性"

  1. 视觉上下文扩展:智能手机相机的原生视场(Field-of-View,FOV)通常过于狭窄,不适合使用腕部安装相机进行操作任务 5,50
    对此,作者开发了一个定制的 3D 打印支架,并配合现成的鱼眼镜头,大幅扩展了视觉上下文,使其能够同时捕捉周围环境的边缘区域以及夹爪与物体之间的交互

  2. 夹爪宽度集成:为高保真地采集夹爪宽度,作者开发了一套基于 ESP32 的定制蓝牙接口。通过 1Mbps 的 RS485 总线集成磁编码器,系统在 30 Hz频率下实现了 0.088◦ 的角分辨率

    固件在 BLEGATT 之上采用轻量级的发布-订阅模式以实现低延迟传输,同时硬件设计保持可扩展性,以便未来集成更多传感器

1.2.2 软件架构:主动数据验证、时空同步

如原论文所说,软件流水线将边缘计算能力转化为数据质量和系统可扩展性。它充当一个主动的监督模块,通过两个核心机制确保普通用户采集的数据满足严格的学习标准:

  1. "主动数据验证",用于检查数据在物理和逻辑层面的有效性
  2. "时空同步",用于支持可扩展的多设备配置

首先,对于通过主动验证保障数据质量

为消除不可用数据带来的瓶颈,作者将实时监控与现场可视化反馈相结合,在采集过程中确保数据的有效性

  • 实时约束与反馈
    作者实现了一个多阶段监控模块,用于同时验证 SLAM 追踪的稳定性和运动学可行性

    首先,通过监测特征点密度和速度突变,在实时过程中评估 SLAM 的可靠性并检测SLAM 异常
    其次,一个运行在设备端的 IK 求解器(Jacobian DLS 34)持续地将夹爪的运动映射到机器人关节空间 ,以检查是否出现奇异位形或关节限位违反。触发这些警告的帧会被立即标记为"无效",并通过视觉/触觉反馈(见图 2b)在运行过程中引导用户调整到可行的轨迹

  • AR 轨迹回放
    算法检测由"++AR 轨迹回放++ "功能加以补充。通过在真实世界视图上渲染末端执行器的轨迹(见图 2b),用户可以在执行结束后立即回顾记录下来的轨迹


    这使得用户能够从视觉上验证SLAM 的精度(确保数字化运动与其物理操作相一致且不存在 SLAM 漂移),以及逻辑上的成功(例如,抓取是否稳定

  • 闭环用户自适应
    至关重要的是,该验证机制建立了一个紧密的反馈回路,为操作员提供隐式训练信号。通过实时可视化失败模式(例如SLAM 异常),普通用户可以主动调整其数据采集策略,从而降低数据废弃率并提升高质量数据的吞吐量

其次,对于多设备时空同步

为了从单臂扩展到双臂配置,作者采用软件定义的协议来实现严格对齐

  1. 空间对齐是通过 ARKit 1 中的点对点地图融合协议完成的,设备之间交换世界地图以建立统一的"世界坐标系"
  2. 时间对齐则采用低延迟网络协议,将各设备的内部时钟同步到 5ms 的精度

由此确保在多机械臂学习场景中,所有传感器数据包(图像、位姿、夹爪状态)在时间和空间上都得到严格对齐

1.3 无机器人即时代策迭代

1.3.0 问题表述

如原论文所述,驱动作者系统设计的核心研究问题是:如何高效地收集机器人实际所需的特定数据分布?

类似很多问题一样,作者

  • 将机器人操作任务形式化为一个由元组定义的马尔可夫决策过程(MDP)
    标准模仿学习(IL)利用一个静态数据集来训练策略,以最小化与专家分布的差异

  • 然而,由于长时间跨度任务中固有的误差累积,策略必然会因为协变量偏移而遇到分布外(OOD)状态
    形式上,令为由策略π 诱导的状态分布

    其目标是在该诱导分布下最小化损失:

进一步而言

  1. 传统的交互式方法,如DAgger 43,通过聚合策略内数据来覆盖诱导的状态空间以解决这一问题。然而,这些方法通常需要实际机器人执行来生成,这既昂贵又带来安全风险

    此外,标准的数据收集流程以"批处理"的方式运行------在重新训练之前先收集完整的数据集------这切断了操作者理解当前策略能力所需的即时反馈回路

  2. 作者认为,他们提出的解决方案 RoboPocket 通过建立一个无需机器人参与的即时反馈回路(见图 3)弥合了这一鸿沟

    通过可视化策略的意图并实时更新模型参数,使操作者能够直观地从状态空间中那些当前策略表现不足的关键区域进行采样

    无机器人即时策略迭代概览
    (左)借助 AR 视觉预测(AR Visual Foresight),用户在真实环境中识别策略弱点(OOD 状态)和潜在的前瞻性故障,从而立即改进策略
    (右)采集到的纠正数据会被立即流式传输到 Data ServingNode。Training Server使用加权采样(RLPD)进行在线微调,并将更新后的权重推送至 Inference Server。改进后的策略预测结果以实时方式(<150ms)回传到 iPhone,使得在几分钟内即可实现持续的、无需机器人的策略改进

1.3.1 无机器人远程推理

为在没有物理硬件的情况下进行策略评估,作者设计了一种低延迟的服务器-客户端(Server-Client)架构:

  1. 远程推理 :iPhone 作为用于观测流式传输和可视化的轻量级客户端
    作者将推理任务卸载到配备GPU 的远程推理服务器上
    初始化时,推理服务器为该客户端建立一个专用会话,并加载对应的模型检查点和配置
    在运行过程中,客户端将观测数据以流的形式发送到服务器。通过在服务器端保持持久的模型状态,在标准 Wi‑Fi 环境下实现了往返推理时延低于 150ms,从而保证了流畅的用户体验

  2. AR 可视化前瞻与游戏化数据采集 :为使策略意图对非专业用户也具有可解释性,使用增强现实(AR)将预测轨迹投射到真实世界中。更多细节请参见附带视频

    具体而言
    畸变感知渲染:由于相机使用了鱼眼转接头,标准的 AR 渲染会出现错位
    作者基于已标定的相机内参,应用实时顶点位移机制,以确保虚拟轨迹(以一串"金币"路径进行可视化)在视觉上与发生畸变的真实物理世界对齐

    视觉前瞻:AR 界面充当一种"视觉前瞻"。用户在游戏化的引导下沿着硬币路径前进。当设备到达当前动作视界的末端时,系统会自动捕获当前观测,并触发下一次推理查询

  3. 主动干预 :作者的设计做出的一个关键贡献是"主动干预"机制
    即设计了一个物理按钮,使用户可以在任意时刻强制触发一次新的推理查询

    在传统遥操作中,人类是在机器人失败之后进行被动干预。在作者的无机器人设置中,用户通过与策略的反复交互,逐渐识别出当前策略固有的薄弱环节。该物理按钮使用户能够自然地在策略状态空间的"薄弱"区域中进行探索并收集数据,从而有效地执行无机器人主动学习

1.3.2 即时策略迭代

虽然 DAgger 在理论上是完备的,但其在实际中的效率常常受到训练周期离散性的限制。用户通常并不知道在什么时候已经收集了足够的数据来修复某一个特定的失效模式

为了解决这一问题,作者实现了一个连续的、异步的在线策略迭代(Online Policy Iteration)框架。除了推理服务器之外,后端还包括两个额外的服务:数据服务节点(Data Serving Node)和训练服务器(Training Server)

其具备以下三个特点

  1. 实时上传:当用户在RoboPocket 上收集数据时,轨迹会立即上传到数据服务节点

  2. 在线微调 :训练服务器持续监控数据集
    当检测到新的on-policy 数据时,它会使用加权采样策略更新策略,类似于RLPD 2
    关于RLPD,详见本博客中的解读《RLPD------利用离线数据实现高效的在线RL:不进行离线RL预训练,直接应用离策略方法SAC,在线学习时对称采样离线数据》

    且通过从原始离线数据集中采样50 %,以及从新收集的在线数据集中采样50 % 来构建每一个训练批次。这一做法在积极拟合新的故障纠正数据的同时,避免了灾难性遗忘

  3. 实时模型分发:周期性地(例如,每隔N 步),更新后的模型权重会被同步到推理服务器

该架构在数分钟内就能形成一个紧密的反馈循环:用户观察到一次失败,收集纠正数据,然后由 AR可视化结果反映了更新后的策略在行为上的改进。这种几乎即时的正向反馈显著提升了数据收集效率和用户参与度

1.4 实验

在本节中,作者从三个关键维度对 RoboPocket 进行实证评估:硬件-软件系统保真度、策略学习中的数据效率,以及在分布式真实环境(in-the-wild)设置下的可扩展性

所有真实世界的机器人实验均使用 Flexiv Rizon 4 11 机械臂和 Robotiq 2F-85 42 夹爪进行。且使用 DiffusionPolicy 6 并配合 CLIP 40 或 DINOv2 36 编码器来训练所有模型

1.4.1 实验设计概述

作者的评估分为三个部分:

  1. 系统能力验证
    首先验证 RoboPocket作为一款野外(in-the-wild)数据采集设备的基础能力
    这包括量化轨迹跟踪精度、分析采集效率,并验证通过该系统采集的数据是否符合既有的数据缩放定律(Data Scaling Laws)16
  2. 通过即时迭代突破数据扩展规律
    研究本工作的核心假设:所提出的无机器人即时策略迭代(Robot-Free Instant Policy Iteration)是否能够打破传统数据扩展所面临的收益递减问题?
    且作者在四个具有挑战性的操作任务上,将该方法与性能强劲的基线方法进行对比,这些任务具有长时间跨度、不同的物体动力学特性以及可变形物体
  3. 可扩展且具备泛化能力的策略迭代
    最后,作者展示该系统的分布式能力。即在多个环境中部署一批RoboPocket 设备,以验证即时迭代闭环是否同样能够在不同场景和用户之间促进高效且有效的策略自适应

1.4.2 系统能力验证

作者首先评估 RoboPocket 是否满足高质量机器人数据采集的各项需求

  1. 定位精度与跟踪稳定性
    为了测量跟踪精度,作者将RoboPocket 设备刚性固定在机器人末端执行器上

    如图5 所示,在单设备设置下,平均累积3D 欧氏误差为2.8mm,旋转误差为0.4°,在UMI 5 中优于标准惯性-单目SLAM 系统(6.1mm, 3.5°)


    在采用作者共享地图软件同步的双设备设置下,位置误差为4.0mm(峰值7.5mm),旋转误差为0.7◦

    在无纹理环境(例如白色桌面)中,作者观察到VIO 漂移率上升
    然而,RoboPocket的实时界面通过可视化的" 跟踪状态" 指示器成功标记了这些无效帧。这确保了保留下来的轨迹具有高保真度和运动学一致性

  2. 采集效率与数据质量
    作者开展了一项对照用户研究,将 RoboPocket 与标准的手持式采集流程(UMI 5)进行比较。参与者执行"调味料倒入"任务以收集 10 条演示数据

    然后对时间成本和数据质量指标进行了分析:
    效率:使用 UMI 采集 10 条轨迹的单轮周期时间为:采集 8 分 34 秒,传输 1 分 24 秒,SLAM 处理 9 分12 秒
    相比之下,RoboPocket 采用在线 SLAM,不需要单独的数据采集用于建图或离线 SLAM 计算。因此,它只需要 3 分 51 秒进行数据采集和 1 分 37 秒进行数据传输

    数据质量:在 UMI 中,9 次成功试验里有 2 次在卡尔曼滤波之后出现明显的位置跳变。此外,由于跟踪抖动,每条轨迹在相邻帧之间都包含超过15m/s2 的加速度尖峰。相比之下,RoboPocket 的传感器融合没有产生任何位置跳变,并保持在物理上合理的加速度范围之内

  3. 数据缩放律验证
    为确认我们的数据适用于大规模学习,我们针对"MouseArrangement"(鼠标摆放)任务,在 64 组不同的环境-物体组合上收集了 1,600 条示教数据。如图 6 所示,该策略在 OOD 场景下的成功率与数据多样性呈现出与文献 16 中相同的幂律关系,这验证了RoboPocket 是一个可用于扩展机器人学习的有效平台

1.4.3 超越模仿学习的数据缩放定律

标准行为克隆(Behavior Cloning)受到协变量偏移(covariate shift)的影响,即便加入更多专家数据,性能也会趋于平台期、难以继续提升

而作者认为,他们的无机器人即时策略迭代(Robot-Free Instant Policy Iteration)方法可以通过收集有针对性的"失败恢复"数据来打破这一天花板

首先,对于任务设置与基线

如图4所示,作者在四个具有不同挑战的任务上评估了性能:

  1. 积木分类 :一个长时间跨度的任务,要求机器人根据颜色对应关系将积木分类放入不同的盒子中
    挑战:该任务具有严格的顺序依赖性,策略必须在较长的时间跨度内持续跟踪任务进度
  2. 调料倒取 :机器人必须按顺序抓取三个调料罐并将其中的调料倒在盘子上
    挑战:这需要大幅度、强烈的腕部旋转。模型必须在执行大范围旋转之后,仍能保持精确的 TCP(工具中心点)定位能力
  3. 毛巾折叠 :机器人需要抓取毛巾的特定角并进行折叠
    挑战:这考察对可变形物体的感知能力。策略必须仅凭像素信息推断布料各部分的语义含义,以识别正确的抓取点
  4. 零食装袋 (双臂):这是一个双臂任务,机器人需要协调两只机械臂将零食拾起并放入袋中
    挑战:这要求双臂都具备精确的定位能力,以实现高效的双臂协同

然后作者将他们的无机器人即时策略迭代方法(IL + Instant PI)与三种基线策略进行对比:

  1. 仅 IL:在大小为 N = 100、200、300 的固定预采集数据集上进行训练
  2. IL + 手动PI:专家手动分析机器人失败的视频,并收集若干(25 或50)有针对性的纠正示范
  3. IL + 离线PI:用户使用RoboPocket 的AR 反馈循环收集若干(25 或50)纠正示范,但使用的是固定的预训练模型

其次,对于结果与分析

结果如图7所示

  1. 方块排序 :纯 IL策略经常以错误的顺序执行排序。虽然所有 PI 策略的表现都优于纯数据缩放,但作者的方法在未使用实体机器人情况下,获得了与"IL + 手动 PI"相当的结果
    这表明作者的系统能够有效暴露在在真实环境中的失败模式,从而引导用户采集必要的校正数据

  2. 调味味品倒入 :纯IL 在第一次倒入后,由于大幅旋转导致的OOD 状态,往往无法在第二个罐子上正确重新定位

    作者宣称,他们的方法在使用更少数据的情况下,达到了与300 次IL 相当的效果。值得注意的是,IL + Instant PI 的方差(0.08)显著低于IL + Offline PI(0.30)
    这表明++在线反馈++使数据采集者能够实时了解模型的能力,从而在采集过程中避免大的错误

  3. Towel Folding :纯IL 在理解可变形物体的语义组成部分时存在困难,导致抓取点错误。关键的是,IL + ManualPI 导致性能下降(0.73 →0.50),只有作者的IL + InstantPI 实现了稳定的提升(0.88)
    这可能是因为对可变形物体的感知本身就非常具有挑战性,引入不准确的数据实际上会降低性能。因此,实时的策略更新以及获取策略的意图对恢复数据的收集至关重要

  4. 零食装袋 :纯模仿学习(Pure IL)会遭遇左臂抓取失败,或右侧腕部摄像头视野被遮挡的问题。因此,要在双臂任务上获得高精度通常需要海量数据
    然而,作者的方法使用户能够有针对性地专注于存在歧义的特定区域,从而高效地超越了 300 条 IL 数据的基线表现(0.56 对比 0.51)

1.4.4 可扩展且具有泛化能力的策略迭代

最后,作者验证系统在"真实环境(In-The-Wild)"中的可扩展性和泛化能力。作者的目标是在多个场景下收集数据,并利用 Robot-Free Instant Policy Iteration 来同时获得显著的性能提升,包括作者认为,他们的分布式车队管理系统也带来了性能提升

  1. 设置:四个数据采集端在四个不同房间(场景1-4)中进行数据采集和策略迭代
    首先,收集100个方块排序(Block Sorting)任务的演示数据(每个房间25个),用于基础策略训练
    然后,每位用户在无机器人即时策略迭代(Robot-Free Instant Policy Iteration)的模式下,同时收集12个演示数据

  2. 结果:如图8 所示,基础策略在一些困难环境中表现不佳(例如,场景2 成功率:0.42)

    然而,通过启用IL+ Instant PI,用户能够在各个环境中快速改进策略。每个场景仅需12 次交互,成功率就有了显著提升(场景2:0.42 →0.82,场景4:0.52 →0.81)
    这一结果凸显了RoboPocket 的关键优势:当扩展离线数据因难以覆盖各类场景中的失败模式而遇到瓶颈时,RoboPocket允许进行分布式且高效的微调。通过将策略迭代循环置入一个口袋设备中,使得能够在多样化的真实世界场景中,以极小的开销实现鲁棒的泛化能力

1.4.5 结论与局限性

RoboPocket通过利用 AR 视觉前瞻,使得非专业用户也能够发现策略弱点并给出有针对性的纠正,而无需对实体机器人进行现场监管

且实证结果表明,相较于开环基线,这一范式在集中式与分布式环境中都符合数据缩放定律,并将数据效率提高至多 2 倍

然而,仍然存在若干局限性

  1. 首先,尽管硬件在结构上与标准工业夹爪同构,但并行夹爪的设计限制了其在需要高灵巧度手内操作任务中的适用性

  2. 其次,尽管系统具有便携性,但当前的手持装置整体仍然较为笨重,可能会导致使用者在长时间的数据采集过程中容易疲劳

    未来的研究方向包括探索更加自然且轻量化的人机交互界面,例如第一人称视角的 AR 眼镜,以进一步减轻物理负担,并为通用型机器人学习构建一个无缝、以自我为中心的反馈循环