ENPIRE——Agent驱动的机器人策略自我改进(具身RSI的代表之一):自动奖励验证、自动复位、无人值守的策略迭代

前言

通过本博客中的此文《π∗0.6------通过RL框架RECAP微调流式VLA π0.6:先基于示教数据做离线RL预训练,再SFT(即IL微调),最后在线RL后训练(与环境自主交互,从经验数据中学习,且必要时人工干预)》,可知在通过π*0.6做真机RL迭代的时候,数采时还需通过人工打标(标注成/败)的方式,给予模型反馈,那对于一些不那么复杂的任务,是否可以做到自动给奖励反馈呢

这就是本文要介绍的ENPIRE,其与π*0.6的本质区别如下

具体而言,ENPIRE是一个面向编码智能体的控制框架,通过四个核心模块具体实现这一物理反馈流程:

  1. Environment 模块(EN),用于自动重置与结果验证;
  2. Policy Improvement 模块(PI),用于启动策略改进;
  3. Rollout 模块(R),用于在单个或多个并行运行的真实机器人上评估策略;
  4. 以及 Evolution 模块(E),在该模块中,编码智能体分析日志、查阅文献、改进训练基础设施与算法代码,以应对各类失败模式

这个闭环系统将真实世界的机器人学习转化为一个可控的优化过程,由智能体进行管理,从而最大程度减少人类参与,同时在不同训练方案与智能体变体之间实现公平的消融对比

此外,在π*0.6论文原文中,还提到了R3L,具体而言

  • 84R3L(2020,真机 RL 的工程要素)------目标和 ENPIRE 几乎一模一样:让机器人在真实世界"无需手工设计复位、只靠机载感知、无需手工奖励函数"地持续学习,最终三指灵巧手完全无人干预学会多种视觉技能

    区别在于:它的自动奖励、复位机制、安全约束全是人手工为每个任务搭的系统工程,而且只解决"怎么无人跑起来",不涉及自动改进训练算法

  • 而 ENPIRE 的质变在于------连"搭建自动化设施"这件事本身也自动化了(coding agent 按任务合成验证器/复位程序/安全约束,人工只给几分钟示范+指标要求)
    并且多了 Evolution
    模块去迭代训练算法本身

当然了,具身 RSI 的天然优势是"物理执行反馈"可以自动拿到,所以 ENPIRE 类工作把可程序验证 + 可程序复位 当作能否进入自动闭环的分水岭------能过的走 agent 环,过不去的(柔性体、液体、长程任务)目前还是 RECAP 式人工兜底最通用

第一部分 ENPIRE: Agentic Robot Policy Self-Improvement in theReal World

1.1 引言与相关工作

1.1.1 引言

在迈向通用物理智能的道路上,自动学习灵巧操作技能一直是一个重大障碍。当前最前沿的策略训练方法虽然极其高效,但在数据收集、带复位的评估以及算法调参与更新的整个生命周期中,仍然需要人类在幕后参与(19; 20; 24)。随着现实世界策略学习规模的扩大,人类对策略改进过程的"看护"劳动不可避免地成为限制机器人获得灵巧能力速度的关键因素之一

由编码智能体驱动的最新自主研究(22)(autoresearch)进展,为实现算法改进自动化展示了一条前景可观的路径。然而,当作者将这一范式扩展到自动化现实世界的策略学习时,会出现独特的挑战

  1. 首先,编码智能体缺乏一套用于在物理世界中进行闭环假设检验的现实世界环境接口,而这需要实现策略的自动化部署、评估以及场景重置
  2. 其次,当在机器人集群规模上扩展 autoresearch的吞吐量时,如何在保持资源利用效率的同时选择和验证假设,仍是一个尚未解决的开放问题

为了解决这些挑战,来自的研究者提出了 ENPIRE,这是一种智能体调度框架,利用一组自主的环境接口,实现可扩展的实体自动化研究(physical autoresearch)『ENPIRE 先通过工具调用,++根据人类反馈构建一个具备自动复位与自动验证机制++的环境。接着,编码代理(coding agent)调用环境 API 开展自研究(auto research),并基于真实世界的奖励信号采用爬山法逐步提升策略的成功率』

ENPIRE 将灵巧操作技能的获取分解为两个自动化研究过程

  1. 在第一阶段(EN in ENPIRE),编码智能体根据人类反馈构建一个自主环境接口。通过这一初始研究闭环,智能体实现并优化一套程序化的工具调用,用于为特定任务建立安全边界、自动复位以及验证流程
    它们在离线条件下一次性优化,仅需一次性部署成本;一旦定型,这些接口就作为不可变的 API,在后续阶段被反复复用
  2. 第二阶段(PIRE in ENPIRE)则过渡到一个完全自主的自动化研究过程,在这一阶段,编码智能体基于真实世界反馈不断改进策略
    在完全由环境自动化验证信号指引的条件下,智能体自主探索和优化多种方法论,在无需人工干预的情况下最大化真实世界任务的成功率

1.1.2 相关工作

1.2 ENPIRE的完整方法论

总之,作者提出了一种用于让编码智能体在物理世界中执行自动化研究的测试框架设计。该流程被分解为两个阶段:基于人类反馈的环境构建(EN in ENPIRE)以及基于真实世界反馈的自动策略改进(PIRE in ENPIRE)

1.2.1 阶段一:基于人类反馈的环境构建

为了使编码智能体能够开展自主的物理自我研究,作者首先需要将物理交互与反馈抽象为一种对智能体友好的结构化环境。这一环境应包含任务相关的安全约束以支持长期运行、用于反馈与奖励/责任分配的实时自动化验证流程,以及确保快速迭代的稳健自动复位机制

为提升系统可靠性,智能体通过过程化工具调用来构建环境 API,并根据人类评估结果不断改进其实现。人类投入仅为一次性成本,随后在下节(对应于原论文第2.2节)所述的自动策略改进过程中,这一成本将被摊销到所有机器人上的全部实现之中

首先,对于硬安全约束

作者将机器人的构型空间和运动学行为限制在安全的操作范围内。这些安全区域既足以完成任务,又作为硬性约束存在:一旦违反这些限制,将立即判定任务失败并触发自动重置

这样既为真实环境中的交互提供了安全防护,同时也作为回合终止或截断的触发来源

其次,对于自动化验证

  1. 在真实世界实验中,机器人学习需要依据传感器输入进行实时验证,以量化实验进展
    为尽量减少人工工程工作量,编码智能体负责通过过程式工具调用合成一个二值奖励函数,用于区分任务结果
    在仅给定几分钟的成功与失败示范的情况下,这些智能体利用视频和本体感知(proprioception)记录,在降低处理时延的同时最大化预测准确率评分
  2. 例如,autoresearch 会为插销任务发现一个鲁棒的奖励函数,该函数基于视觉对齐、末端执行器高度以及力估计
    编码智能体在 Fig. 4 所示的扎带(zip-tie)插入任务中也展现了其设计依赖感知的奖励函数的能力

最后,对于自动复位

  1. 一旦某个任务完成或失败,智能体就会执行一系列工具调用,将环境恢复到其初始状态。对于高接触任务,作者借鉴 CaP-X (15) 中的思路,使用过程化的工具调用,并利用模块化操作技能将环境直接重置到任务中最具挑战性的阶段起点

    通过将机器人精确地定位在关键动作(例如插入销钉、安装 GPU、或抓取剪刀)的起始时刻,作者就能有策略地将学习系统的注意力集中在这些对精度要求极高的瓶颈环节上

  2. 安全约束、自动化验证以及自动化重置共同构成了他们的环境模块(即 ENPIRE 中的 EN)。策略还会接收视觉-本体感受传感器输入,并向机器人控制器提交动作指令,这些指令与作者的奖励函数一起构成了 Rollout 模块(即 ENPIRE 中的 R)
    在构建完成后,代码生成代理可以通过不可变的 Gym API (7) 访问这些模块,从而获得反馈信号和调试信息,以实现策略的自动化改进

1.2.2 阶段二:基于真实世界反馈的自动化策略改进

第二阶段利用自动化研究来为特定任务训练一个策略。在初始化时,编码智能体会接收到任务描述,其最终目标是通过自主试验最大化该任务的成功率。为此,智能体被授予对一个精简训练代码库的写入权限,该代码库支持基础的端到端策略训练以及基于代码的策略综合

首先,对于一个激励性示例

  1. 以插销任务为例来演示这一过程:策略需要将插销插入到间隙只有 4mm 的紧配合孔中(图 2)

    在这一自动化研究阶段,智能体通过一个策略改进模块(PIinENPIRE)运行,在其中查阅相关文献以生成洞见、提出假设,并直接修改训练代码------例如行为克隆或强化学习(RL)算法------从而根据真实世界的自动验证结果来优化性能
  2. 为了收集丰富的证据,智能体调用环境 API,在多次 rollout 过程中记录机器人轨迹、视频录制以及回报信号,并检查这些统计数据以指导后续的持续改进

其次,对于通过多智能体扩展加速自动化研究

  1. 虽然自动复位和验证机制提高了单一部署循环的可扩展性,但通过启动并行的、多智能体的去中心化协作协议,还可以进一步加速物理层面的自动化研究

    该协议在 N 台实体机器人上部署 N 个智能体,以异步方式测试 N 个假设。每个智能体都从同一套基线策略训练代码库分支出来,并通过 Git 自主协作,以扩展该进化模块(EinPIRE)

    在无人为干预的情况下,智能体会自发地从其他智能体中"挑拣"(cherry-pick)、复制或合并成功的训练配方,以优化其代码搜索

    作者指出,实证上,他们观察到,随着并行的"智能体-机器人"对数量的扩展,用于发现高成功率策略配方的实际耗时被大幅缩短,如图 3 所示


    即ENPIRE 使最先进的编码智能体能够在 Push-T 和 Pin Insertion 任务上实现自主策略改进。ENPIRE 还能随资源规模扩展:随着机器人智能体工作进程数量的增加,实现相同任务性能所需的实际运行时间会减少

  2. 为量化编码智能体将其分配到的物理资源转化为研究进展的效率,作者提出了两种补充任务级结果的利用率指标

    平均机器人利用率(MRU)指的是在研究的实际墙钟时间中,机器人实际执行实验的时间所占的比例
    GPU 利用率则是指在研究的实际墙钟时间中,GPU 实际处于使用状态的时间所占的比例。一个在资源上完全饱和的智能体会将这两个指标都推向 1;但在实际中,对于作者评估的任何前沿编码智能体,这两个指标都没有达到该值

    为了衡量一个智能体团队将tokens 转化为成功机器人策略的效率,作者将平均 token 利用率(MTU)定义为整个机群在自动化研究过程中消耗的平均 token 数。然后我们计算 token-成功比,以体现任务学习的 token 使用效率

    关于随着智能体团队规模变化,机器人与 token 利用率如何变化的实证结果如图 7 所示

// 待更