VLA-Precision——用于在线RL的VLA非对称协同自举方法:以人工纠偏行为克隆提速、渐进价值校准稳策、相对优势更新防漂移

前言

我司七月具身,在通过真机RL挑战电源精细插拔100%成功率的路上,于26年9月2日的第五轮终于迎来里程碑的突破,不断变换插座位置,连续8次 插入成功

  1. 影响插拔100%成功率的因素太多了,特别是数据质量 包括sft和rollout数据质量,其次算法实现 光线的影响 必要的工程优化
    此外,即便在办公室达到了100%,不代表在产线上依然能达到100%(产线上得做更多努力)

  2. 我司长期投入/优化,不断提升的场景包括:上下料、质检、搬运、分拣、插拔、装配
    既然未来2-3年内,具身模型通用不了(当然 说给投资人 则是另一码事)
    那不如先在垂直场景里做到垂直下的智能/泛化

    如果足够敢挑战 足够敢努力,欢迎加入我们
    持续长期做『利于生产力且足够有价值』的事情,把"改变世界"落实成:实际行动,有意加入者 敬请私我,未来许多年,皆长期有效

正因为我司长期关注插拔装配,故也关注到了本文要介绍的VLA-Precision

第一部分 VLA-Precision: Asymmetric Co-Bootstrapping for EfficientReal-World Online RL of Vision-Language-Action Models

1.1 引言与相关工作

1.1.1 引言

如原论文所述

  1. 行为克隆(Behavior Cloning,BC)通过学习示例中密集标注的动作标签,直接获取任务行为,但一旦偏离示例分布,误差会逐步累积,且其性能始终受限于示例数据的质量
  2. 相比之下,强化学习(ReinforcementLearning,RL)利用时间信用分配(temporal creditassignment),通过交互来学习长期动作价值

因此,将 RL 应用于 VLA 的后训练阶段,可以通过交互产生的回报信号持续优化策略,从而减轻误差累积问题,并突破由示例数据所施加的性能上限

为实现这一目标,现有工作已经探索了基于仿真和真实世界强化学习(RL)的 VLA 后训练方法4--6

  1. 基于仿真的 RL 支持大规模并行且对失败具有容忍度的交互,在不受真实机器人物理约束的前提下,实现可扩展、低成本的策略优化

    然而,视觉观测与接触动力学上的"仿真到现实"(sim-to-real)差距限制了策略向物理机器人的可靠迁移78

  2. 相比之下,真实世界 RL 通过与物理环境的直接交互对 VLA 进行优化,使策略能够适应真实世界的动力学特性及传感器噪声

    现有真实世界 RL 方法按模型规模大致可分为两类:
    面向大规模预训练 VLA 的 RL 方法9--11
    以及面向紧凑型机器人策略的 RL 方法12--14

尽管取得了上述进展,真实世界的 VLA-RL 仍然受到两个关键瓶颈的制约:

  1. 算法稳定性:不可靠的价值估计可能导致策略漂移
  2. 系统效率:大规模 VLA 带来的计算开销限制了训练吞吐量,降低了整体在线 RL 效率

具体而言

  1. 为缓解算法层面的瓶颈,现有方法14--16通过引入基于示范或干预的行为克隆(behavioral cloning)约束来正则化 RL 更新。虽然这些约束能够保持既有行为并稳定探索过程,但对价值估计的改善有限。因此,RL 更新仍然容易受到价值估计误差和策略漂移的影响
  2. 针对系统层面的瓶颈,现有方法121415依赖于高度依赖重放的优化过程,其在大规模 VLA 场景下的计算成本会显著增加,从而限制训练吞吐量
    真实世界的在线交互则进一步放大了这一计算负担

上述限制突显出:要在真实世界中对大规模 VLA 进行后训练,亟需更加可靠的RL 算法以及更高效的训练系统

对此,来自1中国科学技术大学 2精密与智能化学国家重点实验室、3北京航空航天大学、4中关村学院、5合肥斯平科技术公司的研究者提出了VLA-Precision

具体而言,为了解决第一个算法层面的问题,作者提出了非对称协同自举(Asymmetric Co-Bootstrapping,ACoB),这是一种面向真实世界的在线RL算法,将快速的行为学习与跨时间尺度的渐进式价值校准相结合

  1. 在较快的时间尺度上,基于干预引导的行为学习能够快速吸收成功的、由人类执行的动作,加速策略改进的同时,持续提升在线交互体验的质量

    与此同时,随着自主交互经验的不断累积,整体回报传播与局部偏好排序持续校准价值估计。由此得到的相对动作优势用于指导基于参考正则化的策略改进,在保留已学到任务特定能力的前提下抑制策略漂移

  2. 这种非对称的交互机制在不同时间尺度上形成了一个协同自举闭环:快速的行为学习持续改进支撑价值估计的经验,而日益可靠的价值估计则在超出直接监督范围之外引导策略更新

为了解决第二个系统层面的问题,作者提出了 ACoB-Stream,这是一种用于真实世界大规模 VLA 在线强化学习的闭环"经验--策略"架构。在不变状态解耦和按需流式传输的指导下,ACoB-Stream 在四个阶段中联合管理经验上下文状态和策略状态的生命周期:

  1. 经验上下文生成
    通过在多次更新之间保留冻结的 VLM 上下文,减少策略更新过程中的冗余计算
  2. 经验上下文持久化
    通过上下文去重和滑动窗口采样,降低存储冗余,并在经验不断累积时限制随机访问开销
  3. 经验上下文访问
    通过与目标对齐的上下文检索,在优化过程中提升数据访问效率
  4. 策略状态同步
    通过可训练子空间的策略发布,降低同步开销并加速策略部署

这四个阶段共同构成一个闭环的"经验--策略"流,在受限算力和内存条件下,降低真实世界在线强化学习的端到端系统开销

1.1.2 相关工作

首先,对于基于仿真的RL用于 VLA 训练后阶段

RL有望在视觉--语言--动作任务中突破由示范学习所施加的性能上限(VLA)模型通过奖励驱动的探索和时间维度的信用分配来进行训练

  1. 基于仿真的强化学习(RL)通过大规模并行交互,在无需真实机器人训练成本和安全风险的前提下,实现高效、高吞吐量的 VLA 探索 17--19

    在最早的一些研究中,RIPT-VLA20 将动态 rollout 采样与 leave-one-out优势估计相结合,从而将一次性成功率从4 % 提升至97 %
    而VLA-RL 7 将轨迹级RL 与过程奖励相结合,使性能比微调高出4.5 个百分点

    一个受控的VLA 基准测试21 表明,RL 主要增强语义泛化和执行鲁棒性

    后续工作拓展了任务和策略的覆盖范围
    SimpleVLA-RL 22 结合VLA 特定采样与并行渲染,将LIBERO-Long 23 从17.1 % 提升至91.7 %
    而RLinf-VLA 8 协调异构工作负载,实现最高2.27× 的加速
    对于基于流的策略,πRL 24 构造可处理的似然函数,将成功率最高提高31.0 %

  2. 最新工作则以物理迁移为目标
    RL-Co 16 使用真实示例对基于仿真的RL 进行正则化,使真实环境中的成功率分别提高24 % 和20 %
    而WoVR 25 通过控制想象中的动力学来提升跨机器人平台的成功率

尽管这些方法减少了真实数据需求,但仿真到现实的差距仍然限制了迁移的可靠性。真实世界中的RL 将自主试错建立在真实观测和动力学之上,将预训练的VLA 能力转化为精确、可靠的执行。这个优势促使作者将重点放在真实世界VLA 后训练上

其次,对于面向 VLA 后训练的真实世界RL

通过从物理交互中学习,真实世界的RL 将策略适配到实际传感与动力学,从而提高在部署条件下的可靠性。用于紧凑机器人策略的RL 推动了高接触和动态操作的发展26-30

  1. HIL-SERL12 通过基于干预引导的在线RL,在1-2.5 小时内达到近乎完美的成功率,但在任务内泛化方面有限

    ConRFT14 通过在Octo 表示31 上进行离线到在线RL,在45-90 分钟内达到96.3 % 的平均成功率,但Q 最大化会牺牲先验性能并导致策略漂移
    Robo-Dopamine32 为ConRFT 配备了一个基于进展的大型奖励模型,但分布外幻觉可能会误导优化

    RL-10013 将离线到在线RL 应用于扩散策略,但收敛缓慢,每个任务平均需要12.1 小时的真实机器人回合,其中6.8 小时为离线,5.3 小时为在线

  2. 这些权衡促使人们研究用于大规模预训练VLA 的RL,它们保留了更广泛的动作先验。π∗0.6*9通过批量价值标注和优势条件再训练,在大多数任务上成功率超过90 %,但平均每个任务需要超过1,000 次真实机器人回合,严重限制了反馈效率*
    RL Token*11 将关键阶段的吞吐量加速至多3×,但每个任务需要400-1,000 个在线episode,而外部化的改进和策略接力限制了端到端的适应能力*

    不同于以往方法,ACoB 建立在大规模预训练VLA 之上,将快速行为学习与渐进式价值校准相结合以抑制策略漂移,并开发了ACoB-Stream 以构建高效的真实世界连续在线RL 闭环

最后,对于面向 VLA 模型的高效在线RL系统

高效的在线强化学习必须缩短闭环的"经验--策略"循环

  1. 基于仿真的 VLA-RL 系统会对多模态解码进行批处理、并行化渲染,并且协调异构工作负载,从而实现最高达 2.27× 的加速7, 8,22
    然而,大规模并行且快速的可重置模拟器无法直接迁移到真实世界的在线强化学习

    对于紧凑型策略,异步 actor--learner 系统通过将物理交互与重放优化重叠来提高吞吐量123314
    然而,这种效率并不能扩展到大规模预训练 VLA,因为大规模优化会带来更高的计算、状态管理以及同步成本

  2. EXPO-FT10 和 RL Token11 分别通过优化残差动作编辑以及轻量级token 条件策略,来避免将强化学习梯度反向传播穿过 VLA

    这样一来,基于奖励驱动的改进被限制在辅助策略上,需要单独的编辑器或切换逻辑,且在任务规模扩展时,无法将这些改进累积到统一的策略中

  3. SOP34 和 USER35 分别通过机器人车队编排以及异构云--边缘基础设施,将真实世界在线学习扩展到更大规模
    此类横向扩展在增加机器人和加速器数量以提升吞吐量的同时,并未减少每次更新中大VLA 的计算开销

有别于上述方法,作者提出ACoB-Stream,这是一种围绕状态生命周期组织的闭环"经验--策略"架构,以不变状态解耦和按需流式传输为核心设计原则,从而支持对大规模 VLA 在真实世界中进行高效、连续的在线强化学习

1.2 VLA-Precision的完整方法论:ACoB、ACoB-Stream

如原论文所述,作者首先将现实世界中大型 VLA 在异步actor--learner 流程下的强化学习后训练,形式化为一个闭环的"经验--策略"优化问题

  1. 随后,提出非对称协同自举(Asymmetric Co-Bootstrapping,ACoB)算法,在抑制由价值估计引起的策略漂移的同时,使策略性能突破基于示范的上限
  2. 接着,再提出 ACoB-Stream,通过经验上下文的构建、持久化、访问以及策略--状态同步,为大型 VLA 建立一个闭环的"经验--策略"流

最后,作者给出用于持续现实世界大规模 VLA 强化学习后训练的端到端在线训练与部署协议

1.2.0 VLA 精度问题形式化

在真实世界的在线RL中使用示范进行初始化,可以提供与任务相关的先验,从而减轻早期探索的负担并提高样本效率1214

对于一个大规模的预训练 VLA,初始化还必须在保持预训练操作先验和任务内泛化能力的同时,建立面向当前任务的专门能力

为此,图1 给出了VLA-Precision 框架的概览

而图2 详细展示了两阶段后训练流水线:

  1. 阶段I 在任务示范上执行全参数模仿学习,以获得任务特定的策略先验
  2. 随后阶段II 从 初始化真实世界的在线RL,并在该异步执行者-学习者系统中改进行为专家

作者将阶段II 表述为一个闭环的经验-策略优化问题

具体而言,作者将在任务指令 ℓ 下的物理交互建模为一个标准的马尔可夫决策过程(MDP)

  • 这里,S 和A 表示状态空间和动作空间,P 表示环境转移概率,r 表示奖励函数, 表示初始状态分布,表示折扣因子
  • 在决策步 ,状态由视觉观测 、机器人状态 和任务指令 组成

一个VLA策略动作是一个H 步动作块

其中H 是块的时域长度,d 是单步动作维度

执行该动作块会引起,并产生累积回报,其中是原始步的折扣因子,

任务条件策略将每个状态映射为一个动作块分布,并在下诱导轨迹

  • 为了实例化任务条件策略π,作者从任务微调后的π0.5 初始化在线策略,并仅优化动作专家中的LoRA 参数36
  • 在这种参数化下, 表示冻结的多模态前缀参数, 表示从阶段I 继承的冻结动作专家参数, 表示动作专家中可训练的LoRA 参数

动作片段生成可简洁地写为

在这里,是根据视觉观测、任务指令和机器人状态编码得到的任务条件多模态前缀上下文。 是初始高斯噪声, 是单位协方差矩阵,是基于流的动作专家

相应的在线RL 目标为

这里,表示回报最大化的参数,T 是以动作块决策步数衡量的序列长度

为了通过持续的真实世界交互来上述求解式(3),VLA-Precision 构建了如图 2 所示的闭环求解过程(定义为公式4):

  • 在此,n 表示在线更新周期
    分别表示学习器进程中的可训练动作专家状态及其在执行器进程中的部署对应项
    , 分别表示真实环境轨迹、在线经验池和训练批次
  • 在线经验池由重放缓冲区R、修正缓冲区C 和上下文缓冲区K 组成
    执行器在 下生成 ,将所有转移存储到R 中,将有效修正存储到C 中,并将多模态前缀上下文存储到K 中
  • 学习器使用ACoB 在 上优化θn,得到 并作为进行部署
    在这一形式化中,ACoB 在学习器进程内优化动作专家,而ACoB-Stream 则闭合了两个进程之间的经验的策略循环

1.2.1 面向动作专家的非对称协同自举:渐进式价值校准、相对优势策略改进

要在真实世界中可靠地对大型 VLA 进行强化学习后训练,必须在防止不可靠的价值估计导致策略漂移的同时,使动作专家的能力超越基于示范的性能上限

为此,ACoB 在*式 (4)*的学习器过程中建立了非对称的协同自举机制:

  1. 行为学习能够快速提升动作专家的能力,并持续提高在线经验的质量;
  2. 与此同时,评论家(critic)会在在线经验不断累积的过程中持续校准价值估计,从而产生越来越可靠的相对动作优势,用于进一步提升动作专家的能力

ps,以上这两点 在所有RL微调VLA的范式中,基本都如此

1.2.2 ACoB-Stream 架构

首先,针对渐进式价值校准

++可靠的价值学习既需要长时域回报估计,也需要细粒度的信用分配++。前者用于刻画行为在时间维度上的累积后果,而后者则有助于更精确地提升策略

因此,ACoB 通过全局回报传播和局部偏好排序,为行动专家优化建立了渐进式价值校准

为了联合学习这两种信号,ACoB 将价值模型实例化为由K 个任务特定的评论家组成的集成。每个评论家采用价值-优势分解

其中

  • 是状态的视觉-本体感受组件
  • 是对应的目标评论家
  • 对于任意动作块
    表示其OpenPI 归一化的模型表示
    为其展平后的评论家表示,其中排除不激活的动作维度

第一,对于全局回报传播。基于上述评论器的形式化,ACoB 通过时序差分优化来传播长时间跨度的回报。令表示最终由机器人执行的动作片段,它可以来自自主策略推断或人类纠正

它引起如下转移

其中 是终止标志。令表示可用于价值学习的样本。令表示在归一化的OpenPI动作空间中的动作专家输出

对于每个采样的转移,在 处的自举动作及其TD 目标被构造为

全局回报传播通过如下定义的集成 TD 目标来实现:

// 待更