【论文解析】一篇读懂异步在线 RL:从动作块三分区到梯度截断,SmoothRL 让值梯度只流向真正执行的动作

写在前面:

社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~

AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。


论文:SmoothRL: Online Reinforcement Learning During Asynchronous Execution(Astribot,arXiv 2026)

发布时间:2026 年 8 月 30 日(arXiv v1)

作者:Guang Gao、Yuxuan Nong、Baifu Huang、Jianan Wang(共 4 人)

核心一句话:在异步推理循环里做值梯度在线 RL:把动作块按帧索引分成已提交/执行/丢弃三区、梯度只过执行区,真机上把笔盖、开箱、抛掷三个高精度/高动态任务的成功率分别从 8%/30%/39% 拉到 83%/90%/94%,且加速度与 jerk 各降 52%、47%。

配套资源

核心关键词

  • 异步推理 + 动作分块(asynchronous inference + action chunking):策略推理与动作执行在时间上重叠,用新一帧块接力以隐藏高推理延迟、维持平滑控制。
  • 在线强化学习(online RL):策略从它当前正在生成的数据中改进,而不是离线轮次训练后再部署。
  • 值梯度范式(value-gradient paradigm) :把动作价值函数 Q Q Q 对动作的梯度 ∇ a Q \nabla_a Q ∇aQ 直接回传进策略参数 θ \theta θ,让学习信号直达策略。
  • 动作块三分区(committed / execution / discarded) :按帧索引按执行状态把每块拆成已提交区 [ 0 , n ) [0,n) [0,n)、执行区 [ n , 2 n ) [n,2n) [n,2n)、丢弃区 [ 2 n , H ) [2n,H) [2n,H),只有执行区真正进入环境。
  • 梯度截断到执行区(gradient truncation) : ∇ a Q \nabla_a Q ∇aQ 只对执行区 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 计算,保证被求导的段同时是策略输出又是真正执行的动作。
  • 延迟预算 n n n(latency budget) :估计推理时间上界并强制 d = c = n d=c=n d=c=n,把随机边界消成固定边界,换取每个块在同一帧窗上执行。
  • 冻结基策略 + 轻量附着网络(frozen base + attached actor-critic) :冻结 π 0.5 \pi_{0.5} π0.5 出参考块与表征 token,只训一个 TD3 式附着 actor-critic 做有界残差修正。

带着问题阅读

  1. 异步推理解决了执行卡顿,但它给在线 RL 的梯度计算带来了什么根本麻烦?
  2. 既然动作块只有一部分真正执行,为什么不干脆只用执行的那段、而要把整块交给 critic?
  3. 延迟预算 n n n 把边界固定成 d = c = n d=c=n d=c=n,代价是放弃更鲜的观测------这个代价在什么场景下会不划算?
  4. 值梯度范式相比 GR-RL 那种 latent-space 路线,为什么"能改的幅度"更大、却也要承担"梯度污染"的风险?
  5. 人在环干预为什么能直接当训练数据,而不需要 latent 反演或单独的离线采集阶段?
  6. 真机上开箱任务先掉到 20% 再升到 90% 的非单调曲线,说明了在线 RL 的什么性质?

一、核心导读

把通用机器人策略部署到物理世界,要同时满足两件事:可靠 (任务成功率高)与平滑实时执行。前者往往需要样本高效的在线强化学习来适配预训练策略;后者因为基础模型推理延迟越来越高,不得不采用异步推理 + 动作分块------策略算下一块的同时机器人继续执行当前块,靠新块接力来隐藏延迟。问题是这两条线长期被分开研究:现有在线 RL 默认同步执行,而部署几乎都跑异步推理,于是策略在"和部署时不同的动力学"下被优化。

SmoothRL 把这两条线焊在一起:在异步推理循环里做值梯度在线 RL,并把异步执行显式建模进训练目标 。具体说,每个生成的动作块按帧索引被分成三区------已提交区(上一轮推理已发出的动作)、执行区(这一块新生成且真正被执行的动作)、丢弃区(会被下一块覆盖、永不入环境的动作);值梯度 ∇ a Q \nabla_a Q ∇aQ 只过执行区,保证策略更新只依赖真正执行的动作。同时训练 rollout 里就跑同一个异步循环,使 replay buffer 记录的是机器人真正执行的动作与时序。实例化上,冻结 π 0.5 \pi_{0.5} π0.5 当基策略、只训一个轻量附着 actor-critic。真机上三个任务大幅提升,运动也更平滑。

二、问题背景:作者到底想解决什么

2.1 可靠性与平滑执行的长期割裂

可靠性与平滑实时执行是部署的两条腿,却一直被各做各的。同步执行下,推理延迟直接压在控制路径上:每个块边界机器人都得停下等下一次前向,而很多任务(如连续挥动)一旦停住就崩。异步推理 + 动作分块用"边算边执行"消除了这种停顿,但新块来自更早的观测、与已执行动作接不上,会在块边界产生速度/加速度不连续。于是又冒出一族"块缝合"方法去维持连续性。

如上图所示,上半给出 SmoothRL 在异步推理下做在线 RL 微调、支撑抛掷这类高动态灵巧任务的示意,下半则是它带来的平滑性收益------加速度与 jerk 的 RMS 分别降 52% 和 47%(右末端执行器 XYZ 在一次自主抛掷 rollout 的每块上测)。这张图同时承担了两个 desideratum 的视觉证据:上面对应"能做高动态任务",下面量化"做得更平滑"。作者据此立论:在线 RL 应当在与部署相同的异步执行范式下进行,即 Reinforce in Deployment

2.2 三维设计空间与现有路线的取舍

作者把设计空间收成三个必备条件,并按顺序排出已有路线各牺牲了哪一条(原论文 §2):Online (从当前生成数据改进,而非离线轮次)、Asynchronous (推理与执行重叠、延迟不限控制频率)、Value-gradient ( ∇ a Q \nabla_a Q ∇aQ 回传进策略参数)。Offline RL 把学习完全放在训练期、部署固定,异步只是调度选择、不影响学习信号,牺牲 Online;同步在线 RL 把 ∇ a Q \nabla_a Q ∇aQ 回传进策略,但假设同步执行,牺牲 Asynchronous;异步受限在线 RL(GR-RL)考虑了异步执行,但优化变量落在冻结扩散策略的 latent noise 空间、不进策略参数,牺牲 Value-gradient 且改进被冻结解码器表达能力上界封顶。

三条路都让掉一维,剩下一个同时满足三维的空白------异步在线 RL ------正是本文要填的。难点在于:异步执行下每个块只被部分执行,而值梯度路径又必须通到策略参数,于是"被求导的动作"和"真正执行的动作"天然对不齐,梯度污染在这种设定下无法靠执行调度回避,必须由目标本身消除。这就是 SmoothRL 的切入点。

三、核心思路:用一句主线串起来

一句话:把异步执行当成已知约束显式写进值梯度在线 RL 的目标------动作块按帧索引三分区,值梯度只过执行区,训练期就跑异步循环让 replay 记录真正执行的动作与时序,从而让"被求导的动作"与"真正执行的动作"严格同一。

这条主线有两处刻意设计。其一是"分区 + 截断"而非"只用执行段":critic 仍吃整块动作(含已提交区),是因为 chunk-skip bootstrap 只有在 critic 条件在"生成了这段奖励的动作序列"上才无偏,而且正在飞行的块是并发决策所需的状态增广;但梯度只从执行区回传,保证策略更新只依赖有环境后果的动作。其二是"训练期就异步":把部署用的异步推理循环放进训练 rollout,使 replay 里的动作正是机器人按同一时序真正执行的动作,避免策略在部署中遇不到的动力学下被优化。

四、方法展开:沿着论文原始逻辑拆解

4.1 异步推理循环与动作块三分区

异步推理下,基策略在机器人执行当前块的同时推断下一块;控制进程始终发最新可用动作、不等推理完成,新块一到立即接管,从而隐藏延迟(原论文 §3.1)。但异步执行有个根本后果:策略生成的块只有一部分被环境执行。于是按帧索引把每块(horizon H H H)分成三区:

  • 已提交区 [ 0 , d ) [0,d) [0,d) :本块推理延迟期间已过去的帧,动作由上一块给出、本块此区预测永不入环境,长度 d d d 由当前推理时间决定。
  • 执行区 [ d , d + c ) [d,d+c) [d,d+c) :本块是最新可用输出、直到下一块就绪前的窗口,动作原样发给机器人、唯一直接决定环境轨迹的部分,长度 c c c 由下一块到达时间决定。
  • 丢弃区:下一块就绪之后的帧,被新块覆盖、永不入环境。

)

如上图所示,上面对应可变推理延迟------ d k d_k dk 由本块推理延迟决定、 c k c_k ck 由下一轮推理延迟决定,两者独立波动、且在块生成时未知;下面是同一调度在延迟预算 n n n 下的情形------ d k = c k = n d_k=c_k=n dk=ck=n 对每个块成立,执行窗固定为 [ n , 2 n ) [n,2n) [n,2n)。作者选择不建模这种随机性、而是用固定延迟预算消除它:估计推理时间上界 n n n,每块在其首帧到期前 n n n 步就被请求,推理早完就等,使块交接总在预定时刻发生。于是 d = c = n d=c=n d=c=n,对任意 H ≥ 2 n H\ge 2n H≥2n,已提交区 [ 0 , n ) [0,n) [0,n)、执行区 [ n , 2 n ) [n,2n) [n,2n)、丢弃区 [ 2 n , H ) [2n,H) [2n,H)。代价是把"实际延迟与预算 n n n 的余量"变成等待时间、而不是用来吃更鲜的观测;换来的是每个块都在同一帧窗上执行。这正面回应了开头的第 3 个问题------当任务对更鲜观测极敏感、且推理延迟波动远小于预算时,这个代价才可能不划算,但论文认为固定边界的收益更值。

4.2 连续动作空间的值梯度 RL 与动作块为原子单元

这一节回顾本文通用的连续动作 RL 表述(原论文 §3.2)。动作价值函数 Q π ( s , a ) Q^\pi(s,a) Qπ(s,a) 满足 Bellman 方程:

公式(1):

Q π ( s , a ) = E r , s ′ ∼ P r + γ Q π ( s ′ , π ( s ′ ) ) Q^{\pi}(s,a)=\mathbb{E}_{r,s'\sim P}\leftr+\\gamma Q\^{\\pi}(s',\\pi(s'))\\right Qπ(s,a)=Er,s′∼Pr+γQπ(s′,π(s′))

off-policy actor-critic 交替更新:critic 用 replay 采样拟合 TD 目标,actor 更新策略参数以提高 Q Q Q。连续动作空间里提升 Q Q Q 有两条路:一是通过候选选择/优势加权/latent 引导,不把 ∇ a Q \nabla_a Q ∇aQ 回传进生成了执行动作的策略参数;二是本文走的值梯度路------ ∇ a Q \nabla_a Q ∇aQ 通过确定性策略 a = π θ ( s ) a=\pi_\theta(s) a=πθ(s) 回传到 θ \theta θ:

公式(2):

∇ θ J = E ∇ a Q ( s , a ) ∣ a = π θ ( s ) ⋅ ∇ θ π θ ( s ) \nabla_\theta J=\mathbb{E}\left\\left.\\nabla_a Q(s,a)\\right\|_{a=\\pi_\\theta(s)}\\cdot\\nabla_\\theta\\pi_\\theta(s)\\right ∇θJ=E∇aQ(s,a)∣a=πθ(s)⋅∇θπθ(s)

把动作块当成 RL 的原子动作单元:对跨 H H H 帧的块,转移记为 ( s t , a t : t + H , r t , s t + H ) (s_t,a_{t:t+H},r_t,s_{t+H}) (st,at:t+H,rt,st+H), a t : t + H a_{t:t+H} at:t+H 是策略在 s t s_t st 生成的块、 r t r_t rt 是块执行期间累计折扣回报、 s t + H s_{t+H} st+H 是块全执行后的观测。对应的 chunk-skip Bellman backup:

公式(3):

Q ( s t , a t : t + H ) ← r t + γ H Q ( s t + H , π ( s t + H ) ) Q(s_t,a_{t:t+H})\leftarrow r_t+\gamma^{H}Q(s_{t+H},\pi(s_{t+H})) Q(st,at:t+H)←rt+γHQ(st+H,π(st+H))

这个 backup 无偏,因为 critic 条件在"生成了这段区间奖励的动作序列"上。选块而非单步作为原子单元不是偶然:在单步表述里,块内动作没有帧索引,根本无法表达"梯度只作用在该块的某个子段"------而子段选择性正是异步执行要强加的约束。

4.3 异步部署下的块级 RL:执行区目标、梯度截断与全跨度 critic

在异步部署下,若直接把上面两件拼起来、让 ∇ a Q \nabla_a Q ∇aQ 在整块上回传,策略更新就会依赖那些永不入环境的生成动作。解法是把"哪段真正执行"当成部署过程施加的已知约束写进目标(原论文 §3.3)。目标只在块的前 2 n 2n 2n 帧上定义(已提交区与执行区各占一个预算区间;基策略发出的 H H H 可以更长),记 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 为已提交区里机器人真正执行的动作(由上一块发出、视为固定):

公式(4):

max ⁡ θ E Q ( s , a \~ \[ 0 , n ) , π θ ( s ) \[ n , 2 n ) ) s . t . ( a ~ 0 , n ) , π θ ( s ) \[ n , 2 n ) ) ∈ E \\max_\\theta\\mathbb{E}\\left\[Q\\big(s,\\tilde a_{\[0,n)},\\pi_\\theta(s)_{\[n,2n)}\\big)\\right\quad\mathrm{s.t.}\quad(\tilde a_{0,n)},\\pi_\\theta(s)_{\[n,2n)})\\in\\mathcal{E} θmaxE\[Q(s,a\~\[0,n),πθ(s)\[n,2n))s.t.(a~[0,n),πθ(s)[n,2n))∈E

其中 E \mathcal{E} E 是 [ 0 , 2 n ) [0,2n) [0,2n) 上物理可执行的块集合。可执行性是整跨度的属性而非仅执行区:一块被纳入仅当它在两区都有效、且在帧 n n n 边界处保持一致。丢弃区 [ 2 n , H ) [2n,H) [2n,H) 在有效执行窗之外、被目标整体排除。chunk-skip backup 也收到同一跨度:区间为 [ 0 , 2 n ) [0,2n) [0,2n) 而非全 H H H,奖励 r t r_t rt 在这 2 n 2n 2n 帧累计、bootstrap 状态为 s t + 2 n s_{t+2n} st+2n、折扣指数为 2 n 2n 2n,仍保无偏(critic 条件在 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 接 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 这一真正生成奖励的序列上)。

梯度截断到执行区。 从策略视角看,已提交区不产生有效环境反馈(这些动作被上一块覆写),不构成当前策略的有效梯度路径。于是 ∇ a Q \nabla_a Q ∇aQ 只对 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 计算。这确立了一个关键同一性:接收值梯度的段同时是策略输出又是环境真正执行的动作,使所得梯度对策略参数良定义。注意截断只作用于梯度路径,critic 仍在整块上运作。

critic 为何要吃整块。 异步执行把这里变成并发决策问题:执行区不是从 s t s_t st、而是从 s t + n s_{t+n} st+n 开始动作,中间帧由正在飞行的块支配。若 critic 只条件在 ( s t , a n , 2 n ) ) (s_t,a_{\[n,2n)}) (st,a\[n,2n)) 上,就会对 replay 里那些由更老策略诱导的飞行块分布做边缘化。并发决策过程要求用两个量增广状态------当前飞行中的动作、及其剩余完成时间(原论文引 \[35)。本设定里延迟预算把后者固定为常数 n n n,而块缝合一致性使前者在生成时直接可得:每个新生成块的已提交区正好等于上一块已发出的动作,记录这些发出动作就免费且精确地提供了所需状态增广。

平滑性。 可执行集约束 E \mathcal{E} E 限制的不是策略能作用的帧、而是被优化的块集合。actor 也条件在已提交区上,但理由与 critic 不同:已提交区与执行区在帧 n n n 相连,候选块必须在知晓它要接续的轨迹下选出。继承自预训练策略的平滑性由示教提供、而非显式强制;可一旦值目标在执行区上抬高 Q Q Q,这种平滑性不再保证,连续性必须作为显式约束重新引入目标------于是优化只在 E \mathcal{E} E 上搜索、把平滑性要求转回策略本身。这套表述基于 §4.1 的时序模型,因此转移必须在同一执行语义下采集:异步循环在训练 rollout 里就跑、而非只在部署,保证 replay 记录的是机器人真正执行的动作;同步执行下采的转移里没有显式区域边界可供目标对齐。这正面回答了第 1、2 个问题:异步给梯度带来的麻烦是"被求导动作 ≠ 执行动作",而 critic 吃整块是因为 chunk-skip 无偏性与并发状态增广都离不开已提交区。

4.4 具体实例化:冻结基策略、双干预模式与训练循环

实例化沿用 RLT 骨架:冻结基策略出参考块、轻量 TD3 式 actor-critic 经一个 RL token 读基策略内部表征、预测残差修正(原论文 §3.4)。这骨架无需结构性改动就满足 §4.3 要求:它提供块级 actor(使帧索引梯度截断可表达)、在原始动作空间运作(免于反演人机干预)、并暴露一个可把已提交区作为 stop-gradient 项追加的 critic 输入。

)

如上图所示,冻结基策略 π b a s e \pi_{\mathrm{base}} πbase 产生潜在表征 z t z_t zt 与参考动作块 a ˉ t : t + 2 n \bar a_{t:t+2n} aˉt:t+2n;可训练的附着网络以 z t , s t , a ˉ t : t + 2 n z_t,s_t,\\bar a_{t:t+2n} zt,st,aˉt:t+2n 为输入预测一个有界修正、加到参考块上得到最终块;critic 条件在修正后的块上,而梯度只经执行区回传到 actor(§4.3)。人机干预施加在发出的原始动作空间上,使干预轨迹可直接并入训练(见下)。

人在环干预。 演化策略期间支持两种模式(原论文 §3.4):

)

如上图所示,上面是绝对干预------遥操作块直接发出、actor 输出丢弃;下面是残差干预------人输入加到 actor 输出上、操作者改而非换策略块。两模式下游处理完全相同:实际发出的动作记入 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 并当 BC 目标。块级标注是否被干预,决定执行区的 BC 目标 a [ n , 2 n ) t a r g e t a_{[n,2n)}^{\mathrm{target}} a[n,2n)target(干预块用实际发出块、否则用基策略参考),而已提交区恒用参考动作当目标。 Q Q Q 的输入与干预标志无关:已提交区记的是实际发出动作,故上一块若被干预则含人的动作------§4.3 的状态增广继续忠实表示飞行中的动作。这正面回答了第 5 个问题:原始动作空间下人机动作与策略输出同空间,干预块既当 BC 回归目标又当 critic 的 TD 转移,无需 latent 反演。两种模式适配不同任务:残差干预保留块的时间结构只改轨迹、用于动态任务(抛掷);绝对干预给操作者全块控制、用于需高精度大灵活的任务(开箱、笔盖)。

critic / actor / buffer / 调度。 critic 是每隐层带 LayerNorm 的 MLP,输入 z t , s t , a \~ \[ 0 , n ) , a \[ n , 2 n ] z_t,s_t,\\tilde a_{\[0,n)},a_{\[n,2n}] zt,st,a\~\[0,n),a\[n,2n]、输出标量;目标构造跟 TD3(目标 actor 动作加裁剪高斯噪声、对目标值取悲观估计),但有三处偏离骨架:块显式分区成已提交/执行区并都喂给 critic;backup 用 chunk-skip 而非单步;固定双 Q Q Q 扩成 REDQ 式 N N N 个独立 critic 集成、在随机子集上取 min。actor 同构 MLP,输入 z t , s t , a ˉ t : t + 2 n z_t,s_t,\\bar a_{t:t+2n} zt,st,aˉt:t+2n 输出长 2 n 2n 2n 的块;残差模式下预测有界修正加到参考块。actor 损失三项:

公式(5):

L a c t o r = − Q ( z , s , s g a \~ \[ 0 , n ) , a n , 2 n ) ) + w b c ∥ a − a t a r g e t ∥ \[ 0 , 2 n ) 2 + w s m o o t h ∑ k = 1 3 w k ∥ Δ k a ∥ \[ 0 , 2 n ) 2 \\mathcal{L}_{\\mathrm{actor}}=-Q\\big(z,s,\\mathrm{sg}\[\\tilde a_{\[0,n)},a_{n,2n)}\\big)+w_{\\mathrm{bc}}\\\|a-a\^{\\mathrm{target}}\\\|_{\[0,2n)}\^{2}+w_{\\mathrm{smooth}}\\sum_{k=1}\^{3}w_{k}\\\|\\Delta\^{k}a\\\|_{\[0,2n)}\^{2} Lactor=−Q(z,s,sg\[a\~\[0,n),a[n,2n))+wbc∥a−atarget∥[0,2n)2+wsmoothk=1∑3wk∥Δka∥[0,2n)2

第一项是 §4.3 的 Q Q Q 最大化,第二项是 TD3+BC 式的 BC 锚(锚定参考动作而非数据集动作),第三项是 §4.3 可执行集 E \mathcal{E} E 的实例化------用逐帧速度/加速度/jerk 界限刻画 E \mathcal{E} E、松弛成惩罚; s g \mathrm{sg}\\cdot sg 是 stop-gradient:整块喂给 Q Q Q,但对 θ \theta θ 的梯度只过执行区。replay buffer 先用纯基策略在部署循环下 rollout 初始化(附着网络不激活),保证每条转移都在目标的时序假设下采的、并给 critic 一个改进起点的初始拟合;奖励稀疏、仅回合末由操作者判成功给出。更新节奏由 rollout 进度而非墙上时间决定:每条新轨迹做 G G G 次 critic 迭代,actor 与目标网络每 D D D 次 critic 迭代更新一次,使 update-to-data 比受 rollout 吞吐上界约束。完整训练循环见下。

复制代码
Algorithm 1  SmoothRL training in the asynchronous inference loop
Require: frozen π_base with RL-token encoder E, budget n, discount γ,
         soft-update rate τ, step size η, update-to-data ratio G, actor delay D
Initialize: π_θ and {Q_φ_i}_{i=1}^N ;
            targets θ⁻ ← θ, φ_i⁻ ← φ_i ; replay buffer D
            ã_[0,n) ← hold action        # robot stationary until first chunk arrives
# Process 1 & 2 run concurrently, sharing D and the parameters.

1: Process 1: asynchronous rollout
2: for t = 0, n, 2n, ... do
3:   observe s_t
4:   ā_{t:t+2n} ← π_base(s_t, ã_[0,n)) ;  z_t ← E(π_base)
5:   a_{t:t+2n} ← π_θ(z_t, s_t, ā_{t:t+2n})
6:   a_[0,n) ← ã_[0,n)              # committed region over [t, t+n)
7:   a^target_[0,2n) ← ā_[0,2n)
8:   if teleoperation then
9:     a_[n,2n) ← a^human_[n,2n)    # absolute or residual (§3.4)
10:    a^target_[n,2n) ← a_[n,2n)
11:  issue a_[n,2n)
12:  record transition τ_t = (s_t, z_t, ã_[0,n), a_[n,2n), a^target_[0,2n])  # finished at t+2n
13:  if t ≥ 2n then
14:    τ_{t-2n} ∪= (r_{t-2n}, s_t, z_t, ā_{t:t+2n}, a_[0,n))   # reward over [t-2n,t); next state
15:    append τ_{t-2n} to D
16:  ã_[0,n) ← a_[n,2n)             # update committed region for next step

17: Process 2: off-policy updates
18: for each trajectory appended by Process 1 do
19:   for G iterations do
20:    sample a batch B ⊂ D
21:    for each τ = (s, z, ã_[0,n), a_[n,2n), a^target, r, s', z', ā', ã'_[0,n)) ∈ B:
22:      draw M ⊂ {1,...,N} at random
23:      a' ← π_θ⁻(z', s', ā') + ε     # clipped Gaussian ε
24:      y ← r + γ^{2n} min_{i∈M} Q_{φ_i⁻}(z', s', ã'_[0,n), a'_[n,2n))
25:      φ_i ← φ_i − η ∇_{φ_i} Σ_B (Q_{φ_i}(z, s, ã_[0,n), a_[n,2n]) − y)²   for all i
26:      if every D-th iteration then
27:        θ ← θ − η ∇_θ L_actor          # Eq. (5)
28:        θ⁻ ← τθ + (1−τ)θ⁻
29:        φ_i⁻ ← τφ_i + (1−τ)φ_i⁻        for all i

算法里两件事值得点出:第 6 步把已提交区显式设为上一块实际发出的 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n)(stop-gradient),第 16 步又把它更新为当前执行区------这是并发状态增广的工程落地;第 14 步在 t ≥ 2 n t\ge 2n t≥2n 时才把奖励与下一状态补进 2 n 2n 2n 步前的转移,正对应 chunk-skip backup 的 2 n 2n 2n 跨度与 γ 2 n \gamma^{2n} γ2n 折扣。基策略在 TT-RTC 调度器下跑以维持 §4.1 的时序保证,每次前向同时产出参考块 a ˉ t : t + 2 n \bar a_{t:t+2n} aˉt:t+2n 与 RL token z t z_t zt。

五、实验与证据:结果能支撑到什么程度

5.1 平台与三个任务

三任务在 Astribot S1 上做------一台 25 自由度移动双臂机器人(两支 7-DoF 臂带平行夹爪、4-DoF 躯干、2-DoF 头、3-DoF 轮式底盘)。基策略观测为三路相机(头、左腕、右腕,各 224 × 224 224\times224 224×224)加本体关节状态,发 31 维动作于 30Hz(左/右臂与躯干末端 9 维笛卡尔 delta 位姿 + 2 夹爪 + 2 头关节);附着 actor-critic 只改 20 维臂动作、躯干与头不动。推理以 5Hz 请求、新块每 200ms 到、对应延迟预算 n = 6 n=6 n=6 帧;基策略训到预测 H = 32 H=32 H=32 帧,故已提交区+执行区共 12 帧、丢弃区 20 帧。

)

如上图所示,三任务跨两互补区间:高速动态操作与高精度双臂操作。动态抛掷 :抓起随机放置的物体抛进随机放置的桶------成功要求末端在释放前全程积累足够速度而非瞬时达标,对异步执行尤其敏感(块边界一停、剩余挥动来不及恢复释放速度),桶口约 7 × 12 7\times12 7×12cm、物约 6 × 7 6\times7 6×7cm。笔盖 :对齐笔与盖、压紧、释放------插入需相对位姿落在约 5mm 间隙内,超出则盖会偏转而非就位,双臂主动控制使精度取决于相对位姿。开箱:左手稳箱、右臂插刃入缝、沿缝切胶带、翻盖------刃约 1mm 宽、缝仅 2--3mm,需毫米级入缝,错向任一侧都会失败(切纸板或漏胶带),入缝后缝引导刀运动、主难在入缝精度。

5.2 训练设置与评测协议

附着 actor-critic 是 3 层 MLP、每层 512 单元;update-to-data 比 G = 5 G=5 G=5、actor 延迟 D = 5 D=5 D=5(每条新轨迹 5 次梯度更新,actor 与目标网络每 5 次更新一次);batch 256;修正界 0.05(基策略已接近成功、只需小修正)。奖励由操作者经手柄/VR 给稀疏二值:仅在判任务完成时终止并给奖励,无中间奖励;回合后回初始位姿、复位场景。训练时操作者按需干预以维持成功/失败回合的均衡比。

)

如上图所示,评测用预定义初始状态构型------开箱 10 个箱位、抛掷 18 个(3 物位×6 桶位)、笔盖 12 个(4 初始手态×3 笔盖位),与在线微调时所用相同,每构型评一次、分别得 10/18/12 回合。比较四个时点:冻结基策略 π 0.5 \pi_{0.5} π0.5(无附着网络,零点)、以及引入附着网络后第 150/200/250 rollout 回合的检查点。监督预训练用示教:开箱与笔盖各 1500 条、抛掷 500 条(后者更难采------跨所有桶位遥操成功率仅约 50%,因人也要维持连续挥动)。在线 RL 先用纯基策略采 50 回合热身 replay、再引入附着网络。四检查点同硬件、同异步推理循环与延迟预算,唯一变量是附着网络的在线微调量。

5.3 结果:三任务大幅提升、非单调学习与"最后一毫米"

250 回合后三任务都大幅超过冻结基策略:动态抛掷 39%→94%、笔盖 8%→83%、开箱 30%→90%。下表与学习曲线给出全过程。

原论文表 1:各检查点成功率(累计 rollout 回合数,每成功率按每初始构型一回合算)。

Task Number of Rollout Episodes Success Rate
Dynamic Tossing 0 (base policy) 39%
Dynamic Tossing 150 72%
Dynamic Tossing 200 83%
Dynamic Tossing 250 94%
Pen Capping 0 (base policy) 8%
Pen Capping 150 67%
Pen Capping 200 75%
Pen Capping 250 83%
Box Opening 0 (base policy) 30%
Box Opening 150 20%
Box Opening 200 40%
Box Opening 250 90%

)

如上图所示,零点为冻结基策略(虚线延展作参考),三个非零检查点来自每任务单次 RL run。抛掷与笔盖单调上升、前 150 回合涨幅最大(笔盖 8%→67%,说明主导系统偏置早早就修掉了大半,之后主要受修正轨迹周围的残余变化限制)。开箱则呈非单调:150 回合后先掉到 20%(低于基策略的 30%),200 回合回到 40%,250 到 90%。这正面回答了第 6 个问题------非单调反映附着网络在适配任务时为发现有效修正所需的探索,是真实机器人在线 RL 的固有性质而非 bug;也说明不能只看早期点判方法成败。

基策略的失效模式。 三任务的失败是系统性的而非随机:笔盖里策略对不同盖位产生相似轨迹、不调盖位致仅 8%;开箱里刀刃有稳定左偏、扎进纸板而非入胶带缝;抛掷里策略不随目标距离调释放速度(近桶过射、远桶欠射,且对侧目标有系统左右偏)。

在线 RL 修了什么。 附着网络逐步修正基策略的系统偏移。下图把 250 回合检查点的代表性失败与基策略失败并排。

)

如上图所示,对比两行可见失败在向成功靠拢:基策略沿固定方向以可见余量脱靶,RL 后剩的是围绕正确位姿的小散布------抛掷物落点更近桶、破了基策略的固定偏置;开箱刀刃偏离缝小到 1--2mm 左右散布;笔盖轴向外错位同样收成围绕正确位姿的小散布。这些偏移量正是任务难的地方:成功不是到目标区、而是闭合最后几毫米,小到图像里勉强可辨的误差就足以失败。这正回应了第 4 个问题的另一半:值梯度路在原始动作空间直接改策略,所以能把这种毫米级系统偏移逐步抵消------这是 latent-space 路线(受冻结解码器表达力上界封顶)做不到的。

六、这篇工作的边界与可复现性

边界。 框架通用,但当前实例化有两已知限制(原论文 §Limitations)。一是推理延迟约束:框架在固定推理频率下运作、要求每次块级推理在预算 n n n 内完成;当推理延迟时变波动使实际计算时间超预算,预定的块交接无法保证,时序失配会动摇异步执行循环。二是表达力受基策略封顶:RL 模块条件在 VLA 内部表征上,故感知能力被 VLA 嵌入信息丰富度上界封顶;且当前只产出对参考动作的有界残差修正,修正幅度被固定局部邻域卡住,当基策略对目标域数据有系统偏置时,局部残差修正表达力不足以纠正错误策略行为。

可复现性。 关键实现细节齐全。策略: π 0.5 \pi_{0.5} π0.5 作冻结基策略、附着 actor-critic 为 3 层 MLP(512 单元/层),冻结基策略下 TT-RTC 调度维持时序。RL: G = 5 G=5 G=5、 D = 5 D=5 D=5、batch 256、修正界 0.05、REDQ 式 N N N critic 集成、TD3+BC 式 BC 锚、平滑正则用逐帧速度/加速度/jerk 界限。时序:5Hz 推理、 n = 6 n=6 n=6 帧、 H = 32 H=32 H=32、控制 30Hz、31 维动作(附着网络只改 20 维臂动作)。平台:Astribot S1(25-DoF 移动双臂)、三路 224×224 相机。奖励稀疏二值、由操作者判成功;人在环干预走绝对/残差两模式、干预块同时作 BC 目标与 TD 转移。数据:开箱/笔盖各 1500 条示教、抛掷 500 条;在线 RL 先 50 回合纯基策略热身 replay。

七、如果继续研究/落地,应该关注什么

  • 把 committed prefix 当 prefix-constrained generation。 当前三区里已提交区是"输出空间覆写",若把值梯度扩到整个生成策略(如 QAM 的 adjoint terminal condition ∇ a Q \nabla_a Q ∇aQ),保留已发动作就变成前缀约束生成问题------这指向更一般的"部分提交生成下的在线策略优化"。
  • 把 blending 写进目标而非外挂。 框架排除了外挂混合算子,但不阻止把混合直接放进目标:让 critic 评估最终被执行的混合动作、可能给更忠实的训练信号,代价是目标时序依赖更宽、需围绕混合算子加连续性约束、且每个贡献块多一次 actor 前向。要注意混合权通常在块交界(最需连续处)衰减------平滑性与学习信号强度可能有不利 trade-off。
  • 用分布偏移实验定位"局部修正失效点"。 系统增大与预训练基策略的分布偏移,看局部修正何时不够用、该上更表达的 adapter 还是全生成策略更新。这能区分学习算法本身的限制与所选策略参数化的限制。
  • 延迟预算的自适应。 现在固定 n n n 在推理延迟长时波动下会失配(限制一);能否让预算随实测延迟自适应、同时保住固定执行窗,是把框架推向更现实部署的关键工程问题。
  • 把人机协作干预信号结构化。 现在干预只作 BC 目标与 TD 转移;若把"操作者为何干预"的偏好也纳入,可能给更密的奖励信号,降低稀疏奖励下的样本成本。

八、术语与概念速查

术语 含义 / 在本文中的角色
χ 0 \chi_0 χ0 / RECAP 离线 RL 路线:优势经独立价值模型估计,靠 AWR 加权或 CFG 条件影响策略,不把 ∇ a Q \nabla_a Q ∇aQ 回传进策略参数;支持异步部署。
CO-RFT 离线块级 Cal-QL(Chunked Cal-QL),但部署同步------说明离线 RL 里异步只是调度选择。
RLT 冻结 VLA + RL token + 块级 TD3 actor 的骨架,SmoothRL 实例化直接沿用它。
EXPO-FT 冻结 VLA + 残差编辑头 + SAC actor + Best-of-N,同属值梯度同步在线 RL。
GR-RL 异步受限在线 RL:优化变量在冻结扩散策略的 latent noise 空间,改进被冻结解码器表达力上界封顶。
LWD fleet 规模在线 RL:块级 critic,经 adjoint-matching 把 ∇ a Q \nabla_a Q ∇aQ 传进 flow 策略头,假设同步执行。
QAM adjoint matching,终值条件 ∇ a Q \nabla_a Q ∇aQ------SmoothRL 未来扩展到全生成策略的天然接口。
Dynamic tossing / pen capping / box opening 三评测任务:桶口 ~7×12cm 物 ~6×7cm;笔盖间隙 ~5mm;刃 1mm 缝 2--3mm。
Astribot S1 25-DoF 移动双臂机器人(2×7-DoF 臂 + 4-DoF 躯干 + 2-DoF 头 + 3-DoF 轮式底盘)。
π 0.5 \pi_{0.5} π0.5 冻结基策略(Physical Intelligence),出参考块与 RL token。
绝对 / 残差干预 VR 直接发块 / 手柄位移作 delta 加到 actor 输出;下游都记入 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 当 BC 目标。
TT-RTC 调度器 维持基策略时序保证、使每次前同时出参考块与 token 的训练时动作条件调度。
chunk-skip Bellman backup Q ( s t , a t : t + H ) ← r t + γ H Q ( s t + H , π ( s t + H ) ) Q(s_t,a_{t:t+H})\leftarrow r_t+\gamma^H Q(s_{t+H},\pi(s_{t+H})) Q(st,at:t+H)←rt+γHQ(st+H,π(st+H));异步下跨度收到 [ 0 , 2 n ) [0,2n) [0,2n)。
REDQ critic 集成,在随机子集上取 min,替代 TD3 的固定双 Q Q Q。
G G G / D D D update-to-data 比 G = 5 G=5 G=5(每条新轨迹 5 次梯度更新)、actor 延迟 D = 5 D=5 D=5(每 5 次更新一次 actor/目标网络)。
Agreement / differentiability 两要求:发出的动作=执行的动作;该动作对 θ \theta θ 有有效梯度路径------直接发策略输出即同时满足。
latency budget n n n 推理时间上界,固定 d = c = n d=c=n d=c=n,执行窗 [ n , 2 n ) [n,2n) [n,2n),本文 n = 6 n=6 n=6 帧。

九、拓展思考:值得继续扩展研究与思考的创新点

  • 从"输出空间覆写"到"前缀约束生成"。 现在已提交区是把策略输出整段替换;若值梯度能进整个生成策略,保留已发动作就升级为前缀约束生成,这或许是异步在线 RL 与扩散/流策略更深融合的钥匙。
  • 并发决策的更精细状态增广。 论文用"飞行中动作 + 剩余时间"增广状态,后者被延迟预算固定为 n n n;若延迟允许波动,剩余时间不再是常数,状态增广与 bootstrap 时序都得重推------这是把框架从"固定预算"推向"弹性时序"的理论关口。
  • 平滑性与学习信号的联合优化。 可执行集 E \mathcal{E} E 现以惩罚项松弛进目标;能否用一个可微的连续性算子,让平滑性约束与 Q Q Q 最大化在梯度层耦合而非相加,可能给出更紧的可行块集。
  • 干预作为偏好信号。 操作者何时干预、干预多少,本身携带相对偏好信息;把它与稀疏二值奖励结合,或能在不改 RL 目标结构的前提下压低样本成本。
  • 跨任务的修正界自适应。 修正界 0.05 跨三任务固定;但开箱的毫米级精度与抛掷的速度修正需求不同,让修正界随任务/随训练进度自适应,可能是把"局部残差"这条路线推到其表达力上界前的低成本改进。
    学习信号的联合优化。** 可执行集 E \mathcal{E} E 现以惩罚项松弛进目标;能否用一个可微的连续性算子,让平滑性约束与 Q Q Q 最大化在梯度层耦合而非相加,可能给出更紧的可行块集。
  • 干预作为偏好信号。 操作者何时干预、干预多少,本身携带相对偏好信息;把它与稀疏二值奖励结合,或能在不改 RL 目标结构的前提下压低样本成本。
  • 跨任务的修正界自适应。 修正界 0.05 跨三任务固定;但开箱的毫米级精度与抛掷的速度修正需求不同,让修正界随任务/随训练进度自适应,可能是把"局部残差"这条路线推到其表达力上界前的低成本改进。
相关推荐
智能体与具身智能14 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
_张一凡1 天前
【论文解读】一篇读懂 VLA 模态纠缠:从证据打分到双铰链一致性损失,零推理开销让策略只信该信的传感器
具身智能·vla
正在走向自律1 天前
爆火全网的2026机器人运动会:从赛场竞速到具身智能产业化的技术全解析
人工智能·机器人·具身智能·人形机器人·机器人运动会·百米竞速
FII工业富联科技服务2 天前
Omniverse + Isaac Teleop + 合成数据:工业富联机器人大脑训练+执行落地闭环拆解
大数据·人工智能·深度学习·机器学习·机器人·制造·具身智能
chen_zn952 天前
《WAM 系列》Zero-WAM | 人类视频上下文学习 | 未来片段预测 | 零样本跨任务泛化
人工智能·具身智能·vla
weixin_468466852 天前
从“建模城市”到“按需查询”:D4RT如何用200+FPS重新定义动态3D世界
人工智能·3d·具身智能·d4rt·4d重建
深蓝学院2 天前
机器人路径规划5大主流算法详解:MPC、强化学习、图搜索等
具身智能
VL——MOESR2 天前
【具身智能】OpenVLA论文阅读随笔
论文阅读·机器学习·具身智能·vla·openvla
feasibility.3 天前
ABot-World-0:当一块 RTX 5090 能编织无限世界——交互式世界模型的高德解法
人工智能·aigc·视频·地图·具身智能·英伟达·世界模型