写在前面:
社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~
AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。
论文:SmoothRL: Online Reinforcement Learning During Asynchronous Execution(Astribot,arXiv 2026)
发布时间:2026 年 8 月 30 日(arXiv v1)
作者:Guang Gao、Yuxuan Nong、Baifu Huang、Jianan Wang(共 4 人)
核心一句话:在异步推理循环里做值梯度在线 RL:把动作块按帧索引分成已提交/执行/丢弃三区、梯度只过执行区,真机上把笔盖、开箱、抛掷三个高精度/高动态任务的成功率分别从 8%/30%/39% 拉到 83%/90%/94%,且加速度与 jerk 各降 52%、47%。
配套资源
- 项目主页:SmoothRL Project Page
- 论文 arXiv 主页:arXiv:2608.29768
核心关键词
- 异步推理 + 动作分块(asynchronous inference + action chunking):策略推理与动作执行在时间上重叠,用新一帧块接力以隐藏高推理延迟、维持平滑控制。
- 在线强化学习(online RL):策略从它当前正在生成的数据中改进,而不是离线轮次训练后再部署。
- 值梯度范式(value-gradient paradigm) :把动作价值函数 Q Q Q 对动作的梯度 ∇ a Q \nabla_a Q ∇aQ 直接回传进策略参数 θ \theta θ,让学习信号直达策略。
- 动作块三分区(committed / execution / discarded) :按帧索引按执行状态把每块拆成已提交区 [ 0 , n ) [0,n) [0,n)、执行区 [ n , 2 n ) [n,2n) [n,2n)、丢弃区 [ 2 n , H ) [2n,H) [2n,H),只有执行区真正进入环境。
- 梯度截断到执行区(gradient truncation) : ∇ a Q \nabla_a Q ∇aQ 只对执行区 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 计算,保证被求导的段同时是策略输出又是真正执行的动作。
- 延迟预算 n n n(latency budget) :估计推理时间上界并强制 d = c = n d=c=n d=c=n,把随机边界消成固定边界,换取每个块在同一帧窗上执行。
- 冻结基策略 + 轻量附着网络(frozen base + attached actor-critic) :冻结 π 0.5 \pi_{0.5} π0.5 出参考块与表征 token,只训一个 TD3 式附着 actor-critic 做有界残差修正。
带着问题阅读
- 异步推理解决了执行卡顿,但它给在线 RL 的梯度计算带来了什么根本麻烦?
- 既然动作块只有一部分真正执行,为什么不干脆只用执行的那段、而要把整块交给 critic?
- 延迟预算 n n n 把边界固定成 d = c = n d=c=n d=c=n,代价是放弃更鲜的观测------这个代价在什么场景下会不划算?
- 值梯度范式相比 GR-RL 那种 latent-space 路线,为什么"能改的幅度"更大、却也要承担"梯度污染"的风险?
- 人在环干预为什么能直接当训练数据,而不需要 latent 反演或单独的离线采集阶段?
- 真机上开箱任务先掉到 20% 再升到 90% 的非单调曲线,说明了在线 RL 的什么性质?
一、核心导读
把通用机器人策略部署到物理世界,要同时满足两件事:可靠 (任务成功率高)与平滑实时执行。前者往往需要样本高效的在线强化学习来适配预训练策略;后者因为基础模型推理延迟越来越高,不得不采用异步推理 + 动作分块------策略算下一块的同时机器人继续执行当前块,靠新块接力来隐藏延迟。问题是这两条线长期被分开研究:现有在线 RL 默认同步执行,而部署几乎都跑异步推理,于是策略在"和部署时不同的动力学"下被优化。
SmoothRL 把这两条线焊在一起:在异步推理循环里做值梯度在线 RL,并把异步执行显式建模进训练目标 。具体说,每个生成的动作块按帧索引被分成三区------已提交区(上一轮推理已发出的动作)、执行区(这一块新生成且真正被执行的动作)、丢弃区(会被下一块覆盖、永不入环境的动作);值梯度 ∇ a Q \nabla_a Q ∇aQ 只过执行区,保证策略更新只依赖真正执行的动作。同时训练 rollout 里就跑同一个异步循环,使 replay buffer 记录的是机器人真正执行的动作与时序。实例化上,冻结 π 0.5 \pi_{0.5} π0.5 当基策略、只训一个轻量附着 actor-critic。真机上三个任务大幅提升,运动也更平滑。
二、问题背景:作者到底想解决什么
2.1 可靠性与平滑执行的长期割裂
可靠性与平滑实时执行是部署的两条腿,却一直被各做各的。同步执行下,推理延迟直接压在控制路径上:每个块边界机器人都得停下等下一次前向,而很多任务(如连续挥动)一旦停住就崩。异步推理 + 动作分块用"边算边执行"消除了这种停顿,但新块来自更早的观测、与已执行动作接不上,会在块边界产生速度/加速度不连续。于是又冒出一族"块缝合"方法去维持连续性。

如上图所示,上半给出 SmoothRL 在异步推理下做在线 RL 微调、支撑抛掷这类高动态灵巧任务的示意,下半则是它带来的平滑性收益------加速度与 jerk 的 RMS 分别降 52% 和 47%(右末端执行器 XYZ 在一次自主抛掷 rollout 的每块上测)。这张图同时承担了两个 desideratum 的视觉证据:上面对应"能做高动态任务",下面量化"做得更平滑"。作者据此立论:在线 RL 应当在与部署相同的异步执行范式下进行,即 Reinforce in Deployment。
2.2 三维设计空间与现有路线的取舍
作者把设计空间收成三个必备条件,并按顺序排出已有路线各牺牲了哪一条(原论文 §2):Online (从当前生成数据改进,而非离线轮次)、Asynchronous (推理与执行重叠、延迟不限控制频率)、Value-gradient ( ∇ a Q \nabla_a Q ∇aQ 回传进策略参数)。Offline RL 把学习完全放在训练期、部署固定,异步只是调度选择、不影响学习信号,牺牲 Online;同步在线 RL 把 ∇ a Q \nabla_a Q ∇aQ 回传进策略,但假设同步执行,牺牲 Asynchronous;异步受限在线 RL(GR-RL)考虑了异步执行,但优化变量落在冻结扩散策略的 latent noise 空间、不进策略参数,牺牲 Value-gradient 且改进被冻结解码器表达能力上界封顶。
三条路都让掉一维,剩下一个同时满足三维的空白------异步在线 RL ------正是本文要填的。难点在于:异步执行下每个块只被部分执行,而值梯度路径又必须通到策略参数,于是"被求导的动作"和"真正执行的动作"天然对不齐,梯度污染在这种设定下无法靠执行调度回避,必须由目标本身消除。这就是 SmoothRL 的切入点。
三、核心思路:用一句主线串起来
一句话:把异步执行当成已知约束显式写进值梯度在线 RL 的目标------动作块按帧索引三分区,值梯度只过执行区,训练期就跑异步循环让 replay 记录真正执行的动作与时序,从而让"被求导的动作"与"真正执行的动作"严格同一。
这条主线有两处刻意设计。其一是"分区 + 截断"而非"只用执行段":critic 仍吃整块动作(含已提交区),是因为 chunk-skip bootstrap 只有在 critic 条件在"生成了这段奖励的动作序列"上才无偏,而且正在飞行的块是并发决策所需的状态增广;但梯度只从执行区回传,保证策略更新只依赖有环境后果的动作。其二是"训练期就异步":把部署用的异步推理循环放进训练 rollout,使 replay 里的动作正是机器人按同一时序真正执行的动作,避免策略在部署中遇不到的动力学下被优化。
四、方法展开:沿着论文原始逻辑拆解
4.1 异步推理循环与动作块三分区
异步推理下,基策略在机器人执行当前块的同时推断下一块;控制进程始终发最新可用动作、不等推理完成,新块一到立即接管,从而隐藏延迟(原论文 §3.1)。但异步执行有个根本后果:策略生成的块只有一部分被环境执行。于是按帧索引把每块(horizon H H H)分成三区:
- 已提交区 [ 0 , d ) [0,d) [0,d) :本块推理延迟期间已过去的帧,动作由上一块给出、本块此区预测永不入环境,长度 d d d 由当前推理时间决定。
- 执行区 [ d , d + c ) [d,d+c) [d,d+c) :本块是最新可用输出、直到下一块就绪前的窗口,动作原样发给机器人、唯一直接决定环境轨迹的部分,长度 c c c 由下一块到达时间决定。
- 丢弃区:下一块就绪之后的帧,被新块覆盖、永不入环境。
)
如上图所示,上面对应可变推理延迟------ d k d_k dk 由本块推理延迟决定、 c k c_k ck 由下一轮推理延迟决定,两者独立波动、且在块生成时未知;下面是同一调度在延迟预算 n n n 下的情形------ d k = c k = n d_k=c_k=n dk=ck=n 对每个块成立,执行窗固定为 [ n , 2 n ) [n,2n) [n,2n)。作者选择不建模这种随机性、而是用固定延迟预算消除它:估计推理时间上界 n n n,每块在其首帧到期前 n n n 步就被请求,推理早完就等,使块交接总在预定时刻发生。于是 d = c = n d=c=n d=c=n,对任意 H ≥ 2 n H\ge 2n H≥2n,已提交区 [ 0 , n ) [0,n) [0,n)、执行区 [ n , 2 n ) [n,2n) [n,2n)、丢弃区 [ 2 n , H ) [2n,H) [2n,H)。代价是把"实际延迟与预算 n n n 的余量"变成等待时间、而不是用来吃更鲜的观测;换来的是每个块都在同一帧窗上执行。这正面回应了开头的第 3 个问题------当任务对更鲜观测极敏感、且推理延迟波动远小于预算时,这个代价才可能不划算,但论文认为固定边界的收益更值。
4.2 连续动作空间的值梯度 RL 与动作块为原子单元
这一节回顾本文通用的连续动作 RL 表述(原论文 §3.2)。动作价值函数 Q π ( s , a ) Q^\pi(s,a) Qπ(s,a) 满足 Bellman 方程:
公式(1):
Q π ( s , a ) = E r , s ′ ∼ P r + γ Q π ( s ′ , π ( s ′ ) ) Q^{\pi}(s,a)=\mathbb{E}_{r,s'\sim P}\leftr+\\gamma Q\^{\\pi}(s',\\pi(s'))\\right Qπ(s,a)=Er,s′∼Pr+γQπ(s′,π(s′))
off-policy actor-critic 交替更新:critic 用 replay 采样拟合 TD 目标,actor 更新策略参数以提高 Q Q Q。连续动作空间里提升 Q Q Q 有两条路:一是通过候选选择/优势加权/latent 引导,不把 ∇ a Q \nabla_a Q ∇aQ 回传进生成了执行动作的策略参数;二是本文走的值梯度路------ ∇ a Q \nabla_a Q ∇aQ 通过确定性策略 a = π θ ( s ) a=\pi_\theta(s) a=πθ(s) 回传到 θ \theta θ:
公式(2):
∇ θ J = E ∇ a Q ( s , a ) ∣ a = π θ ( s ) ⋅ ∇ θ π θ ( s ) \nabla_\theta J=\mathbb{E}\left\\left.\\nabla_a Q(s,a)\\right\|_{a=\\pi_\\theta(s)}\\cdot\\nabla_\\theta\\pi_\\theta(s)\\right ∇θJ=E∇aQ(s,a)∣a=πθ(s)⋅∇θπθ(s)
把动作块当成 RL 的原子动作单元:对跨 H H H 帧的块,转移记为 ( s t , a t : t + H , r t , s t + H ) (s_t,a_{t:t+H},r_t,s_{t+H}) (st,at:t+H,rt,st+H), a t : t + H a_{t:t+H} at:t+H 是策略在 s t s_t st 生成的块、 r t r_t rt 是块执行期间累计折扣回报、 s t + H s_{t+H} st+H 是块全执行后的观测。对应的 chunk-skip Bellman backup:
公式(3):
Q ( s t , a t : t + H ) ← r t + γ H Q ( s t + H , π ( s t + H ) ) Q(s_t,a_{t:t+H})\leftarrow r_t+\gamma^{H}Q(s_{t+H},\pi(s_{t+H})) Q(st,at:t+H)←rt+γHQ(st+H,π(st+H))
这个 backup 无偏,因为 critic 条件在"生成了这段区间奖励的动作序列"上。选块而非单步作为原子单元不是偶然:在单步表述里,块内动作没有帧索引,根本无法表达"梯度只作用在该块的某个子段"------而子段选择性正是异步执行要强加的约束。
4.3 异步部署下的块级 RL:执行区目标、梯度截断与全跨度 critic
在异步部署下,若直接把上面两件拼起来、让 ∇ a Q \nabla_a Q ∇aQ 在整块上回传,策略更新就会依赖那些永不入环境的生成动作。解法是把"哪段真正执行"当成部署过程施加的已知约束写进目标(原论文 §3.3)。目标只在块的前 2 n 2n 2n 帧上定义(已提交区与执行区各占一个预算区间;基策略发出的 H H H 可以更长),记 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 为已提交区里机器人真正执行的动作(由上一块发出、视为固定):
公式(4):
max θ E Q ( s , a \~ \[ 0 , n ) , π θ ( s ) \[ n , 2 n ) ) s . t . ( a ~ 0 , n ) , π θ ( s ) \[ n , 2 n ) ) ∈ E \\max_\\theta\\mathbb{E}\\left\[Q\\big(s,\\tilde a_{\[0,n)},\\pi_\\theta(s)_{\[n,2n)}\\big)\\right\quad\mathrm{s.t.}\quad(\tilde a_{0,n)},\\pi_\\theta(s)_{\[n,2n)})\\in\\mathcal{E} θmaxE\[Q(s,a\~\[0,n),πθ(s)\[n,2n))s.t.(a~[0,n),πθ(s)[n,2n))∈E
其中 E \mathcal{E} E 是 [ 0 , 2 n ) [0,2n) [0,2n) 上物理可执行的块集合。可执行性是整跨度的属性而非仅执行区:一块被纳入仅当它在两区都有效、且在帧 n n n 边界处保持一致。丢弃区 [ 2 n , H ) [2n,H) [2n,H) 在有效执行窗之外、被目标整体排除。chunk-skip backup 也收到同一跨度:区间为 [ 0 , 2 n ) [0,2n) [0,2n) 而非全 H H H,奖励 r t r_t rt 在这 2 n 2n 2n 帧累计、bootstrap 状态为 s t + 2 n s_{t+2n} st+2n、折扣指数为 2 n 2n 2n,仍保无偏(critic 条件在 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 接 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 这一真正生成奖励的序列上)。
梯度截断到执行区。 从策略视角看,已提交区不产生有效环境反馈(这些动作被上一块覆写),不构成当前策略的有效梯度路径。于是 ∇ a Q \nabla_a Q ∇aQ 只对 a [ n , 2 n ) a_{[n,2n)} a[n,2n) 计算。这确立了一个关键同一性:接收值梯度的段同时是策略输出又是环境真正执行的动作,使所得梯度对策略参数良定义。注意截断只作用于梯度路径,critic 仍在整块上运作。
critic 为何要吃整块。 异步执行把这里变成并发决策问题:执行区不是从 s t s_t st、而是从 s t + n s_{t+n} st+n 开始动作,中间帧由正在飞行的块支配。若 critic 只条件在 ( s t , a n , 2 n ) ) (s_t,a_{\[n,2n)}) (st,a\[n,2n)) 上,就会对 replay 里那些由更老策略诱导的飞行块分布做边缘化。并发决策过程要求用两个量增广状态------当前飞行中的动作、及其剩余完成时间(原论文引 \[35)。本设定里延迟预算把后者固定为常数 n n n,而块缝合一致性使前者在生成时直接可得:每个新生成块的已提交区正好等于上一块已发出的动作,记录这些发出动作就免费且精确地提供了所需状态增广。
平滑性。 可执行集约束 E \mathcal{E} E 限制的不是策略能作用的帧、而是被优化的块集合。actor 也条件在已提交区上,但理由与 critic 不同:已提交区与执行区在帧 n n n 相连,候选块必须在知晓它要接续的轨迹下选出。继承自预训练策略的平滑性由示教提供、而非显式强制;可一旦值目标在执行区上抬高 Q Q Q,这种平滑性不再保证,连续性必须作为显式约束重新引入目标------于是优化只在 E \mathcal{E} E 上搜索、把平滑性要求转回策略本身。这套表述基于 §4.1 的时序模型,因此转移必须在同一执行语义下采集:异步循环在训练 rollout 里就跑、而非只在部署,保证 replay 记录的是机器人真正执行的动作;同步执行下采的转移里没有显式区域边界可供目标对齐。这正面回答了第 1、2 个问题:异步给梯度带来的麻烦是"被求导动作 ≠ 执行动作",而 critic 吃整块是因为 chunk-skip 无偏性与并发状态增广都离不开已提交区。
4.4 具体实例化:冻结基策略、双干预模式与训练循环
实例化沿用 RLT 骨架:冻结基策略出参考块、轻量 TD3 式 actor-critic 经一个 RL token 读基策略内部表征、预测残差修正(原论文 §3.4)。这骨架无需结构性改动就满足 §4.3 要求:它提供块级 actor(使帧索引梯度截断可表达)、在原始动作空间运作(免于反演人机干预)、并暴露一个可把已提交区作为 stop-gradient 项追加的 critic 输入。
)
如上图所示,冻结基策略 π b a s e \pi_{\mathrm{base}} πbase 产生潜在表征 z t z_t zt 与参考动作块 a ˉ t : t + 2 n \bar a_{t:t+2n} aˉt:t+2n;可训练的附着网络以 z t , s t , a ˉ t : t + 2 n z_t,s_t,\\bar a_{t:t+2n} zt,st,aˉt:t+2n 为输入预测一个有界修正、加到参考块上得到最终块;critic 条件在修正后的块上,而梯度只经执行区回传到 actor(§4.3)。人机干预施加在发出的原始动作空间上,使干预轨迹可直接并入训练(见下)。
人在环干预。 演化策略期间支持两种模式(原论文 §3.4):
)
如上图所示,上面是绝对干预------遥操作块直接发出、actor 输出丢弃;下面是残差干预------人输入加到 actor 输出上、操作者改而非换策略块。两模式下游处理完全相同:实际发出的动作记入 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 并当 BC 目标。块级标注是否被干预,决定执行区的 BC 目标 a [ n , 2 n ) t a r g e t a_{[n,2n)}^{\mathrm{target}} a[n,2n)target(干预块用实际发出块、否则用基策略参考),而已提交区恒用参考动作当目标。 Q Q Q 的输入与干预标志无关:已提交区记的是实际发出动作,故上一块若被干预则含人的动作------§4.3 的状态增广继续忠实表示飞行中的动作。这正面回答了第 5 个问题:原始动作空间下人机动作与策略输出同空间,干预块既当 BC 回归目标又当 critic 的 TD 转移,无需 latent 反演。两种模式适配不同任务:残差干预保留块的时间结构只改轨迹、用于动态任务(抛掷);绝对干预给操作者全块控制、用于需高精度大灵活的任务(开箱、笔盖)。
critic / actor / buffer / 调度。 critic 是每隐层带 LayerNorm 的 MLP,输入 z t , s t , a \~ \[ 0 , n ) , a \[ n , 2 n ] z_t,s_t,\\tilde a_{\[0,n)},a_{\[n,2n}] zt,st,a\~\[0,n),a\[n,2n]、输出标量;目标构造跟 TD3(目标 actor 动作加裁剪高斯噪声、对目标值取悲观估计),但有三处偏离骨架:块显式分区成已提交/执行区并都喂给 critic;backup 用 chunk-skip 而非单步;固定双 Q Q Q 扩成 REDQ 式 N N N 个独立 critic 集成、在随机子集上取 min。actor 同构 MLP,输入 z t , s t , a ˉ t : t + 2 n z_t,s_t,\\bar a_{t:t+2n} zt,st,aˉt:t+2n 输出长 2 n 2n 2n 的块;残差模式下预测有界修正加到参考块。actor 损失三项:
公式(5):
L a c t o r = − Q ( z , s , s g a \~ \[ 0 , n ) , a n , 2 n ) ) + w b c ∥ a − a t a r g e t ∥ \[ 0 , 2 n ) 2 + w s m o o t h ∑ k = 1 3 w k ∥ Δ k a ∥ \[ 0 , 2 n ) 2 \\mathcal{L}_{\\mathrm{actor}}=-Q\\big(z,s,\\mathrm{sg}\[\\tilde a_{\[0,n)},a_{n,2n)}\\big)+w_{\\mathrm{bc}}\\\|a-a\^{\\mathrm{target}}\\\|_{\[0,2n)}\^{2}+w_{\\mathrm{smooth}}\\sum_{k=1}\^{3}w_{k}\\\|\\Delta\^{k}a\\\|_{\[0,2n)}\^{2} Lactor=−Q(z,s,sg\[a\~\[0,n),a[n,2n))+wbc∥a−atarget∥[0,2n)2+wsmoothk=1∑3wk∥Δka∥[0,2n)2
第一项是 §4.3 的 Q Q Q 最大化,第二项是 TD3+BC 式的 BC 锚(锚定参考动作而非数据集动作),第三项是 §4.3 可执行集 E \mathcal{E} E 的实例化------用逐帧速度/加速度/jerk 界限刻画 E \mathcal{E} E、松弛成惩罚; s g ⋅ \mathrm{sg}\\cdot sg⋅ 是 stop-gradient:整块喂给 Q Q Q,但对 θ \theta θ 的梯度只过执行区。replay buffer 先用纯基策略在部署循环下 rollout 初始化(附着网络不激活),保证每条转移都在目标的时序假设下采的、并给 critic 一个改进起点的初始拟合;奖励稀疏、仅回合末由操作者判成功给出。更新节奏由 rollout 进度而非墙上时间决定:每条新轨迹做 G G G 次 critic 迭代,actor 与目标网络每 D D D 次 critic 迭代更新一次,使 update-to-data 比受 rollout 吞吐上界约束。完整训练循环见下。
Algorithm 1 SmoothRL training in the asynchronous inference loop
Require: frozen π_base with RL-token encoder E, budget n, discount γ,
soft-update rate τ, step size η, update-to-data ratio G, actor delay D
Initialize: π_θ and {Q_φ_i}_{i=1}^N ;
targets θ⁻ ← θ, φ_i⁻ ← φ_i ; replay buffer D
ã_[0,n) ← hold action # robot stationary until first chunk arrives
# Process 1 & 2 run concurrently, sharing D and the parameters.
1: Process 1: asynchronous rollout
2: for t = 0, n, 2n, ... do
3: observe s_t
4: ā_{t:t+2n} ← π_base(s_t, ã_[0,n)) ; z_t ← E(π_base)
5: a_{t:t+2n} ← π_θ(z_t, s_t, ā_{t:t+2n})
6: a_[0,n) ← ã_[0,n) # committed region over [t, t+n)
7: a^target_[0,2n) ← ā_[0,2n)
8: if teleoperation then
9: a_[n,2n) ← a^human_[n,2n) # absolute or residual (§3.4)
10: a^target_[n,2n) ← a_[n,2n)
11: issue a_[n,2n)
12: record transition τ_t = (s_t, z_t, ã_[0,n), a_[n,2n), a^target_[0,2n]) # finished at t+2n
13: if t ≥ 2n then
14: τ_{t-2n} ∪= (r_{t-2n}, s_t, z_t, ā_{t:t+2n}, a_[0,n)) # reward over [t-2n,t); next state
15: append τ_{t-2n} to D
16: ã_[0,n) ← a_[n,2n) # update committed region for next step
17: Process 2: off-policy updates
18: for each trajectory appended by Process 1 do
19: for G iterations do
20: sample a batch B ⊂ D
21: for each τ = (s, z, ã_[0,n), a_[n,2n), a^target, r, s', z', ā', ã'_[0,n)) ∈ B:
22: draw M ⊂ {1,...,N} at random
23: a' ← π_θ⁻(z', s', ā') + ε # clipped Gaussian ε
24: y ← r + γ^{2n} min_{i∈M} Q_{φ_i⁻}(z', s', ã'_[0,n), a'_[n,2n))
25: φ_i ← φ_i − η ∇_{φ_i} Σ_B (Q_{φ_i}(z, s, ã_[0,n), a_[n,2n]) − y)² for all i
26: if every D-th iteration then
27: θ ← θ − η ∇_θ L_actor # Eq. (5)
28: θ⁻ ← τθ + (1−τ)θ⁻
29: φ_i⁻ ← τφ_i + (1−τ)φ_i⁻ for all i
算法里两件事值得点出:第 6 步把已提交区显式设为上一块实际发出的 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n)(stop-gradient),第 16 步又把它更新为当前执行区------这是并发状态增广的工程落地;第 14 步在 t ≥ 2 n t\ge 2n t≥2n 时才把奖励与下一状态补进 2 n 2n 2n 步前的转移,正对应 chunk-skip backup 的 2 n 2n 2n 跨度与 γ 2 n \gamma^{2n} γ2n 折扣。基策略在 TT-RTC 调度器下跑以维持 §4.1 的时序保证,每次前向同时产出参考块 a ˉ t : t + 2 n \bar a_{t:t+2n} aˉt:t+2n 与 RL token z t z_t zt。
五、实验与证据:结果能支撑到什么程度
5.1 平台与三个任务
三任务在 Astribot S1 上做------一台 25 自由度移动双臂机器人(两支 7-DoF 臂带平行夹爪、4-DoF 躯干、2-DoF 头、3-DoF 轮式底盘)。基策略观测为三路相机(头、左腕、右腕,各 224 × 224 224\times224 224×224)加本体关节状态,发 31 维动作于 30Hz(左/右臂与躯干末端 9 维笛卡尔 delta 位姿 + 2 夹爪 + 2 头关节);附着 actor-critic 只改 20 维臂动作、躯干与头不动。推理以 5Hz 请求、新块每 200ms 到、对应延迟预算 n = 6 n=6 n=6 帧;基策略训到预测 H = 32 H=32 H=32 帧,故已提交区+执行区共 12 帧、丢弃区 20 帧。
)
如上图所示,三任务跨两互补区间:高速动态操作与高精度双臂操作。动态抛掷 :抓起随机放置的物体抛进随机放置的桶------成功要求末端在释放前全程积累足够速度而非瞬时达标,对异步执行尤其敏感(块边界一停、剩余挥动来不及恢复释放速度),桶口约 7 × 12 7\times12 7×12cm、物约 6 × 7 6\times7 6×7cm。笔盖 :对齐笔与盖、压紧、释放------插入需相对位姿落在约 5mm 间隙内,超出则盖会偏转而非就位,双臂主动控制使精度取决于相对位姿。开箱:左手稳箱、右臂插刃入缝、沿缝切胶带、翻盖------刃约 1mm 宽、缝仅 2--3mm,需毫米级入缝,错向任一侧都会失败(切纸板或漏胶带),入缝后缝引导刀运动、主难在入缝精度。
5.2 训练设置与评测协议
附着 actor-critic 是 3 层 MLP、每层 512 单元;update-to-data 比 G = 5 G=5 G=5、actor 延迟 D = 5 D=5 D=5(每条新轨迹 5 次梯度更新,actor 与目标网络每 5 次更新一次);batch 256;修正界 0.05(基策略已接近成功、只需小修正)。奖励由操作者经手柄/VR 给稀疏二值:仅在判任务完成时终止并给奖励,无中间奖励;回合后回初始位姿、复位场景。训练时操作者按需干预以维持成功/失败回合的均衡比。
)
如上图所示,评测用预定义初始状态构型------开箱 10 个箱位、抛掷 18 个(3 物位×6 桶位)、笔盖 12 个(4 初始手态×3 笔盖位),与在线微调时所用相同,每构型评一次、分别得 10/18/12 回合。比较四个时点:冻结基策略 π 0.5 \pi_{0.5} π0.5(无附着网络,零点)、以及引入附着网络后第 150/200/250 rollout 回合的检查点。监督预训练用示教:开箱与笔盖各 1500 条、抛掷 500 条(后者更难采------跨所有桶位遥操成功率仅约 50%,因人也要维持连续挥动)。在线 RL 先用纯基策略采 50 回合热身 replay、再引入附着网络。四检查点同硬件、同异步推理循环与延迟预算,唯一变量是附着网络的在线微调量。
5.3 结果:三任务大幅提升、非单调学习与"最后一毫米"
250 回合后三任务都大幅超过冻结基策略:动态抛掷 39%→94%、笔盖 8%→83%、开箱 30%→90%。下表与学习曲线给出全过程。
原论文表 1:各检查点成功率(累计 rollout 回合数,每成功率按每初始构型一回合算)。
| Task | Number of Rollout Episodes | Success Rate |
|---|---|---|
| Dynamic Tossing | 0 (base policy) | 39% |
| Dynamic Tossing | 150 | 72% |
| Dynamic Tossing | 200 | 83% |
| Dynamic Tossing | 250 | 94% |
| Pen Capping | 0 (base policy) | 8% |
| Pen Capping | 150 | 67% |
| Pen Capping | 200 | 75% |
| Pen Capping | 250 | 83% |
| Box Opening | 0 (base policy) | 30% |
| Box Opening | 150 | 20% |
| Box Opening | 200 | 40% |
| Box Opening | 250 | 90% |
)
如上图所示,零点为冻结基策略(虚线延展作参考),三个非零检查点来自每任务单次 RL run。抛掷与笔盖单调上升、前 150 回合涨幅最大(笔盖 8%→67%,说明主导系统偏置早早就修掉了大半,之后主要受修正轨迹周围的残余变化限制)。开箱则呈非单调:150 回合后先掉到 20%(低于基策略的 30%),200 回合回到 40%,250 到 90%。这正面回答了第 6 个问题------非单调反映附着网络在适配任务时为发现有效修正所需的探索,是真实机器人在线 RL 的固有性质而非 bug;也说明不能只看早期点判方法成败。
基策略的失效模式。 三任务的失败是系统性的而非随机:笔盖里策略对不同盖位产生相似轨迹、不调盖位致仅 8%;开箱里刀刃有稳定左偏、扎进纸板而非入胶带缝;抛掷里策略不随目标距离调释放速度(近桶过射、远桶欠射,且对侧目标有系统左右偏)。
在线 RL 修了什么。 附着网络逐步修正基策略的系统偏移。下图把 250 回合检查点的代表性失败与基策略失败并排。
)
如上图所示,对比两行可见失败在向成功靠拢:基策略沿固定方向以可见余量脱靶,RL 后剩的是围绕正确位姿的小散布------抛掷物落点更近桶、破了基策略的固定偏置;开箱刀刃偏离缝小到 1--2mm 左右散布;笔盖轴向外错位同样收成围绕正确位姿的小散布。这些偏移量正是任务难的地方:成功不是到目标区、而是闭合最后几毫米,小到图像里勉强可辨的误差就足以失败。这正回应了第 4 个问题的另一半:值梯度路在原始动作空间直接改策略,所以能把这种毫米级系统偏移逐步抵消------这是 latent-space 路线(受冻结解码器表达力上界封顶)做不到的。
六、这篇工作的边界与可复现性
边界。 框架通用,但当前实例化有两已知限制(原论文 §Limitations)。一是推理延迟约束:框架在固定推理频率下运作、要求每次块级推理在预算 n n n 内完成;当推理延迟时变波动使实际计算时间超预算,预定的块交接无法保证,时序失配会动摇异步执行循环。二是表达力受基策略封顶:RL 模块条件在 VLA 内部表征上,故感知能力被 VLA 嵌入信息丰富度上界封顶;且当前只产出对参考动作的有界残差修正,修正幅度被固定局部邻域卡住,当基策略对目标域数据有系统偏置时,局部残差修正表达力不足以纠正错误策略行为。
可复现性。 关键实现细节齐全。策略: π 0.5 \pi_{0.5} π0.5 作冻结基策略、附着 actor-critic 为 3 层 MLP(512 单元/层),冻结基策略下 TT-RTC 调度维持时序。RL: G = 5 G=5 G=5、 D = 5 D=5 D=5、batch 256、修正界 0.05、REDQ 式 N N N critic 集成、TD3+BC 式 BC 锚、平滑正则用逐帧速度/加速度/jerk 界限。时序:5Hz 推理、 n = 6 n=6 n=6 帧、 H = 32 H=32 H=32、控制 30Hz、31 维动作(附着网络只改 20 维臂动作)。平台:Astribot S1(25-DoF 移动双臂)、三路 224×224 相机。奖励稀疏二值、由操作者判成功;人在环干预走绝对/残差两模式、干预块同时作 BC 目标与 TD 转移。数据:开箱/笔盖各 1500 条示教、抛掷 500 条;在线 RL 先 50 回合纯基策略热身 replay。
七、如果继续研究/落地,应该关注什么
- 把 committed prefix 当 prefix-constrained generation。 当前三区里已提交区是"输出空间覆写",若把值梯度扩到整个生成策略(如 QAM 的 adjoint terminal condition ∇ a Q \nabla_a Q ∇aQ),保留已发动作就变成前缀约束生成问题------这指向更一般的"部分提交生成下的在线策略优化"。
- 把 blending 写进目标而非外挂。 框架排除了外挂混合算子,但不阻止把混合直接放进目标:让 critic 评估最终被执行的混合动作、可能给更忠实的训练信号,代价是目标时序依赖更宽、需围绕混合算子加连续性约束、且每个贡献块多一次 actor 前向。要注意混合权通常在块交界(最需连续处)衰减------平滑性与学习信号强度可能有不利 trade-off。
- 用分布偏移实验定位"局部修正失效点"。 系统增大与预训练基策略的分布偏移,看局部修正何时不够用、该上更表达的 adapter 还是全生成策略更新。这能区分学习算法本身的限制与所选策略参数化的限制。
- 延迟预算的自适应。 现在固定 n n n 在推理延迟长时波动下会失配(限制一);能否让预算随实测延迟自适应、同时保住固定执行窗,是把框架推向更现实部署的关键工程问题。
- 把人机协作干预信号结构化。 现在干预只作 BC 目标与 TD 转移;若把"操作者为何干预"的偏好也纳入,可能给更密的奖励信号,降低稀疏奖励下的样本成本。
八、术语与概念速查
| 术语 | 含义 / 在本文中的角色 |
|---|---|
| χ 0 \chi_0 χ0 / RECAP | 离线 RL 路线:优势经独立价值模型估计,靠 AWR 加权或 CFG 条件影响策略,不把 ∇ a Q \nabla_a Q ∇aQ 回传进策略参数;支持异步部署。 |
| CO-RFT | 离线块级 Cal-QL(Chunked Cal-QL),但部署同步------说明离线 RL 里异步只是调度选择。 |
| RLT | 冻结 VLA + RL token + 块级 TD3 actor 的骨架,SmoothRL 实例化直接沿用它。 |
| EXPO-FT | 冻结 VLA + 残差编辑头 + SAC actor + Best-of-N,同属值梯度同步在线 RL。 |
| GR-RL | 异步受限在线 RL:优化变量在冻结扩散策略的 latent noise 空间,改进被冻结解码器表达力上界封顶。 |
| LWD | fleet 规模在线 RL:块级 critic,经 adjoint-matching 把 ∇ a Q \nabla_a Q ∇aQ 传进 flow 策略头,假设同步执行。 |
| QAM | adjoint matching,终值条件 ∇ a Q \nabla_a Q ∇aQ------SmoothRL 未来扩展到全生成策略的天然接口。 |
| Dynamic tossing / pen capping / box opening | 三评测任务:桶口 ~7×12cm 物 ~6×7cm;笔盖间隙 ~5mm;刃 1mm 缝 2--3mm。 |
| Astribot S1 | 25-DoF 移动双臂机器人(2×7-DoF 臂 + 4-DoF 躯干 + 2-DoF 头 + 3-DoF 轮式底盘)。 |
| π 0.5 \pi_{0.5} π0.5 | 冻结基策略(Physical Intelligence),出参考块与 RL token。 |
| 绝对 / 残差干预 | VR 直接发块 / 手柄位移作 delta 加到 actor 输出;下游都记入 a ~ [ 0 , n ) \tilde a_{[0,n)} a~[0,n) 当 BC 目标。 |
| TT-RTC 调度器 | 维持基策略时序保证、使每次前同时出参考块与 token 的训练时动作条件调度。 |
| chunk-skip Bellman backup | Q ( s t , a t : t + H ) ← r t + γ H Q ( s t + H , π ( s t + H ) ) Q(s_t,a_{t:t+H})\leftarrow r_t+\gamma^H Q(s_{t+H},\pi(s_{t+H})) Q(st,at:t+H)←rt+γHQ(st+H,π(st+H));异步下跨度收到 [ 0 , 2 n ) [0,2n) [0,2n)。 |
| REDQ | critic 集成,在随机子集上取 min,替代 TD3 的固定双 Q Q Q。 |
| G G G / D D D | update-to-data 比 G = 5 G=5 G=5(每条新轨迹 5 次梯度更新)、actor 延迟 D = 5 D=5 D=5(每 5 次更新一次 actor/目标网络)。 |
| Agreement / differentiability | 两要求:发出的动作=执行的动作;该动作对 θ \theta θ 有有效梯度路径------直接发策略输出即同时满足。 |
| latency budget n n n | 推理时间上界,固定 d = c = n d=c=n d=c=n,执行窗 [ n , 2 n ) [n,2n) [n,2n),本文 n = 6 n=6 n=6 帧。 |
九、拓展思考:值得继续扩展研究与思考的创新点
- 从"输出空间覆写"到"前缀约束生成"。 现在已提交区是把策略输出整段替换;若值梯度能进整个生成策略,保留已发动作就升级为前缀约束生成,这或许是异步在线 RL 与扩散/流策略更深融合的钥匙。
- 并发决策的更精细状态增广。 论文用"飞行中动作 + 剩余时间"增广状态,后者被延迟预算固定为 n n n;若延迟允许波动,剩余时间不再是常数,状态增广与 bootstrap 时序都得重推------这是把框架从"固定预算"推向"弹性时序"的理论关口。
- 平滑性与学习信号的联合优化。 可执行集 E \mathcal{E} E 现以惩罚项松弛进目标;能否用一个可微的连续性算子,让平滑性约束与 Q Q Q 最大化在梯度层耦合而非相加,可能给出更紧的可行块集。
- 干预作为偏好信号。 操作者何时干预、干预多少,本身携带相对偏好信息;把它与稀疏二值奖励结合,或能在不改 RL 目标结构的前提下压低样本成本。
- 跨任务的修正界自适应。 修正界 0.05 跨三任务固定;但开箱的毫米级精度与抛掷的速度修正需求不同,让修正界随任务/随训练进度自适应,可能是把"局部残差"这条路线推到其表达力上界前的低成本改进。
学习信号的联合优化。** 可执行集 E \mathcal{E} E 现以惩罚项松弛进目标;能否用一个可微的连续性算子,让平滑性约束与 Q Q Q 最大化在梯度层耦合而非相加,可能给出更紧的可行块集。 - 干预作为偏好信号。 操作者何时干预、干预多少,本身携带相对偏好信息;把它与稀疏二值奖励结合,或能在不改 RL 目标结构的前提下压低样本成本。
- 跨任务的修正界自适应。 修正界 0.05 跨三任务固定;但开箱的毫米级精度与抛掷的速度修正需求不同,让修正界随任务/随训练进度自适应,可能是把"局部残差"这条路线推到其表达力上界前的低成本改进。