DF-ExpEnse:让扩散策略学会「聪明地探索」,机器人微调样本效率大幅提升

导读

想象一下:你手上有一个已经从大量离线数据中学到了基本操作技能的机器人策略,现在需要把它放到真实环境中去"实习"。问题来了------它该怎么利用有限的实习机会,尽快把技能打磨到位?

这就是强化学习微调(RL finetuning)面临的核心挑战:在线经验收集太贵了。每一步真实交互都消耗时间、算力甚至硬件损耗,但如果机器人只是漫无目的地随机探索,大量宝贵的交互机会就白白浪费在了已知区域。

来自斯坦福大学的研究团队(Calvin Luo、Chen Sun、Shuran Song)在 ICML 2026 上提出了 DF-ExpEnse(Diffusion Filtered Exploration via Ensembles),一种让预训练扩散策略在微调阶段"聪明探索"的技术。核心思路出人意料地简洁:既然扩散模型天生就能生成多种候选动作,那就用一组批评家网络来评估哪个候选最值得尝试------不是选"最好的",而是选"最有学习价值的"。

背景与动机

近年来,扩散策略(Diffusion Policy)在机器人行为克隆领域取得了显著成功。通过在大规模离线数据上训练,扩散模型可以学会将噪声逐步去噪为高质量的控制动作序列。这类生成式控制策略的一大优势在于其多模态建模能力------面对同一个状态,模型可以生成多种合理的动作方案。

然而,离线学习的策略终究是"纸上谈兵"。要让机器人真正适应目标环境,在线微调不可避免。目前主流的微调框架包括:

  • DSRL:冻结预训练的扩散策略,通过 SAC 优化噪声输入来调整输出动作

  • ResFiT:学习一个残差策略来修正扩散模型的输出

  • DPPO:将去噪过程本身视为一个内部 MDP,用 PPO 优化

这些方法在"怎么用在线数据更新策略"上各有巧思,但都忽略了一个上游问题:在线数据本身的质量。如果收集到的经验尽是重复的、低信息量的交互,再好的更新算法也只是在低质量数据上做无用功。

DF-ExpEnse 正是瞄准了这个"数据质量"缺口。如上图所示,它的设计理念清晰:将无边界的原始动作空间通过扩散滤波器提取为高质量候选集,再用集成评论器锁定最优动作。它不改变底层的 RL 算法,而是作为一个可插拔的探索模块,优化每一步"该执行哪个动作"的决策,从源头上提升在线经验的信息含量。

核心方法

三步探索:从候选生成到智能筛选

DF-ExpEnse 的算法设计精巧且直观,每个时间步执行三个步骤:

第一步:候选动作生成。 从当前的扩散策略中采样 M 个候选动作:[a_1, ..., a_M] ~ pi(a|s)。这一步充分利用了扩散模型的多模态特性------它不是只输出一个"最佳"动作,而是生成一组覆盖动作空间不同模态的候选方案。默认设置 M=3,计算开销极低。

第二步:探索兴趣评估。 用 K 个批评家组成的集成网络评估每个候选动作的"探索兴趣"(exploration interest):

e_m = min(Q_1...K(a_m, s)) + alpha * std(Q_1...K(a_m, s))

这个公式的设计颇有讲究:min(Q) 取集成中的最小值估计,防止 Q 值过高估计带来的盲目乐观;std(Q) 计算集成间的标准差,量化模型对该动作的不确定性------不确定性越高,说明这个动作的"探索价值"越大。两者通过权重 alpha(默认 0.5)线性组合,在"利用已知"和"探索未知"之间取得平衡。

第三步:动作选择。 执行探索兴趣最高的动作:a* = argmax(e_1, ..., e_M)

如上图所示,集成评论器的目标不是简单地选择质量最高或不确定性最大的动作,而是在二者构成的二维空间中找到帕累托最优解------那个既有足够高的任务执行质量、又能提供最多环境信息的动作。

这个框架的关键洞察在于:扩散模型天然提供了一个"可评估的离散候选集",绕过了在连续动作空间中做 UCB 探索的数学困难。传统方法要在无穷维的动作空间中寻找最优探索点,而 DF-ExpEnse 把问题简化为"从 M 个候选中选一个",既保留了探索的有效性,又确保了计算可行性。

BC-SR:防止遗忘的安全网

微调过程中有一个隐患:随着策略不断更新,它可能逐渐遗忘预训练阶段学到的有效行为模式(mode collapse)。DF-ExpEnse 通过 BC-SR(Behavior Cloning Sampling Regularization)机制来应对这个问题。

具体做法是:在 M 个候选动作中,保留 p 个来自初始预训练策略(而非当前更新后策略)的采样。这意味着无论策略怎么演化,候选集中始终有一部分"原版行为"作为参照,防止探索过程中丢失已经学到的有效技能。

消融实验证实了 BC-SR 的重要性:移除 BC-SR 后样本效率一致下降;反过来,为纯贪心的 Max-Q 方法添加 BC-SR 则能显著提升其性能。这说明 BC-SR 不仅仅是"锦上添花",而是一个独立发挥作用的关键组件。

集群协作探索:多机器人的信息共享

在多机器人并行部署(fleet)场景下,DF-ExpEnse 引入了集群归一化(Fleet Normalization)机制,让多个智能体之间共享探索信息。

核心思路是:将所有 N 个智能体的全部 N*M 个候选动作的价值估计和不确定性估计放在一起做 z-score 归一化:

v_bar = (v - mean(all_v)) / std(all_v) d_bar = (d - mean(all_d)) / std(all_d)

然后每个智能体从自己的候选集中选择归一化后探索兴趣最高的动作。这个机制的效果是:如果智能体 A 的某个候选动作在整个集群看来不确定性很高,它会被优先探索;而如果多个智能体的候选动作落在相似区域,归一化会自动降低它们的相对优先级,引导智能体们分散探索。

这种跨智能体通信有效避免了冗余探索------多台机器人不会在同一片区域反复尝试相同的动作,而是自发地分工覆盖更广的经验空间。

实验与结果

研究团队在三大类任务、多个基准环境上验证了 DF-ExpEnse 的有效性,实验设计覆盖了操纵、运动和双臂协作等典型机器人场景。

操纵任务:稀疏奖励下的显著优势

在 RoboMimic 基准上(Lift、Can、Square、Tool Hang 四个任务),使用稀疏 0-1 奖励评估成功率。DF-ExpEnse 在所有任务上都展现出一致的样本效率优势,尤其在 Square 和 Tool Hang 这类需要精细操控的高难度任务上,性能差距更加显著。

一个耐人寻味的发现是:纯贪心的 Max-Q 基线在操纵任务上甚至低于 Vanilla DSRL。这个看似反直觉的结果恰恰印证了 DF-ExpEnse 的设计理念------只追求"当前最优动作"会导致过早收敛到局部最优,反而不如保留一定的探索性。Max-Q 的失败不是因为它选错了动作,而是因为它从不尝试那些"可能更好但尚未确认"的动作。

运动控制:跨领域通用性验证

在 OpenAI Gym 的三个经典连续控制任务(HalfCheetah-v2、Hopper-v2、Walker2D-v2)上,DF-ExpEnse 同样展现出稳定的累积奖励提升。这些任务与操纵任务在状态空间、动作空间和奖励结构上都有本质区别,DF-ExpEnse 的一致性表现证明了方法的跨领域通用性。

值得一提的实现细节是:Walker2D-v2 使用了 K=2 的批评家集成(而非默认的 K=10),因为在该任务的特定超参组合下,K=10 会导致训练不稳定。这提示在实际部署时,虽然默认设置通常有效,但极端情形仍可能需要针对性调整。

框架无关性:与 ResFiT 的集成

在 DexMimicGen 双臂操纵基准(Can Sort、Box Cleanup、Coffee)上,DF-ExpEnse 与另一个微调框架 ResFiT 无缝集成,同样带来了一致的样本效率收益。这证明 DF-ExpEnse 不是绑定于某个特定 RL 算法的技巧,而是一个真正通用的探索模块------无论底层是优化噪声输入(DSRL)还是学习残差动作(ResFiT),只要微调过程涉及动作选择,DF-ExpEnse 就能介入并提升数据质量。

消融研究:每个组件都不可或缺

消融研究系统地拆解了各组件的贡献,结论清晰而有力:

BC-SR 是性能保障的关键。 移除 BC-SR 后样本效率一致下降;为纯贪心的 Max-Q 添加 BC-SR 则显著提升性能。有趣的是,"DF-ExpEnse 去掉 BC-SR"和"Max-Q 加上 BC-SR"的性能介于完整 DF-ExpEnse 和纯 Max-Q 之间,说明 BC-SR 和探索兴趣评估是两个独立有效的正交机制。

批评家集成规模存在明确的"够用"阈值。 K=5 即达到性能饱和,K=10 几乎无额外收益;但 K=2 导致性能骤降,因为仅两个批评家无法提供可靠的不确定性估计。对于实际部署,K=5 到 K=10 都是安全选择。

候选采样数 M=3 性价比最优。 M=5 和 M=7 只带来了微弱的边际提升,而 M=3 的计算开销最低。这意味着 DF-ExpEnse 的额外推理成本仅仅是多做两次扩散模型的前向传播------在以环境交互为主要瓶颈的在线微调中,这个开销几乎可以忽略。

集群归一化在所有任务上都带来了稳定提升。 与相同规模但各自独立运行的 DF-ExpEnse 智能体相比,启用集群归一化后的协作探索一致优于孤立探索。这证实了跨智能体通信的价值:信息共享带来的探索效率提升远超通信本身的开销。

讨论与思考

为什么 DF-ExpEnse 有效? 本质上,它解决了一个被长期忽视的"数据质量"问题。过去的微调工作主要关注如何更好地利用已有数据(更好的梯度、更好的 loss),而 DF-ExpEnse 把注意力放在了更上游的环节:如何收集更好的数据。这种视角的转换,让一个简单的"采样-评估-选择"流程就能带来显著的效率提升。

设计的优雅之处。 DF-ExpEnse 没有引入额外的探索奖励、好奇心模块或预测模型,而是充分复用了 RL 微调中本就存在的组件------扩散模型的多模态采样能力和批评家网络的价值估计能力。它只是用一种更聪明的方式把这些已有组件组合起来。这种"不加新东西,只是更好地用好已有的东西"的设计哲学,在工程实践中往往意味着更好的可维护性和更低的集成成本。

局限与未来方向。 论文坦诚地指出了两个值得思考的方向:一是当前的逐时间步探索可能在某些已经掌握的状态区域造成不必要的开销,动态判断"何时需要探索"可以进一步提升效率;二是在大规模真实部署中,全部智能体之间的实时通信可能存在延迟瓶颈,分片归一化(sharded normalization)是一个值得探索的工程解法。

更广的启示。 DF-ExpEnse 的思路不局限于机器人。任何使用生成模型做决策、且需要在线微调的场景------对话 AI 的 RLHF、自动驾驶的在线适应、游戏 AI 的策略优化------都可以借鉴"利用生成模型的多样性来优化探索"这一范式。当生成式 AI 从"生成内容"走向"生成决策"时,如何聪明地探索,将成为一个愈发重要的课题。

总结

  • DF-ExpEnse 将扩散策略的多模态采样能力转化为探索工具,用批评家集成在候选动作中平衡质量与不确定性,从源头提升在线数据质量。

  • 三个核心组件各司其职:候选生成利用扩散模型的表达力,集成评估量化探索价值,集群归一化实现跨智能体协作------每一个都经过消融验证不可或缺。

  • 即插即用的模块化设计,已在 DSRL 和 ResFiT 两大微调框架上验证有效,跨越操纵和运动两大任务类型,默认超参数即可获得稳健性能提升。

  • M=3、K=5 的低开销默认配置证明高效探索不需要大量额外计算,让 DF-ExpEnse 具备实际部署的工程可行性。

  • "优化数据收集而非数据利用"的视角转换,为强化学习微调开辟了一条与算法改进正交的提效路径。


本文基于 DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning1 解读。

引用链接

1DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning: https://arxiv.org/abs/2606.19656