(ICLR2026)MORL‑FB:从无奖励强化学习视角重新审视多目标强化学习

文章目录

导读

完整论文:论文《A REWARD-FREE VIEWPOINT ON MULTI-OBJECTIVE REINFORCEMENT LEARNING》(ICLR 2026)

打通多目标强化学习 (MORL)与无奖励强化学习 (RFRL)两大独立领域,把 RFRL 作为辅助任务解决传统 MORL 泛化差、样本低效的痛点,同时实现独有零样本跨目标迁移能力。

改造原生 RF-FB 框架,搭配偏好引导探索与多目标专属损失,在全部离散 / 连续多目标基准上全面超越 SOTA。

背景动机

无奖励强化学习 RFRL(代表:FB Forward-Backward 框架)

训练全程无任何奖励信号,仅学习纯环境动力学表征;测试时输入任意标量回报函数,直接输出对应最优策略。解耦环境动力学(与回报无关)和任务回报(用户偏好),用隐向量z编码任意回报对应的最优策略。

标准RL 训练全过程必须提供奖励 R,算法针对单一固定回报函数优化策略 ;更换任务 / 奖励必须重新训练。

无奖励强化学习 RFRL:训练阶段完全不接收任何奖励信号 ,智能体仅通过随机 / 结构化探索收集环境状态转移,只学习环境固有动力学规律 (环境怎么跳转、状态空间结构);测试阶段才输入任意全新的奖励函数,无需微调、重训,直接输出该奖励下的最优策略。
训练时 R 完全不可观测,仅学习后继测度 / 状态访问分布(仅由转移 P 和策略 (\pi) 决定,和奖励无关): M π ( s , a , s ′ , a ′ ) = E π ∑ t = 0 ∞ γ t ⋅ I { ( s t , a t ) = ( s ′ , a ′ )    ∣    s 0 = s , a 0 = a } \mathcal{M}^\pi(s,a,s',a') = \mathbb{E}_{\pi}\left\\sum_{t=0}\^{\\infty}\\gamma\^t \\cdot \\mathbb{I}\\{(s_t,a_t)=(s',a')\\;\\big\|\\;s_0=s,a_0=a\\}\\right Mπ(s,a,s′,a′)=Eπ∑t=0∞γt⋅I{(st,at)=(s′,a′) s0=s,a0=a}

  • I \mathbb{I} I 指示函数, M π \mathcal{M}^\pi Mπ 代表从 ( s , a ) (s,a) (s,a) 出发,策略 π \pi π 长期访问 ( s ′ , a ′ ) (s',a') (s′,a′) 的折扣总频次。
    .

RFRL 训练仅对齐 M π \mathcal{M}^\pi Mπ,全程不接触 R。测试时给定任意全新奖励函数 R new R_{\text{new}} Rnew,直接用学到的 M π \mathcal{M}^\pi Mπ 计算最优策略: π R new ∗ = arg ⁡ max ⁡ π    ∑ s ′ , a ′ M π ( s , a , s ′ , a ′ ) R new ( s ′ , a ′ ) \pi^*{R{\text{new}}} = \arg\max_{\pi}\; \sum_{s',a'} \mathcal{M}^\pi(s,a,s',a') R_{\text{new}}(s',a') πRnew∗=argmaxπ∑s′,a′Mπ(s,a,s′,a′)Rnew(s′,a′)

.

任意标量回报的 Q 值可统一写成: Q π ( s , a ) = ⟨ M π ( s , a , ⋅ , ⋅ ) , R ( ⋅ , ⋅ ) ⟩ Q^\pi(s,a) = \langle \mathcal{M}^\pi(s,a,\cdot,\cdot), R(\cdot,\cdot) \rangle Qπ(s,a)=⟨Mπ(s,a,⋅,⋅),R(⋅,⋅)⟩,内积形式证明: M π \mathcal{M}^\pi Mπ 是环境基底,R 是可变任务权重,二者天然解耦。

MORL、RFRL 解决同一核心难题:测试阶段用户偏好 / 回报未知,但过往研究完全独立,没有人将 RFRL 适配 MORL。

  • MORL 跨偏好泛化弱 :仅见过训练集权重,陌生偏好性能断崖下跌;目标维度升高(如 Humanoid5d 5 维),超体积 HV 大幅衰减;样本效率极低:仅针对线性加权回报优化,环境动力学表征复用不足。

  • 原生 FB 从标准正态 N ( 0 , I ) \mathcal{N}(0,I) N(0,I)采样隐向量z,完全不匹配 MORL 线性加权回报:盲目探索 无关状态,大量样本浪费;隐空间单峰分布 ,无法区分不同偏好对应的行为;无法利用 MORL 训练时可观测的真实向量回报,只能构造虚假伪回报,优化信号微弱。

原生 FB 采样的 z ∼ N ( 0 , I ) z\sim\mathcal{N}(0,I) z∼N(0,I)生成策略 π z \pi_z πz,对应的虚拟回报函数是完全随机、和任意 λ \lambda λ无关;而 MORL 仅需要优化 { z λ ∣ λ ∈ Δ d } \{z_\lambda \mid \lambda\in\Delta_d\} {zλ∣λ∈Δd}(所有线性加权回报对应的隐向量),正态采样的z绝大部分不在 { z λ } \{z_\lambda\} {zλ}的有效子空间内;由随机z产生交互轨迹,访问的状态对全部帕累托前沿优化无贡献,梯度更新几乎无效,

本文的核心研究问题是:能否改造 FB 无奖励框架,将 RFRL 作为辅助任务,弥补传统 MORL 泛化差、样本低效的短板?

理论贡献:MORL 是 RFRL 的子集

RF 覆盖全体任意标量回报函数;MORL 仅覆盖 d维向量回报的线性加权 这一小类回报集合;训练 RFRL 等价于学习远超 MORL 所需的策略,天然提供海量辅助学习任务,提升表征泛化;

动力学与回报解耦的结构,天然支持新增目标零样本迁移(传统 MORL 不具备该能力);

理论短板:原生z采样被困低维子空间,本文PG-Explore 偏好引导探索彻底解决。

理论基础:FB 后继测度分解

后继测度 M π ( s , a , s ′ , a ′ ) \mathcal{M}^\pi(s,a,s',a') Mπ(s,a,s′,a′)仅由环境动力学决定,和回报无关;FB 将其分解为前向网络 F θ F_\theta Fθ、后向网络 B ω B_\omega Bω: M π z ( s , a , s ′ , a ′ ) = F θ ( s , a , z ) ⊤ B ω ( s ′ , a ′ ) \mathcal{M}^{\pi_z}(s,a,s',a')=F_\theta(s,a,z)^\top B_\omega(s',a') Mπz(s,a,s′,a′)=Fθ(s,a,z)⊤Bω(s′,a′)

最优 Q 值简化: Q ( s , a , z R ) = F θ ( s , a , z R ) ⊤ z R Q(s,a,z_R)=F_\theta(s,a,z_R)^\top z_R Q(s,a,zR)=Fθ(s,a,zR)⊤zR , z R z_R zR是编码回报的隐向量,测试时由偏好 / 回报计算,直接贪心取最优动作。

方法框架

PG-Explore 偏好引导隐向量采样(最关键改进)

原生 z λ z_\lambda zλ空间局限 :理论隐向量 z λ = E B ( s , a ) λ ⊤ R = H λ z_\lambda=\mathbb{E}B(s,a)\\lambda\^\\top R=H\lambda zλ=EB(s,a)λ⊤R=Hλ

H是 d z × d d_z\times d dz×d矩阵,目标维度 d ≪ d \ll d≪隐维度 d z d_z dz,所有 z λ z_\lambda zλ被困 d维低维子空间,隐空间覆盖极小,训练极易陷入局部最优。

批量扰动构造 z ^ λ \hat{z}_\lambda z^λ :从回放缓冲采样 n s n_s ns条转移小批量,通过均值引入噪声扰动: z ^ λ = 1 n s ∑ ( s , a , r , s ′ ) ∈ D B ω ( s , a ) r ⊤ λ \hat{z}\lambda = \frac{1}{n_s}\sum{(s,a,r,s')\in D} B_\omega(s,a) r^\top \lambda z^λ=ns1∑(s,a,r,s′)∈DBω(s,a)r⊤λ

归一化约束: z ← d z z ∥ z ∥ 2 z\leftarrow \sqrt{d_z}\frac{z}{\|z\|_2} z←dz ∥z∥2z

批量噪声突破低维子空间;原生 FB 隐分布单峰集中,MORL-FB 多峰分散,不同偏好占据独立隐区域;所有隐向量绑定当前偏好 λ \lambda λ,仅探索对该加权回报有价值的状态,减少无效采样;同一个 λ \lambda λ可生成无数带噪声 z ^ λ \hat{z}_\lambda z^λ,扩充训练信号,大幅提升表征泛化。

适配 MORL 的辅助 Q 损失 Auxiliary Q Loss

原生 RF-FB 训练无真实回报,只能构造伪回报计算 TD 误差;MORL 训练可观测完整向量回报,直接使用真实标量化回报 λ ⊤ r \lambda^\top r λ⊤r构建损失: L Q ( F θ ; z λ ) = E ( F ( s , a , z λ ) ⊤ z λ − λ ⊤ r − γ F ( s ′ , π , z λ ) ⊤ z λ ) 2 \mathcal{L}Q(F\theta;z_\lambda)=\mathbb{E}\Big\\big(F(s,a,z_\\lambda)\^\\top z_\\lambda - \\lambda\^\\top r - \\gamma F(s',\\pi,z_\\lambda)\^\\top z_\\lambda\\big)\^2\\Big LQ(Fθ;zλ)=E(F(s,a,zλ)⊤zλ−λ⊤r−γF(s′,π,zλ)⊤zλ)2

消融证明:移除该损失后 HV/UT 近乎归零,是贴合多目标任务的核心优化信号。

四损失联合优化完整训练框架

MORL-FB 同步优化四类损失,分工清晰:

  • 测度损失 L M \mathcal{L}_M LM(FB 基础):约束后继测度贝尔曼一致性,解耦动力学与回报,是零样本迁移的底层基础;
  • 辅助 Q 损失 L Q \mathcal{L}_Q LQ(MORL 专属):对齐线性标量化多目标价值,贴合任务优化目标;
  • 正交正则损失 L n \mathcal{L}n Ln:约束后向网络 B ω B\omega Bω输出向量正交,防止表征坍缩、特征冗余;
  • 策略损失 L π \mathcal{L}_\pi Lπ(Actor-Critic):最大化 F ⊤ z F^\top z F⊤z对应的 Q 值,输出偏好条件策略。

正态采样z填充回放缓冲;均匀采样偏好 λ \lambda λ,PG-Explore 生成 z ^ λ \hat{z}\lambda z^λ,环境交互收集轨迹;梯度更新:批量采样转移,联合更新 F θ B ω F\theta B_\omega FθBω ( L M + L Q + L n (\mathcal{L}_M+\mathcal{L}Q+\mathcal{L}n (LM+LQ+Ln);延迟 Actor 更新:每固定轮次更新策略网络;软目标更新:平滑更新 F θ ˉ 、 B ω ˉ F{\bar{\theta}}、B{\bar{\omega}} Fθˉ、Bωˉ稳定训练。

测试推理:给定用户测试偏好 λ t e s t \lambda_{test} λtest,批量计算 z λ z_\lambda zλ,贪心输出策略:

π ( s , λ t e s t ) = arg ⁡ max ⁡ a F θ ( s , a , z λ ) ⊤ z λ \pi(s,\lambda_{test})=\arg\max_a F_\theta(s,a,z_\lambda)^\top z_\lambda π(s,λtest)=argmaxaFθ(s,a,zλ)⊤zλ

实验分析

评测环境(离散 + 连续全覆盖 MO-Gymnasium)

离散控制 :Deep Sea Treasure (DST)、Fruit Tree Navigation (6 维多目标);

连续 MuJoCo 机器人

  • 2 维:Halfcheetah2d、Walker2d、Humanoid2d;
  • 3 维:Hopper3d、Ant3d;
  • 5 维高难:Humanoid5d(前进速度、XY 角速度、双肘关节角速度、能耗)。

对比基线(三类全覆盖)

  • 偏好条件单网络 SOTA:PD-MORL、Q-Pensieve、CAPQL、PCN、EQL;
  • 多策略 MORL:PG-MORL、SFOLS、MORL/D、GPI-LS、GPI-PD;
  • 消融基准:原生 Forward-Backward(无任何 MORL 适配)。

三大标准 MORL 评测指标

  • UT 平均效用:所有均匀偏好下标量化回报均值,代表整体平均性能;
  • HV 超体积:帕累托前沿覆盖体积,多目标领域黄金评价指标;
  • ED 支配概率:随机偏好下本文算法优于基线的概率,ED<0.5 代表基线全面落后;

附加鲁棒指标:CVaR@0.1(最差 10% 偏好平均回报,衡量极端偏好稳定性)、IQM 鲁棒均值、POI 改进概率。

全部 2~5 维连续机器人任务中,MORL-FB UT、HV 全部第一,ED 全部小于 0.5;5 维 Humanoid5d 任务,传统 PD/Q-Pensieve 性能大幅下滑,MORL-FB 衰减极小;仅 1.5M 训练步的 MORL-FB,性能超过完整 3M 步训练的所有基线;对比 21 套独立单目标 SAC(总 63M 样本),仅 3M 样本即可达到同等帕累托前沿;均值、中位数、IQM 鲁棒指标大幅领先,极端难样本、差偏好下稳定性更强。

有限偏好泛化实验

训练集仅提供单目标 one-hot 偏好 + 均等权重,测试全部未知偏好:PD-MORL、Q-Pensieve 性能断崖下跌,MORL-FB 性能仅轻微下滑,验证 PG-Explore 带来极强跨偏好泛化。

消融实验:

  • 移除 PG-Explore(换回正态z采样):UT、HV 直接腰斩;
  • 替换为原生 FB 伪 Q 损失:性能近乎归零,真实多目标回报 TD 损失不可或缺;
  • 移除测度损失 L M \mathcal{L}_M LM:动力学表征失效,零样本迁移能力完全消失;
  • 隐维度消融:150 维最优,维度过小表征容量不足,过大训练不充分性能下降;
  • Q 损失系数鲁棒:权重 0.25~2 区间波动,性能几乎无变化。

独有能力:零样本跨目标迁移

训练 Hopper2d(前进速度 + 能耗 2 目标),不微调直接测试 Hopper3d、Hopper4d(新增跳跃高度、Z 轴速度目标):原生 FB 完全失效,MORL-FB 仍保持高 HV/UT。机理:FB 解耦动力学与回报维度,新增目标仅修改偏好 λ \lambda λ维度, F / B F/B F/B表征完全复用,现有 MORL 无该能力。

总结与思考

  • 传统偏好条件 MORL (PD/Q-Pensieve):仅拟合训练见过的线性加权回报,无通用动力学表征,跨偏好泛化差;
  • 多策略 MORL (PG-MORL/GPI):维护多套独立策略,样本、算力开销巨大;
  • 后继特征 SF:仅能评估固定策略,无法直接生成任意偏好最优策略,依赖人工预定义特征;
  • 原生 RF-FB:无 MORL 专属探索与损失,无法利用训练阶段向量回报,样本低效;

首次系统将 RFRL FB 适配 MORL,结合 MORL 独有的训练向量回报,设计 PG-Explore 与专属 Q 损失,打通长期割裂的两大研究方向。

继承原生 FB 短板:在极度稀疏奖励的复杂环境中,原生无奖励探索能力不足,需要额外稀疏探索策略辅助。

未来可融合其他 RFRL 表征(后继测度、保距基础策略表征);拓展离线多目标、部分可观测 MOMDP (POMORL);适配非线性帕累托前沿、大规模高维机器人多目标控制;结合大语言模型开放集偏好输入,实现开放世界多目标决策。

额外补充

  1. FB(Forward-Backward)表征框架

早期 RFRL 仅支持表格 MDP,无法扩展连续状态 / 高维机器人场景;FB 是深度可扩展的低秩 RFRL 框架,通过两个神经网络双线性分解后继测度 M π \mathcal{M}^\pi Mπ,用固定维度隐向量 z 编码任意任务奖励,完美适配深度强化学习。

后继测 = 策略 π \pi π 下,从 ( s , a ) (s,a) (s,a) 出发,未来所有状态 - 动作对的折扣访问总权重

后继测度原始 Q 值展开

对任意策略 π \pi π,Q 值是后继测度与回报的内积: Q π ( s , a ) = ∑ s ′ ∈ S ∑ a ′ ∈ A M π ( s , a , s ′ , a ′ ) ⋅ R ( s ′ , a ′ ) Q^\pi(s,a) = \sum_{s'\in S}\sum_{a'\in A} \mathcal{M}^\pi(s,a,s',a') \cdot R(s',a') Qπ(s,a)=∑s′∈S∑a′∈AMπ(s,a,s′,a′)⋅R(s′,a′)

连续环境下 S , A S,A S,A 无穷,无法存储完整 M \mathcal{M} M 表格。

FB 低秩双线性分解(核心公式)

引入固定隐空间维度 d z d_z dz,把高维后继测度分解为两个低秩神经网络的内积: M π z ( s , a , s ′ , a ′ ) = F θ ( s , a , z ) ⊤    B ω ( s ′ , a ′ ) \mathcal{M}^{\pi_z}(s,a,s',a') = F_\theta(s,a,z)^\top \; B_\omega(s',a') Mπz(s,a,s′,a′)=Fθ(s,a,z)⊤Bω(s′,a′)

  • 后向网络 B ω ( s ′ , a ′ ) B_\omega(s',a') Bω(s′,a′)(Backward)
    输入仅下一状态 - 动作对 ( s ′ , a ′ ) (s',a') (s′,a′),不含任务隐向量 z ;提取纯环境固有基底特征 ,只编码环境动力学,和任务、奖励完全无关;全局共享,训练完成后环境不变则 B ω B_\omega Bω 永久固定。
  • 前向网络 F θ ( s , a , z ) F_\theta(s,a,z) Fθ(s,a,z)(Forward)
    输入:当前 ( s , a ) (s,a) (s,a) + 任务隐编码 z ∈ R d z z\in\mathbb{R}^{d_z} z∈Rdz;描述 当前状态动作如何匹配 z 对应的任务奖励 ,承载策略行为信息; π z \pi_z πz:由隐向量 z 唯一确定的策略,不同 z 对应不同最优行为。
  • 隐向量 z R z_R zR(回报编码向量)
    将任意奖励函数 R 投影到 B 的隐基底,定义: z R = E ( s , a ) ∼ D B ω ( s , a ) ⋅ R ( s , a ) z_R = \mathbb{E}_{(s,a)\sim \mathcal{D}}\Big B_\\omega(s,a) \\cdot R(s,a) \\Big zR=E(s,a)∼DBω(s,a)⋅R(s,a), D \mathcal{D} D 回放缓冲的状态动作分布; z R z_R zR 是固定 d z d_z dz 维向量,统一编码任意维度的奖励。

最优 Q 值化简(核心简化式)

将分解式代入原始 Q 公式,交换求和与期望顺序:

Q π z R ( s , a ) = ∑ s ′ , a ′ F θ ( s , a , z R ) ⊤ B ω ( s ′ , a ′ ) R ( s ′ , a ′ ) = F θ ( s , a , z R ) ⊤ ⋅ E s ′ , a ′ B ω ( s ′ , a ′ ) R ( s ′ , a ′ ) ⏟ z R = F θ ( s , a , z R ) ⊤ z R \begin{align*} Q^{\pi_{z_R}}(s,a) &= \sum_{s',a'} F_\theta(s,a,z_R)^\top B_\omega(s',a') R(s',a') \\ &= F_\theta(s,a,z_R)^\top \cdot \underbrace{\mathbb{E}{s',a'} \big B_\\omega(s',a') R(s',a') \\big}{z_R} \\ &= F_\theta(s,a,z_R)^\top z_R \end{align*} QπzR(s,a)=s′,a′∑Fθ(s,a,zR)⊤Bω(s′,a′)R(s′,a′)=Fθ(s,a,zR)⊤⋅zR Es′,a′Bω(s′,a′)R(s′,a′)=Fθ(s,a,zR)⊤zR最终极简形式: Q ( s , a , z R ) = F θ ( s , a , z R ) ⊤ z R \boldsymbol{Q(s,a,z_R)=F_\theta(s,a,z_R)^\top z_R} Q(s,a,zR)=Fθ(s,a,zR)⊤zR

贪心最优策略

给定任意回报算出 z R z_R zR 后,直接对动作取最大值得到最优策略: π z R ∗ ( s ) = arg ⁡ max ⁡ a ∈ A    F θ ( s , a , z R ) ⊤ z R \pi^*{z_R}(s) = \arg\max{a\in A}\; F_\theta(s,a,z_R)^\top z_R πzR∗(s)=argmaxa∈AFθ(s,a,zR)⊤zR

低秩压缩(绝大部分维度是冗余信息,核心信息只集中在很少的维度里),支持连续高维状态(机器人图像、人体动力学);环境知识固化在 B,任务仅由 z 编码,天然实现动力学 / 回报解耦;推理仅一次向量内积,计算速度极快。

相关推荐
行业研究员1 小时前
腾讯云ADP:智能体平台封神榜
人工智能·microsoft·腾讯云·智能体·智能体平台·腾讯云adp
问天_观心1 小时前
零基础在windows环境下的WSL使用llamafactory(一)
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
陈童学哦1 小时前
DeepSeek Harness(Cordis):打破Agent框架黑盒,一切皆插件
人工智能
小睿科技1 小时前
建筑AI睿兔大脑 | AI把工程成本测算从经验活变成算清楚的技术活
人工智能
正经教主1 小时前
AI提示词工程(高阶)第19课:提示词评估与A/B测试
人工智能
SomeB1oody1 小时前
【RustyML入门】5.0. 模型评估
开发语言·后端·机器学习·rust·教程
Zach_菠萝侠1 小时前
【DeepSeek Harness 研究】进化方向1:动态路由 思考、设计与实现
人工智能·深度学习·deepseek
whyutianict_vv1 小时前
从 Web 前端到 HarmonyOS ArkTS:一次 AI 鸿蒙全栈智能体开发的迁移实录
前端·人工智能·harmonyos
Aision_2 小时前
代码安全学习手记(二):SCA 软件成分分析原理与 OWASP Dependency-Check 集成实战
运维·人工智能·学习·安全·web安全·网络安全