文章目录
导读
论文全称:Efficient Discovery of Pareto Front for Multi Objective Reinforcement Learning(ICLR 2025)
开源代码:https://github.com/RuohLiuq/C-MORL
将约束策略优化 (CMDP) 与多目标强化学习 (MORL) 结合,两阶段框架高效生成完整、高覆盖 Pareto 前沿,解决高维多目标(最多 9 维)场景下传统 MORL 效率低、前沿覆盖不全的痛点.
背景动机
多目标强化学习 (MORL) 用于存在多个冲突优化目标 的序贯决策(机器人控制、建筑能源调度、采矿 / 月球着陆等),目标输出一组帕累托最优策略,任意偏好下均可选出最优折中方案。现有方法分为两大类,均存在明显缺陷:
- 单偏好条件策略(Preference-Conditioned):如 Envelope、CAPQL、Q-Pensieve,把偏好权重作为网络输入,单网络适配全部偏好。
目标维度升高时,偏好空间指数膨胀,可扩展性极差;多目标梯度互相干扰,训练不稳定,大量偏好下输出被支配次优解;无法保证输出一定落在 Pareto 前沿。
把偏好向量 ω ∈ Ω , ∑ ω i = 1 , ω i ≥ 0 \boldsymbol\omega\in\Omega,\sum\omega_i=1,\omega_i\ge0 ω∈Ω,∑ωi=1,ωi≥0作为网络输入;训练时直接做提前线性标量化: r ω = ω ⊤ r r_\omega=\boldsymbol\omega^\top \boldsymbol r rω=ω⊤r;单网络 π ( a ∣ s , ω \pi(a|s,\boldsymbol\omega π(a∣s,ω)拟合全部偏好对应的策略。
偏好集 Ω \Omega Ω是n 维单纯形 (n = 目标数量): Ω = { ω ∈ R n ∣ ∑ i = 1 n ω i = 1 , ω i ≥ 0 } \Omega=\left\{\boldsymbol\omega\in\mathbb{R}^n\ \bigg|\ \sum_{i=1}^n \omega_i=1,\ \omega_i\ge0\right\} Ω={ω∈Rn ∑i=1nωi=1, ωi≥0}
- n=2:线段,均匀采样 100 个点即可完整覆盖;
- n=3:三角形,同等采样密度需要数千点;
- n=9(论文 Building-9d):8 维超平面单纯形,均匀采样所需样本数量随 n 指数增长(维数灾难)。
.
高维单纯形有核心几何性质:超立方体内部超球体体积占比随维度趋于 0。也就是说,绝大多数偏好向量集中在单纯形边界,网络很难学到内部折中偏好的映射关系。
训练时必须随机采样大量 ω \boldsymbol\omega ω喂入网络,才能让 π ( a ∣ s , ω ) \pi(a|s,\boldsymbol\omega) π(a∣s,ω)拟合整个单纯形映射:要维持相同覆盖密度,采样点数量 ∝ exp ( n ) \propto \exp(n) ∝exp(n);C-MORL 不直接建模偏好空间映射,不学习 ω → π \boldsymbol\omega\to\pi ω→π的映射函数:拓展前沿只需要对每个目标做一轮约束优化,复杂度线性 O ( n ) O(n) O(n);推理阶段直接从预存帕累托集合选 SMP 最优策略,完全避开高维单纯形拟合;
设 n 个独立目标的策略梯度: ∇ θ J 1 , ∇ θ J 2 , . . . , ∇ θ J n \nabla_\theta J_1,\nabla_\theta J_2,...,\nabla_\theta J_n ∇θJ1,∇θJ2,...,∇θJn,单条件 MORL 标量化损失: L ( ω , θ ) = − ω ⊤ J π = − ∑ i = 1 n ω i J i π \mathcal{L}(\boldsymbol\omega,\theta) = -\boldsymbol\omega^\top \boldsymbol J^\pi = -\sum_{i=1}^n \omega_i J_i^\pi L(ω,θ)=−ω⊤Jπ=−∑i=1nωiJiπ。梯度: ∇ θ L = − ∑ i = 1 n ω i ∇ θ J i \nabla_\theta \mathcal{L} = -\sum_{i=1}^n \omega_i \nabla_\theta J_i ∇θL=−∑i=1nωi∇θJi。当目标冲突(比如速度 vs 能耗),梯度方向相反: ⟨ ∇ J i , ∇ J j ⟩ < 0 \langle\nabla J_i,\nabla J_j\rangle <0 ⟨∇Ji,∇Jj⟩<0,内积为负。加权求和后梯度相互抵消,有效梯度模长大幅衰减 : ∥ ∑ ω i ∇ J i ∥ ≪ ∑ ω i ∥ ∇ J i ∥ \left\|\sum\omega_i\nabla J_i\right\| \ll \sum\omega_i\left\|\nabla J_i\right\| ∥∑ωi∇Ji∥≪∑ωi∥∇Ji∥。不同 ω \boldsymbol\omega ω交替训练时,梯度方向持续跳变,损失剧烈震荡,收敛极不稳定。.
C-MORL 的约束优化不提前加权求和:每次优化仅保留 1 个目标梯度 ∇ G l \nabla G_l ∇Gl,其余目标仅作为不等式约束,各目标梯度完全解耦,不存在抵消;
单网络拟合存在额外偏差,采样的偏好有限,未采样的 ω \boldsymbol\omega ω对应的策略是插值近似,大概率落在前沿内部(被支配);此外,表征坍缩让多个偏好共享同一策略,该策略仅对少数 ω \boldsymbol\omega ω最优,其余全部次优。
- 多策略集合方法(Multi-Policy Set):如 PG-MORL、GPI-LS,训练一组离散策略近似前沿。
仅均匀采样偏好,前沿大量空白区域无法填充,覆盖度差;经典 ε- 约束优化复杂度随目标数指数增长,9 目标等高维场景直接超时;训练开销巨大,每次生成新解需要完整重训。
不训练单一偏好条件网络,预先采样有限离散偏好 { ω 1 , ω 2 , . . . , ω M } \{\omega_1,\omega_2,...,\omega_M\} {ω1,ω2,...,ωM},对每个权重单独训练一套独立策略,用这组策略的回报点近似完整帕累托前沿。
PG-MORL/GPI-LS 固定在偏好单纯形 Ω \Omega Ω 均匀网格采样,以 2 目标为例采样间隔 Δ \Delta Δ: ω k = k Δ , 1 − k Δ , k = 0 , 1 , . . . , ⌊ 1 / Δ ⌋ \omega_k = k\\Delta,\\ 1-k\\Delta,\quad k=0,1,...,\lfloor 1/\Delta \rfloor ωk=kΔ, 1−kΔ,k=0,1,...,⌊1/Δ⌋仅能生成权重网格对应的凸包顶点,两个采样权重之间的折中区域没有任何策略。均匀采样完全无视前沿疏密 :前沿密集区域:重复生成相似策略,算力浪费;前沿稀疏 / 凹陷区域:完全无采样,大片空白。
.
C-MORL 依靠拥挤距离优先拓展稀疏区,均匀采样无定向填充能力。
PG-MORL/GPI-LS 的训练逻辑:采样一组全新偏好 ω ′ \omega' ω′;随机初始化网络参数,从零执行完整 PPO / 策略梯度训练,直到收敛;新旧策略之间无参数复用、无约束微调,每一个新解都是独立完整训练流程。.
C-MORL 拓展阶段不随机初始化:以已收敛成熟策略 π r \pi_r πr为起点,仅做约束微调更新少量迭代,无需完整从头训练。
针对上面的问题,本文 把 MORL 转化为约束马尔可夫决策过程 CMDP,分 帕累托初始化 + 帕累托扩展 两步线性复杂度填充前沿,天然适配 2~9 维多目标场景。
CMDP 是标准 MDP 的多约束扩展: ⟨ S , A , P , R l , { R i } i ≠ l , d 1 : n , γ ⟩ \langle S,A,P,R_l,\{R_i\}{i\ne l},d{1:n},\gamma \rangle ⟨S,A,P,Rl,{Ri}i=l,d1:n,γ⟩
- R l R_l Rl:主优化目标(我们要最大化的单维回报);
R i ( i ≠ l ) R_i(i\ne l) Ri(i=l):约束目标(其余所有多目标);
d i d_i di:约束阈值,强制约束: E ∑ γ t R i ( s t , a t ) ≥ d i \mathbb{E}\\sum\\gamma\^t R_i(s_t,a_t) \ge d_i E∑γtRi(st,at)≥di
标准 CMDP 优化形式: max π G l π s . t . G i π ≥ d i , ∀ i ≠ l \max_{\pi}\ G_l^\pi \quad s.t.\quad G_i^\pi \ge d_i,\ \forall i\ne l maxπ Glπs.t.Giπ≥di, ∀i=l ,其中 G i π = E π ∑ t = 0 ∞ γ t R i ( s t , a t ) G^\pi_i=\mathbb{E}_\pi\left\\sum_{t=0}\^\\infty \\gamma\^t R_i(s_t,a_t)\\right Giπ=Eπ∑t=0∞γtRi(st,at)为第i目标期望回报。每次只聚焦单一目标最大化,其余目标仅做下界约束,不做加权融合;全程保留各目标独立梯度,不会把多目标压缩成单一加权损失,不存在梯度抵消;
传统约束策略优化 CPO 仅能稳定处理≤2 个约束;本文基于对数障碍内点法,可高效求解任意数量目标的约束优化,理论证明对偶间隙为 0,保证解帕累托最优。
不随机拓展策略,优先选择前沿稀疏区域的策略做约束优化填充空白【基于拥挤距离 (Crowd Distance) 】 ;复杂度仅 O ( n K N ) O(nKN) O(nKN)(n 目标数,K 扩展步数,N 拓展策略数),远优于 PG-MORL 的指数复杂度 O ( K N n − 2 ) O(KN^{n-2}) O(KNn−2)。
方法框架
多目标马尔可夫决策过程 MOMDP,元组 < S , A , P , R 1 : n , Ω , f , γ > <S,A,P,R_{1:n},\Omega,f,\gamma> <S,A,P,R1:n,Ω,f,γ>,核心区别:
- 奖励为 n 维向量 r ∈ R n r\in\mathbb{R}^n r∈Rn,每个目标独立回报;
- 策略 π \pi π对应 n 维期望回报向量 G π = G 1 π , . . . , G n π T G^\pi=G_1\^\\pi,...,G_n\^\\pi^T Gπ=G1π,...,GnπT;
- 偏好向量 ω ∈ Ω , ∑ ω i = 1 \omega\in\Omega,\sum\omega_i=1 ω∈Ω,∑ωi=1,标量化效用 f ω ( G ) = ω T G f_\omega(G)=\omega^TG fω(G)=ωTG。
支配 :策略 π ′ \pi' π′优于 π \pi π当且仅当所有目标 G i π ′ ≥ G i π G_i^{\pi'}\ge G_i^\pi Giπ′≥Giπ,至少一个严格更大;帕累托最优:不存在任何策略能支配它;所有最优回报构成Pareto 前沿。
Set Max Policy (SMP) :给定偏好 ω \omega ω,从策略集合里选出效用最大的帕累托策略,推理阶段无需重新训练。
拥挤距离 Crowd Distance 衡量一个解在前沿上的稀疏程度:
D ( P ( j ) ) = ∑ i = 1 n G ~ i ( k + 1 ) − G ~ i ( k − 1 ) G ~ i , m a x − G ~ i , m i n D(P(j))=\sum_{i=1}^n \frac{\tilde{G}i(k+1)-\tilde{G}i(k-1)}{\tilde{G}{i,max}-\tilde{G}{i,min}} D(P(j))=i=1∑nG~i,max−G~i,minG~i(k+1)−G~i(k−1)
G ~ i \tilde{G}_i G~i为第 i 目标升序序列,k 为当前解排序位置。
拥挤距离越大 → 该区域解越少 → 优先拓展填充,是本文策略选择核心依据。

灰色填充区域就是超体积 。Reference Point (参考点,左下角黑点):一个很差的被支配参考回报点,所有帕累托解的各项目标都要优于该点。HV 定义:所有帕累托解与参考点围成的目标空间体积(二维是面积)。
π b \pi_b πb的拥挤距离,依靠左右邻居 π a \pi_a πa、 π c \pi_c πc的回报计算。拥挤距离数值越大:该点在帕累托前沿上越 "孤立",周围空白区域大,前沿稀疏,需要优先拓展这个点。C‑MORL没有条件网络,推理时不把偏好 ω \boldsymbol\omega ω输入网络;手里保存一组离散帕累托策略集合 { π a , π b , π c , π d } \{\pi_a,\pi_b,\pi_c,\pi_d\} {πa,πb,πc,πd}。输入偏好向量 ω \boldsymbol\omega ω(图中灰色箭头);计算集合内每一个策略的线性标量化效用 ω ⊤ G π \boldsymbol\omega^\top G^\pi ω⊤Gπ; ω T G π c > ω T G π d > ω T G π b > ω T G π a \boldsymbol\omega^T G^{\pi_c} > \boldsymbol\omega^T G^{\pi_d} > \boldsymbol\omega^T G^{\pi_b} > \boldsymbol\omega^T G^{\pi_a} ωTGπc>ωTGπd>ωTGπb>ωTGπa,Set‑Max:直接选出集合内效用最大的策略,这里就是 π c \pi_c πc作为输出策略。
三大评价指标
- 超体积 HV:前沿与参考点包围的空间体积,衡量整体覆盖范围;
- 期望效用 EU:随机采样大量偏好,取匹配 SMP 的平均效用;
- 稀疏度 SP:前沿解分布均匀度,数值越小分布越均衡。
核心算法 C-MORL 完整流程
整体算法流程图:初始化→拥挤距离筛选拓展策略→循环约束拓展→推理阶段策略分配

浅橙色圆点:Selected Solution 被选中拿来做拓展的父策略;虚线圆圈蓝色圆点:迭代拓展后新增得到的Pareto Optimal Solution
阶段 1:帕累托初始化(Pareto Initialization)
均匀采样 M 组不同偏好向量 ω i n i t \omega_{init} ωinit;并行训练 M 个独立 PPO 策略,每个策略最大化对应偏好加权回报;
保存所有策略与回报向量至解集缓冲区(包含中间训练策略,丰富候选);输出初始帕累托解集 X i n i t X_{init} Xinit。
初始化策略与偏好解耦,后续拓展、推理可适配任意权重。
阶段 2:帕累托扩展(Pareto Extension)------ 核心创新模块
分为策略选择、约束优化拓展两个子步骤,循环 K 次:
策略选择算法(Algorithm 1)
过滤 X i n i t X_{init} Xinit中所有被支配解,仅保留帕累托最优;
按拥挤距离降序排序;优先选取拥挤距离最大的 N 个策略作为拓展集 X e x t e n s i o n X_{extension} Xextension(默认同时保留各目标极值策略);
定向填充前沿空白,避免重复优化密集区域。
约束优化拓展
对每个选中策略、每个目标 l 依次求解: π r + 1 , i = arg max π G l π s . t . G i π ≥ β G i π r , i ≠ l \pi_{r+1,i}=\arg\max_\pi G_l^\pi \quad s.t.\ G_i^\pi \ge \beta G_i^{\pi_r},\ i\ne l πr+1,i=argmaxπGlπs.t. Giπ≥βGiπr, i=l
固定其他目标回报不低于当前策略的 β \beta β倍(论文最优 β = 0.9 \beta=0.9 β=0.9),单独最大化第 l 维目标;
从现有解向单一目标极限方向延伸,生成全新帕累托点;
两种求解实现:
- C-MORL-CPO:基于置信域 CPO,仅适合 2 目标场景,依赖 KL 约束,多约束求解复杂;
- C-MORL-IPO(主推):内点对数障碍法,把约束转为正则项: max π G l π + ∑ i ≠ l log ( G i π − β G i π r ) t \max_\pi G_l^\pi + \sum_{i\ne l}\frac{\log(G_i^\pi-\beta G_i^{\pi_r})}{t} maxπGlπ+∑i=ltlog(Giπ−βGiπr)
t 为障碍系数,理论证明最优解与原约束问题误差上界 n − 1 t \frac{n-1}{t} tn−1,任意多目标稳定求解,无需二阶 Hessian,计算更高效。
Proposition 4.3 :若约束阈值 d i ≥ G ~ i ( k − 1 ) d_i\ge \tilde{G}_i(k-1) di≥G~i(k−1)(k 为初始解排序位置),则约束优化得到的解一定是帕累托最优,不会生成被支配无效解。

可视化CMDP 子问题约束阈值设置的理论条件(论文命题 4.3),解释:为什么把约束下界设置恰当,CMDP 求解出来的解就保证是帕累托最优,不会产出被支配解。 π r \boldsymbol{\pi_r} πr:原始父策略(已经在帕累托集合中的旧解,热启动的初始点), π ′ \boldsymbol{\pi'} π′:CMDP 约束优化之后生成的新候选解。 π a , π b \pi_a,\pi_b πa,πb:帕累托集合里的其他邻近解。
左子图:约束曲面 Constraint Surface。Expected Return Surface of π a \pi_a πa: G 1 = G π a G_1=G^{\pi_a} G1=Gπa(红色平面)。这是现有解 π a \pi_a πa在目标 1 上的回报对应的超平面。Constraint Surface of Objective1: G 1 = d 1 G_1=d_1 G1=d1;Constraint Surface of Objective2: G 2 = d 2 G_2=d_2 G2=d2, d 1 , d 2 d_1,d_2 d1,d2就是 CMDP 子问题设置的约束下界: { max G 3 s . t . G 1 ≥ d 1 , G 2 ≥ d 2 \begin{cases} \max G_3 \\ s.t. \ G_1 \ge d_1,\ G_2 \ge d_2 \end{cases} {maxG3s.t. G1≥d1, G2≥d2,本例子:把 G 3 G_3 G3作为主目标最大化,约束 G 1 , G 2 G_1,G_2 G1,G2不低于阈值 d 1 , d 2 d_1,d_2 d1,d2。
把新解 π ′ \pi' π′加入帕累托集合之后,整个集合的超体积指标增加的那一部分体积。C‑MORL 做拓展的目标就是:通过 CMDP 子问题生成 π ′ \pi' π′,带来尽可能大的 Δ H ( P ) \Delta \mathcal H(P) ΔH(P),填补前沿空白,提升整体 HV。
阶段 3:推理阶段 ------ 策略分配 Policy Assignment
训练完成得到完整帕累托策略集,对任意未知偏好 ω \omega ω,直接遍历集合选出 SMP: π ω S M P = arg max π ∈ Π P ω T G π \pi_\omega^{SMP}=\arg\max_{\pi\in\Pi_P}\omega^TG^\pi πωSMP=argmaxπ∈ΠPωTGπ
无需微调、无需重训,单次遍历即可得到最优折中方案,区别于单条件策略易输出次优解。
实验分析
测试基准(离散 + 连续,最高 9 维目标)
- 离散任务:Minecart (3 目标)、MO-Lunar-Lander (4)、FruitTree (6);
- 机器人连续 MuJoCo:Hopper2d/3d、Ant2d/3d、Humanoid2d(复杂 348 维状态);
- 可持续能源 SustainGym:Building3d (3)、Building9d (9 目标,高维核心测试场景)。

C‑MORL(深蓝色)的前沿分布最完整、覆盖范围最大,点沿着真实帕累托曲线连续铺开,两端极端解也能达到更高回报。
CAPQL / Q‑Pensieve(条件网络类):点出现聚集、断层,很多中间折中解缺失。单条件网络在偏好单纯形插值的缺陷,很难完整拟合全部折中解;部分区域生成被支配次优解。
PG‑MORL、GPI‑LS、MORL/D(集合类基线):前沿覆盖范围明显更小,点稀疏,缺口很多。PG‑MORL 依靠均匀采样,只能产出少量离散解;MORL/D 甚至前沿被压缩到很窄的区间。
3 目标 MO‑Ant‑3d(三维目标空间,高维场景)(a) CAPQL:点聚集在很窄的一条线上,高维下条件网络拟合崩溃,大量折中解丢失。
(b) Q‑Pensieve:点分布零散,覆盖不全。
© PG‑MORL:解数量极少,前沿缺口巨大。
(d) GPI‑LS:覆盖范围有限。
(e) MORL/D:解几乎挤在一条直线,高维场景失效。
(f) C‑MORL(深蓝色):点云饱满,三维目标空间内,帕累托集合填充的范围远大于全部基线。
这张图是论文关键证据:高维多目标场景,传统算法缺陷被急剧放大。
对比基线
- 单条件策略:Envelope、CAPQL、Q-Pensieve;
- 多策略方法:PG-MORL、GPI-LS、MORL/D。

核心实验结果
超体积 HV 全面最优 :全部基准超过 SOTA,最高提升 35%,9 目标 Building-9d 唯一未超时算法;期望效用 EU 10 项基准中 9 项第一 :多策略天然优势,任意偏好均可匹配帕累托解,单条件策略大量偏好输出支配解;稀疏度 SP 整体最优 :拥挤距离拓展让前沿分布更均匀,不会仅覆盖局部区域;高维目标碾压优势 :PG-MORL/GPI-LS 在 9 目标环境训练超时,C-MORL 线性复杂度稳定输出高质量前沿。

消融实验
- 拥挤距离 vs 随机选择:拥挤距离筛选 HV、EU 全面更高,证明稀疏区域拓展有效;
- 约束系数 β:β=0.9 性能最优,过高限制拓展空间,过低易生成支配解;
- 初始化策略数量 M:M=6 均衡性能与训练步数,M 过大单策略训练不足;
- 拓展策略数 N:N=12 即可完整填充前沿,N=18 增益有限;
- 缓冲区大小:缓冲区越大 HV 越高,200 容量达到性能饱和。




总结与思考
部分极端目标方向仍存在未探索前沿空白,拓展机制仍有提升空间;底层基于 PPO,样本效率偏低,依赖大量环境交互;多策略存储开销大,目标维度极高时策略集合数量上限受限(对比单条件策略内存劣势)。
后续可以设计更强的前沿拓展算子,覆盖全部目标极值区域;融合基于模型 MORL 提升样本效率;多智能体协同 C-MORL,适配分布式多目标任务;策略迁移学习,复用预训练帕累托集合减少重训开销。
额外补充
- 单纯性
n 维单纯形是 R n + 1 \mathbb{R}^{n+1} Rn+1空间中,由 n + 1 n+1 n+1个线性无关顶点张成的最小凸多面体。
二维平面上从 ( 1 , 0 ) (1,0) (1,0)到 ( 0 , 1 ) (0,1) (0,1)的线段(1 维单纯形,嵌入 2 维空间)只需少量采样点就能全覆盖整条线段。三维空间里的等边三角形(2 维单纯形),三个顶点 ( 1 , 0 , 0 ) , ( 0 , 1 , 0 ) , ( 0 , 0 , 1 ) (1,0,0),(0,1,0),(0,0,1) (1,0,0),(0,1,0),(0,0,1)。要均匀铺满三角形内部,采样点数量远多于 2 目标线段。
- C‑MORL 与传统 ε \boldsymbol{\varepsilon} ε‑约束方法的区别?
二者子问题数学形式看上去几乎一模一样:选定主目标l最大化,其余目标给下界约束:
{ max π G l π s . t . G i π ≥ 阈值 , i ≠ l \begin{cases} \displaystyle\max_{\pi}\ G_l^\pi \\ s.t.\quad G_i^\pi \ge \text{阈值},\ i\neq l \end{cases} {πmax Glπs.t.Giπ≥阈值, i=l
但是传统 ε‑约束是 "全局穷举网格" ;C‑MORL 是 "基于已经得到的帕累托解做局部邻域拓展",阈值来自现有解,热启动,拥挤距离定向选点,避开指数爆炸。
CMDP 是一类优化数学模型; ε \varepsilon ε‑约束是一套多目标完整算法范式;C‑MORL 反复调用 CMDP 子问题,但没有采用 ε‑约束整套网格穷举范式。
阈值怎么生成、哪些子问题要解,是区分二者的关键。
传统经典 ε \boldsymbol{\varepsilon} ε‑约束方法
在求解任何子问题之前,先对每一个约束目标的取值范围做均匀网格划分。假设每个约束目标划分T个档位;n个目标就有 n − 1 n-1 n−1个约束目标。阈值集合 { ε i } \{\varepsilon_i\} {εi}是预先定义好的全部网格组合。
例子, n = 3 n=3 n=3(3 个目标),每个目标分 T = 5 T=5 T=5档:约束目标有 2 个,需要遍历全部 5 × 5 = 25 5\times5 = 25 5×5=25组 ( ε 2 , ε 3 ) (\varepsilon_2,\varepsilon_3) (ε2,ε3),每组都要独立求解一个约束优化问题。
每一组 ( ε 2 , ε 3 ) (\varepsilon_2,\varepsilon_3) (ε2,ε3),都从零初始化网络,完整跑一遍约束 RL,不利用任何已经算出来的帕累托解。
子问题的触发,穷举全部网格组合",先把所有阈值组合列出来,全部求解,再筛掉不可行解与被支配解"。
C‑MORL 的约束子问题(CMDP)
阈值 来自当前已经存在的策略回报,自适应动态设置阈值不是预先全局网格。 d i = β ⋅ G i π r \boldsymbol{d_i=\beta\cdot G_i^{\pi_r}} di=β⋅Giπr , π r \pi_r πr是已经收敛、已经在帕累托集合里的一个现有策略; G i π r G_i^{\pi_r} Giπr就是这个策略第i目标的回报; β ∈ ( 0 , 1 ) \beta\in(0,1) β∈(0,1)是固定超参(论文实验最优 0.9)。
举例:现有策略 π r \pi_r πr回报 G π r = ( 5 , 3 , 2 ) G^{\pi_r}=(5,3,2) Gπr=(5,3,2),取 β = 0.9 \beta=0.9 β=0.9;当把目标 1 作为主目标去最大化,则约束阈值自动设为: G 2 ≥ 0.9 × 3 = 2.7 , G 3 ≥ 0.9 × 2 = 1.8 G_2\ge 0.9\times3=2.7,\quad G_3\ge0.9\times 2=1.8 G2≥0.9×3=2.7,G3≥0.9×2=1.8
优化初始点:从已有策略 π r E \boldsymbol{\pi_r}E πrE热启动,求解这个约束 CMDP 的时候,不从随机参数开始训练,直接拿 π r \pi_r πr作为初始策略,只做少量迭代微调。
子问题的触发根据拥挤距离筛选,只填充帕累托前沿稀疏缺口,不做穷举。