从因果视角解决多智能体协作:细读 SCIC 算法

文章目录

导读

论文标题:基于情境依赖因果影响的协作多智能体强化学习(Situation-Dependent Causal Influence-Based Cooperative Multi-agent Reinforcement Learning,简称 SCIC)(AAAI 2024)

传统基于互信息的多智能体内在奖励算法仅衡量智能体行为统计相关性,忽略交互的情境差异性,无法区分关联与真实因果作用,稀疏奖励场景下协作、探索效率低下;

两台机器人近距离、同向移动时,A 的动作会强烈改变 B 下一时刻位置(高因果影响力);两台机器人远距离、不在彼此运动轨迹上时,A 几乎无法影响 B(低因果影响力)。现有 MI 方法不区分两种场景,统一计算相关性,无法引导智能体主动走到 "能互相影响的关键状态。

本文从因果推断视角 提出 SCIC 算法,构建多智能体因果图 MACGM,借助因果干预 + MINE 估计条件互信息 量化智能体间情境依赖因果影响,并以此设计新型同伴激励内在奖励,将外部任务奖励与因果内在奖励联合优化;

在捕食者 - 猎物(Predator Prey)、协作导航(Navigation Task)、线段控制(Cooperative Line Control)三类 MPE 基准任务上,SCIC-MADDPG 相比 MADDPG、SI、PMIC 等主流 SOTA 算法收敛速度更快 、长期累积奖励更高,显著提升多智能体协同与状态探索能力。

背景动机

多智能体强化学习(MARL)广泛落地自动驾驶协同、机器人集群、交通信号调度等分布式协作场景,当前主流训练框架为集中式训练分布式执行(CTDE),分为两大技术路线:

  • 价值分解类 CTDE(VDN、QMIX):对全局团队价值函数拆解为各智能体局部价值,分布式执行仅依赖自身观测;
  • 集中评价器 CTDE(MADDPG、MAAC、COMA):训练阶段使用全局信息训练中心化 Critic,执行阶段各智能体独立决策。

为解决环境奖励稀疏、智能体协同弱的问题,近年大量研究引入互信息(MI)内在奖励方案:通过最大化智能体动作、轨迹、全局状态间统计相关性,引导智能体产生协作行为,代表工作为 SI(社会影响)、PMIC、EITI、VM3-AC。

同时,因果强化学习逐步兴起,现有工作利用因果图、干预、反事实推理完成状态抽象、样本增广、特征筛选,但少有研究将因果影响量化为多智能体协作的内在激励信号

现有方法存在的一些缺陷问题:

  1. CTDE 底层策略独立假设存在缺陷

主流 CTDE 算法默认各智能策略相互独立,忽略智能体之间的交互约束,决策时不考量自身动作对同伴状态的改变,难以学习复杂协同行为;仅依靠外部稀疏任务奖励优化,探索效率极低。

  1. 传统互信息内在奖励混淆 "相关性" 与 "因果性"

SI、PMIC 等方法仅统计智能体行为、轨迹的统计关联,无法区分虚假相关与真实因果控制:即便智能体处于无交互价值的远距离场景,仍会强制最大化关联,引导无效动作,不区分不同状态下交互强弱,无法识别高价值重要状态(significant states),训练收敛缓慢。

  1. 离线回放数据混杂多策略分布,无法精准推断因果

普通观测轨迹混杂历史多种旧策略,直接采样计算互信息会引入混杂偏移,无法真实反映动作对其他智能体下一状态的因果作用,现有方法未引入因果干预消除混杂。


问题设定

本文研究完全协作、局部观测多智能体任务,形式化元组 M = < I , S , U , O , P , R , γ > \mathcal{M}=<I, S, U, O, P, R, \gamma> M=<I,S,U,O,P,R,γ>

  • I = 1 , 2 , . . . , N I={1,2,...,N} I=1,2,...,N:有限智能体集合;
  • S S S:全局联合状态空间,任意智能体无法完整观测;
  • U = ∏ i ∈ I U i U=\prod_{i\in I}U^i U=∏i∈IUi:联合动作空间, U i U^i Ui 为智能体 i i i动作集;
  • O O O:观测函数, o t i = O ( s t , i ) o_t^i=O(s_t,i) oti=O(st,i) 为智能体 i i i局部观测;
  • P ( s t + 1 ∣ s t , a t ) P(s_{t+1}|s_t,a_t) P(st+1∣st,at):环境状态转移函数;
  • R : S × U → R R:S\times U \to \mathbb{R} R:S×U→R:全局共享外部团队奖励(完全协作,所有智能体奖励一致);
  • γ ∈ [ 0 , 1 ) \gamma\in[0,1) γ∈[0,1):折扣因子。

优化目标:求解最优联合策略 π ∗ \pi^* π∗,最大化团队长期折扣回报:

π ∗ = arg ⁡ max ⁡ π E ∑ t = 0 ∞ γ t R ( s t , a t ) \pi^*=\arg\max_{\pi}\mathbb{E}\left\\sum_{t=0}\^{\\infty}\\gamma\^t R(s_t,a_t)\\right π∗=argπmaxEt=0∑∞γtR(st,at)


作者将因果图模型(CGM)拓展至去中心化多智能体场景,构建多智能体因果图模型 (MACGM)。在该模型中,智能体共享同一个环境;集中训练阶段,智能体能够获取所需的私有变量与 / 或公共变量。MACGM 在时刻t的单步转移动力学,被建模为定义在随机变量集合V上的因果图 G \mathcal{G} G: V = S t , S t + 1 , S t i i ∈ I , A t i i ∈ I , S t + 1 j j ∈ I V={S_t, S_{t+1}, {S_t^i}{i\in I}, {A_t^i}{i\in I}, {S_{t+1}^j}{j\in I}} V=St,St+1,Stii∈I,Atii∈I,St+1jj∈I 核心因果边 A t i → S t + 1 j A_t^i \to S{t+1}^j Ati→St+1j 代表: t t t时刻智能体 i i i的动作能够因果控制 t + 1 t+1 t+1时刻智能体 j j j的状态;

定义可控 / 不可控状态,使用 条件互信息 C I i j = I ( S t + 1 j ; A t i ∣ S t i ) CI^{ij}=I(S_{t+1}^j;A_t^i|S_t^i) CIij=I(St+1j;Ati∣Sti) 量化 i i i对 j j j的情境依赖因果强度,通过均匀分布 d o do do干预消除观测混杂,利用 MINE 神经网络近似求解连续空间互信息下界。

可控状态变量: A t i → S t + 1 j A_t^i \to S_{t+1}^j Ati→St+1j因果边激活,i 能控制 j 下一状态;不可控状态变量:因果边无效,i 的动作无法改变 j 下一状态;算法核心目标是最大化可控状态出现频率,引导智能体主动进入高可控(高协作)情境。

本文核心创新:

融合外部任务奖励与因果内在奖励,单智能体总即时奖励:

r t , t o t a l i = r t , e x + α ∑ j ≠ i C I i , j r_{t,total}^i = r_{t,ex} + \alpha \sum_{j\neq i} CI^{i,j} rt,totali=rt,ex+αj=i∑CIi,j α \alpha α为平衡超参数,最大化总奖励期望,同步完成任务回报优化+主动探索高因果交互状态双重目标。

方法框架

整体流程分为 4 个模块:环境交互、经验回放、因果影响推理、融合奖励策略更新。

注意:该文章 因果影响的计算仅在集中式训练阶段执行,该阶段每个智能体可以获取其余智能体的策略与动作信息。

模块交互与轨迹存储

各智能体独立 Actor 网络 π θ i \pi_\theta^i πθi基于本地观测输出动作 a t i a_t^i ati;执行联合动作 a t a_t at得到下一全局状态 s t + 1 s_{t+1} st+1与外部团队奖励 r t , e x r_{t,ex} rt,ex;将完整轨迹 ( s t , a t , s t + 1 , r t , e x ) (s_t,a_t,s_{t+1},r_{t,ex}) (st,at,st+1,rt,ex)存入回放缓存 Buffer。

前向动力学模型训练

从缓存采样批量数据,训练神经网络拟合转移 p ( s t + 1 j ∣ s t i , a t i ) p(s_{t+1}^j|s_t^i,a_t^i) p(st+1j∣sti,ati),假设转移服从高斯分布;随后借助前向动力学模型,对动作积分消元,求解边缘转移分布:

p ( s t + 1 j ∣ s t i ) = ∫ π ( a t i ∣ s t i ) p ( s t + 1 j , a t i ∣ s t i ) d a t i p(s_{t+1}^j|s_t^i)=\int \pi(a_t^i|s_t^i)p(s_{t+1}^j,a_t^i|s_t^i) da_t^i p(st+1j∣sti)=∫π(ati∣sti)p(st+1j,ati∣sti)dati 实际实现中,采用蒙特卡洛近似替代积分运算: p ( s t + 1 j ∣ s t i ) ≈ 1 K ∑ k = 1 K p ( s t + 1 j , a t i , ( k ) ∣ s t i ) p(s_{t+1}^j|s_t^i) \approx \frac{1}{K}\sum_{k=1}^K p(s_{t+1}^j,a_t^{i,(k)}|s_t^i) p(st+1j∣sti)≈K1k=1∑Kp(st+1j,ati,(k)∣sti)训练阶段,动力学模型 p ( s t + 1 j ∣ s t i ) p(s_{t+1}^j|s_t^i) p(st+1j∣sti)、统计网络T、智能体策略网络同步训练。

基于 MINE 的因果影响推理(核心创新)

条件互信息(CMI)是衡量变量依赖程度的经典指标,本文将其用作智能体之间因果影响(CI)的度量标准。 若 CMI > 0 \text{CMI}>0 CMI>0,说明想要预测 S t + 1 j S_{t+1}^j St+1j就必须引入 A t i A_t^i Ati,即 A t i ⊥̸  ⁣ ⁣ ⁣ ⊥ S t + 1 j ∣ S t i = s t i A_t^i \not\perp\!\!\!\perp S_{t+1}^j|S_t^i = s_t^i Ati⊥⊥St+1j∣Sti=sti成立,因果通路 A t i → S t + 1 j A_t^i \to S_{t+1}^j Ati→St+1j存在。

然而在真实场景中,连续变量的互信息(MI)求解十分困难。对比基于变分推断的方法,基于 MINE 的算法展现出更优越的性能。受 MINE 启发,本文方法利用下界近似互信息,实现互信息的神经网络估计。

C I i j : = I ( S t + 1 j ; A t i ∣ S t i ) = K L ( P S t + 1 j , A t i ∣ s t i ∥ P S t + 1 j ∣ s t i ⊗ P A t i ∣ s t i ) = sup ⁡ T : Ω → R E p ( S t + 1 j , A t i ∣ s t i ) T − l o g ( E p ( S t + 1 j ∣ s t i ) p ( A t i ∣ s t i ) e T ) ≥ sup ⁡ ψ ∈ Ψ E p ( S t + 1 j , A t i ∣ s t i ) T ψ − l o g ( E p ( S t + 1 j ∣ s t i ) p ( A t i ∣ s t i ) e T ψ ) . \begin{align} CI^{ij} &:= I\left(S_{t+1}^j;A_t^i|S_t^i\right) \tag{2} \\ &= KL\left(P_{S_{t+1}^j,A_t^i|s_t^i} \parallel P_{S_{t+1}^j|s_t^i} \otimes P_{A_t^i|s_t^i}\right) \tag{3} \\ &= \sup_{T:\Omega\to\mathbb{R}} \mathbb{E}{p(S{t+1}^j,A_t^i|s_t^i)}T - log\left(\mathbb{E}{p(S{t+1}^j|s_t^i)p(A_t^i|s_t^i)}e\^{T}\right) \tag{4} \\ &\geq \sup_{\psi\in\Psi}\mathbb{E}{p(S{t+1}^j,A_t^i|s_t^i)}T_\\psi - log\left(\mathbb{E}{p(S{t+1}^j|s_t^i)p(A_t^i|s_t^i)}e\^{T_\\psi}\right). \tag{5} \end{align} CIij:=I(St+1j;Ati∣Sti)=KL(PSt+1j,Ati∣sti∥PSt+1j∣sti⊗PAti∣sti)=T:Ω→RsupEp(St+1j,Ati∣sti)T−log(Ep(St+1j∣sti)p(Ati∣sti)eT)≥ψ∈ΨsupEp(St+1j,Ati∣sti)−log(Ep(St+1j∣sti)p(Ati∣sti)eTψ).(2)(3)(4)(5)首先,借助 Donsker--Varadhan 表示定理(Donsker & Varadhan,2010),将条件互信息公式改写为式 (3)。输入空间 Ω \Omega Ω是 R d \mathbb{R}_d Rd上的定义域;该上确界对所有能让两项期望有限的函数T成立。

随后,利用 PAC 贝叶斯领域的压缩引理,把 Donsker--Varadhan 形式下的条件互信息转化为式 (5) 中的下界形式(Banerjee,2006)。统计模型T由参数为 ψ \psi ψ的深度神经网络参数化。

离线强化学习算法的数据来自多种策略混合分布,因此不能直接使用智能体自身采样策略开展干预。选取动作空间上的均匀分布 U ( A ) \mathcal{U}(\mathcal{A}) U(A)作为干预策略。

融合总奖励 + MADDPG 策略更新

基于因果影响估计方法,下面利用智能体间因果影响构造内在奖励,学习能够最大化期望折扣回报的联合策略。

智能体i接收融合奖励:由团队外部奖励、来自同伴因果影响的内在奖励共同构成,形式如下:

r t , t o t a l i = r t , e x + α ∑ j ≠ i C I i , j , (6) r_{t,total}^i = r_{t,ex} + \alpha \sum_{j\neq i} CI^{i,j}, \tag{6} rt,totali=rt,ex+αj=i∑CIi,j,(6) 式中 C I i , j CI^{i,j} CIi,j代表 A t i A_t^i Ati对 S t + 1 j S_{t+1}^j St+1j产生的因果影响; α \alpha α为超参数,用于平衡内在奖励与外部奖励。智能体i的内在奖励记作 r t , i n i = ∑ j ≠ i C I i , j r_{t,in}^i=\sum_{j\neq i}CI^{i,j} rt,ini=∑j=iCIi,j。

每个智能体需要学习策略,最大化标准优化目标:

J ( π ) : J ( π θ i ) = E ∑ t = 0 ∞ γ t r t , t o t a l i . J(\pi): J(\pi_\theta^i) = \mathbb{E}\left\\sum_{t=0}\^\\infty \\gamma\^t r_{t,total}\^i\\right. J(π):J(πθi)=Et=0∑∞γtrt,totali. 最大化该目标等价于让智能体i获得控制其他目标同伴的能力。

本文以 MADDPG 为基线搭建完整方法。每个智能体i的联合动作价值函数由联合价值网络 Q ϕ Q_\phi Qϕ近似,完整训练流程见算法 1。

实验分析

选取三项基准多智能体任务对所提方法开展评估,三类经典协作基准任务,覆盖简单到高难度:

  • 捕食 - 猎物 Predator Prey:3/4/5 捕食者协作抓捕固定策略猎物;
  • 协作导航 Cooperative Navigation:3/4/5 机器人抵达各自地标,最小总移动距离;
  • 线段控制 Cooperative Line Control:3/5 智能体均匀分布在两目标点连线上(高难度稀疏奖励)。

实验环境(MPE 多智能体粒子环境),环境内智能体遵循二阶积分动力学模型,可在二维空间内运动。

评论网络与演员网络学习率均设置为 0.001;折扣因子 γ \gamma γ设置为 0.95;每个训练回合最大时长为 25 个时间步。为估计状态转移边缘分布 p ( s t + 1 j ∣ s t i ) p(s_{t+1}^{j}|s_{t}^{i}) p(st+1j∣sti),单次蒙特卡洛采样数量K设定为 64。

  1. 对比基线

MADDPG:基础 CTDE 算法(本文主干);

SI:社会影响互信息内在奖励经典算法;

PMIC:渐进互信息协作 SOTA 算法。

图 3 (a)、图 3 (b)、图 3 © 分别展示 SCIC-MADDPG、PMIC、SI、MADDPG 在捕食者数量为 3、4、5 的捕食 - 猎物任务上奖励对比结果。

统一结论:SCIC-MADDPG 在绝大多数任务、智能体数量下收敛速度、最终累积奖励全面优于所有基线:

消融实验:

为验证干预采样机制的有效性,实现了去除干预模块的 SCIC(SCIC w/o Intervention)变体:该变体在估算智能体间因果效应、获取动作集合时,不再基于均匀分布开展干预采样,而是直接从经验回放缓冲区采样。

产生该结果的核心原因是:离策略强化学习算法中的采样动作来自多种策略的混合分布,无法直接用于因果估计。将智能体间因果影响作为奖励增益,能够促进智能体协作,提升多智能体强化学习算法性能;引入干预机制可以更加精准地估计因果影响。

超参数 α 消融:最优值 α = 0.01 \alpha=0.01 α=0.01:内在奖励权重适中,既引导协作探索,又不破坏原始任务外部奖励优化目标;α 过大时内在奖励主导,偏离原始任务最优策略。

总结与思考

现有基于内在奖励的 MARL 方法大多聚焦状态新颖性、行为相关性,该工作从因果推理切入,以因果影响衡量智能体协作价值,为多智能体协作目标提供了新的优化方向;方法搭建在经典 MADDPG 之上,模块化的内在奖励结构便于迁移到其他集中式训练 MARL 算法;同时通过消融实验清晰论证了干预采样组件的必要性,实验设计完整规范。

局限和可扩展的方向

验证仅局限于小规模二维 MPE 粒子环境,尚未在大规模智能体、连续复杂仿真或者真实机器人场景验证算法泛化能力;协同线段控制任务中 3 智能体场景性能仅与 PMIC 持平,算法在部分困难场景的优势仍有提升空间。

算法需要通过蒙特卡洛采样、干预采样估计因果分布,会带来额外计算成本;随着智能体数量增多,两两之间因果影响估计的复杂度会显著上升,难以直接扩展到大规模群体智能场景。

当前实现绑定集中式训练范式,未来可拓展到分布式训练与基于模型 MARL。

概念补充

  1. 什么是MINE?它有什么用?

互信息 I ( X ; Y ) I(X;Y) I(X;Y) 衡量两个随机变量统计关联程度 ,定义为联合分布与边缘乘积分布的 KL 散度:

I ( X ; Y ) = D K L ( P X , Y ∥ P X ⊗ P Y ) I(X;Y)=D_{KL}\big(P_{X,Y} \parallel P_X \otimes P_Y\big) I(X;Y)=DKL(PX,Y∥PX⊗PY)

离散变量查表即可计算;但是,高维连续变量 (机器人坐标、图像观测、多智能体状态)下,核密度、变分下界等传统方法存在维度灾难、收敛差、无法梯度反向传播三大缺陷,无法嵌入深度 RL 训练流程。

MINE(ICML2018,Belghazi)专门解决高维连续变量互信息可微估计 问题,核心是Donsker--Varadhan(DV)KL 变分表示,把 KL 散度转化为神经网络可优化的上确界目标,全程支持梯度下降与反向传播。

D K L ( p ∣ m ) = sup ⁡ T ∈ F E x ∼ p T ( x ) − log ⁡ E x ∼ m e T ( x ) D_{KL}(p|m)=\sup_{T\in\mathcal{F}} \mathbb{E}{x\sim p}T(x) - \log\mathbb{E}{x\sim m}\bige\^{T(x)}\\big DKL(p∣m)=T∈FsupEx∼pT(x)−logEx∼meT(x)

其中:

  • T T T 是任意有界实值函数,MINE 用 深度神经网络 T ψ T_\psi Tψ 拟合;
  • p p p = 联合分布样本 ( X , Y ) (X,Y) (X,Y);
  • m m m = 边缘独立采样 ( X ′ , Y ′ ) (X',Y') (X′,Y′)(打乱配对得到无关联负样本)。

代入互信息定义得到 MINE 估计下界:

I ^ ( X ; Y ) = sup ⁡ ψ ; E ( x , y ) ∼ P X , Y T ψ ( x , y ) − log ⁡ E ( x ′ , y ′ ) ∼ P X P Y e T ψ ( x ′ , y ′ ) \hat{I}(X;Y)=\sup_\psi ;\mathbb{E}{(x,y)\sim P{X,Y}}T_\\psi(x,y) - \log\mathbb{E}_{(x',y')\sim P_X P_Y}\bige\^{T_\\psi(x',y')}\\big I^(X;Y)=ψsup;E(x,y)∼PX,YTψ(x,y)−logE(x′,y′)∼PXPYeTψ(x′,y′)

具有高维兼容性 :状态、动作是连续多维向量(机器人二维坐标、多智能体观测),传统 MI 方法失效,MINE 线性缩放维度;完全可微 :网络参数 ψ \psi ψ可随 Actor/Critic/ 动力学模型同步反向传播;

  1. 互信息奖励的缺陷是什么?

多智能体场景常用三类 MI(互信息) 作为奖励:

  • I ( A i ; A j ∣ S ) I(A_i;A_j|S) I(Ai;Aj∣S):智能体 i、j 当前动作互信息(SI 社会影响);
  • I ( S ; A j o i n t ) I(S;A_{joint}) I(S;Ajoint):全局状态与联合动作互信息(PMIC);
  • I ( T r j ; A i ) I(Tr_j;A_i) I(Trj;Ai):i 动作轨迹与 j 下一状态互信息(EITI)。

解决稀疏奖励问题 ,环境仅在任务终点给少量奖励(如线段控制任务),MI 每时每刻提供稠密梯度信号,训练速度大幅提升;同时缓解CTDE独立策略缺陷,原生 MADDPG/QMIX 假设各智能策略独立,MI 奖励强制动作产生依赖,削弱非平稳环境带来的训练震荡。

然而 互信息只度量统计相关性,无法区分因果作用 :仅时空靠近、无实际操控能力也会产生高 MI;3. 无法区分单向因果: I ( A i ; S j ) I(A_i;S_j) I(Ai;Sj)对称,分不清是 i 控制 j,还是 j 被动跟随 i。MI 全局统一度量,不区分 "近距离可交互" 和 "远距离无影响" 两种状态,不会引导智能体主动走到能真正协作的关键状态;

两台机器人同步原地转圈,动作高度相关 I ( A 1 ; A 2 ) I(A1;A2) I(A1;A2)极大,但 A1 完全无法改变 A2 的运动轨迹,没有真实协作价值;传统 MI 方法会疯狂鼓励这种无效行为;

  1. 如何理解因果图 / 干预 / 反事实下 状态抽象、特征筛选这两个概念?

传统 RL 直接把原始高维状态全部喂给网络,包含大量无关噪声特征,状态空间爆炸、采样效率低;

因果推理工具(因果图、do 干预、反事实)能识别:哪些状态变量对任务有真实因果作用、哪些只是无关混淆变量,据此完成

  • 特征筛选:剔除无因果贡献的冗余维度(比如机器人控制过程中的墙面纹理,地面湿度,光照强度等);
  • 状态抽象:把多个因果等价的原始状态合并为一个抽象状态,压缩状态空间(干预后产生一致的因果结果)。

只要捕食者与猎物距离∈0,1 区间,无论精确坐标是多少,执行 "向前移动" 动作后,都会缩小抓捕距离、获得相同增量奖励;按距离分段抽象:近距 / 中距 / 远距三大抽象状态,抛弃精确小数坐标。状态空间从连续无穷集压缩为离散 3 类,智能体更容易泛化协作策略。

相关推荐
Coder-magician1 小时前
《代码随想录》刷题打卡day31:动态规划-背包问题part02
算法·动态规划
c238561 小时前
《算法武林谱:四大排序神功与二分寻宝术全解》
数据结构·算法·排序算法
一米阳光86611 小时前
软考(中级)软件设计师核心笔记(9)算法——时间复杂度与空间复杂度、查找算法、排序算法
笔记·算法·职场发展·软考·软件设计师·中级职称
Mem0rin1 小时前
二分查找:左右边界
数据结构·算法
大明者省11 小时前
WSL2 Ubuntu22.04 GPU训练环境配置指南
人工智能·算法·计算机视觉
白狐_79813 小时前
408数据结构第8章:排序②——性质对比秒杀、场景选择与外部排序
java·数据结构·算法
zander25813 小时前
LeetCode 84:柱状图中的最大矩形——单调栈如何确定左右边界
java·数据结构·算法
Shell运维手记13 小时前
Linux 常用基础命令学习笔记
linux·运维·笔记·学习·算法·github
杨航 AI14 小时前
O(n log n):线性对数原理拆解 这个是排序算法的黄金复杂度之一。
算法·排序算法