写在前面:
社区共建项目:AIGC算法工程师/开发工程师面试面经秘籍分享,Interview-for-Algorithm-Engineer,欢迎大家Star⭐收藏~
AIGC时代的 《三年面试五年模拟》AI算法工程师求职面试秘籍独家资源: 【三年面试五年模拟】AI算法工程师面试秘籍,欢迎 Star⭐收藏~,诚邀大家参与项目共建,聚力赋能 AIGC 行业生态建设!
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)一起交流学习。
论文:Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies(UNC Chapel Hill / MERL,arXiv 2026)
发布时间:2026 年 9 月 2 日(arXiv v1)
作者:Yue Yang、Diego Romeres、Chiori Hori、Gedas Bertasius、Daniel Szafir、Siddarth Jain(共 6 人)
核心一句话:在 BEHAVIOR-1K 的 47 个技能上把单模态回退成功率从 2.8% 提到 6.1%(+120%),双臂真机在物理干扰下从 30% 飙到 85%(+183%),全程只改训练目标、零推理开销、不动 π0.5 架构。
核心关键词
- 模态纠缠(modality entanglement):VLA 策略在有限、同质的机器人示教上训练后,把行为绑定到当前状态并不相关的传感器上,形成跨传感器的伪相关。
- 两种失效模式:nuisance sensitivity(扰动作废的传感器也能崩掉策略)与 single-modality insufficiency(只剩一个有效传感器时策略不会回退到它)。
- 证据得分 E t , m E_{t,m} Et,m :每帧、每传感器一个 0 , 1 0,1 0,1 的任务相关性打分,跨模态归一化,作为软归纳偏置而非真值。
- 证据门控正则化(EGR):用证据得分门控两个一致性损失的训练目标,模态无关、零推理开销。
- 不变性损失 L i n v \mathcal{L}{\mathrm{inv}} Linv / 充分性损失 L s u f f \mathcal{L}{\mathrm{suff}} Lsuff:分别针对低证据传感器(要求扰动不变)与高证据传感器(要求单模态自足),正好对上两种失效模式。
- 铰链权重 w i n v / w s u f f w_{\mathrm{inv}}/w_{\mathrm{suff}} winv/wsuff :以 τ l o w = 0.2 \tau_{\mathrm{low}}=0.2 τlow=0.2、 τ h i g h = 0.5 \tau_{\mathrm{high}}=0.5 τhigh=0.5 为膝点,证据处于中间灰区时两个损失都不激活,退回基础模仿损失。
- 重要性采样估计器 :把每步 2 ∣ M ∣ 2|\mathcal{M}| 2∣M∣ 次额外前向压到 3 次(1 次干净 + 各 1 次采样),且无偏。
带着问题阅读
- VLA 为什么会在"与任务无关的腕部相机里塞了点干扰物"这种情况下整个策略就停住?问题出在推理还是训练?
- 既然要解决的是"这一帧该信哪个传感器",为什么不直接用注意力机制让策略自己学,而要绕道一个显式的证据得分?
- 证据得分怎样才能既不依赖端到端学习、又能同时覆盖视觉相机和 GelSight 触觉这两种截然不同的传感器?
- 两个铰链损失各自对应一种失效模式,那"证据不高不低"的灰色帧怎么办?会不会留下没人管的地带?
- "零推理开销"的代价是不是全转嫁到了训练?重要性采样凭什么能保证无偏而不偷工?
- 真机上双臂拿到 +183%、触觉只有 +27%,这个差距能说明 EGR 跨具身/跨模态可迁移,还是说明它在触觉上其实没生效?
一、核心导读
Vision-Language-Action(VLA)策略把视觉、语言、触觉等多路传感器的特征在前端早早融合,再输出动作。这套范式能力强,但有一个被本文系统命名的隐患:模态纠缠。因为机器人示教数据远比网页语料小、同质,策略很容易在训练里把"某个腕部相机看到这块地板纹理"这种偶然共现当成"该走对路"的信号。等部署时遇到遮挡或干扰,这种伪相关就暴露成两种失效:扰动一个本不该被信任的传感器也能让策略停滞;或者所有有效传感器都被遮挡、只剩一个有效时,策略却不会回退到它。
本文的解法是 Evidence-Gated Regularization(EGR) :给每一帧、每一个传感器算一个"证据得分" E t , m ∈ 0 , 1 E_{t,m}\in0,1 Et,m∈0,1,衡量它此刻对任务的相关性;得分低就挂上不变性损失(扰动它不应改变动作),得分高就挂上充分性损失(只留它也应给出同样动作),中间灰区不施加额外损失。证据的构造与正则化被刻意解耦:前者按传感器类型实例化(视觉看任务相关几何可见度、触觉看接触模式),后者对所有传感器一视同仁。因为只改训练目标,π0.5 的架构和推理路径完全不动,部署时零额外开销。
验证上,作者基于 BEHAVIOR-1K 构了一个专门针对模态纠缠的基准(47 个技能:11 个导航 + 36 个操作),配两套评测(推理诊断 + 回滚成功率),并在两套真实机器人上验证:双臂 Kinova + 三个 RGB 相机;单臂 MELFA ASSISTA + 一个 RGB + 两个 GelSight 触觉。结果是:仿真里单模态回退成功率从 2.8% 提到 6.1%(+120%),双臂真机在物理干扰下从 30% 提到 85%(+183%),并且干净输入不掉点、操作类干净成功率反而从 12.5% 涨到 16.4%。
二、问题背景:作者到底想解决什么
2.1 模态纠缠的两种失效模式
模态纠缠不是泛泛的"不鲁棒",而是有明确的状态依赖结构:策略对传感器 m m m 的行为依赖,与 m m m 在当前帧对任务的真实重要性错位。作者把这种错位拆成互补的两半(原论文 §3.1)。

如上图所示,上半对应 nuisance sensitivity( nuisance 敏感) :导航时头相机才提供任务相关信息,两个朝下的腕相机只拍地板;可部署时只在腕相机视野里放物理干扰物、头相机视野完全不变,策略却停住了------说明它把"这块地板长这样"当成了"在正确路上"的信号。下半对应 single-modality insufficiency(单模态不充分):伸手进货架时头相机和右腕相机本都能看到目标;当目标被放得更深、上层板挡住头相机而右腕相机仍能看见目标时,策略却停下或乱动------说明它没学会"仅靠右腕相机这一路就足以继续"。
形式化地,在状态 t t t:nuisance sensitivity 指 m m m 本与任务无关、扰动 m m m 不改变成功率却会改变动作分布;single-modality insufficiency 指 m m m 单独就够、其它相关模态也并存,但只用 m m m 执行时动作分布却和全传感器时不同。这两个定义是后面两个损失的设计依据,值得先记住。
2.2 现有鲁棒性方法的缺口
已有的多模态鲁棒性思路可以分成三类,但都抓不住"每帧该信哪个传感器"这个状态依赖问题(原论文 §2.2)。随机模态 dropout 与对抗式多传感器一致性把传感器和时间步一视同仁,能提高对缺失/扰动的容忍,却不做状态相关的模态选择;注意力类方法让策略端到端学这种选择,但用的正是那份催生模态纠缠的有限同质示教,学到的注意力会继承同样的伪共现。TacVLA 引入一个显式门控、只在检测到接触时激活触觉 token,但这个门是专为"触觉 + 二值接触"单一模态单一线索设计的,换到别的传感器就得重做门控机制。
作者据此提炼出三个诉求:模态选择要显式 、要扎根于任务结构 而非脆弱的示教统计、要与具体传感器模态解耦。EGR 正是按这三条设计的。
三、核心思路:用一句主线串起来
一句话:用任务结构算出的每帧每传感器证据得分,去门控两个状态条件一致性损失,让策略对低证据传感器学会"无视扰动"、对高证据传感器学会"单兵作战",训练期加约束、推理期零开销。
这条主线里有两处刻意设计。第一是"证据构造"与"正则化"的分离:前者定义每种传感器什么叫任务相关(视觉看几何可见度、触觉看接触模式),后者一旦拿到 E t , m E_{t,m} Et,m 就用同一套铰链权重和一致性损失套到所有传感器上------这让框架对异构传感器是统一的,却把"什么叫相关"留给了任务先验。第二是"训练期约束、推理期不变":EGR 只在训练时往 flow-matching 损失上加两项正则,π0.5 的网络结构和推理前向完全不动,所以部署成本和基础策略一模一样。
四、方法展开:沿着论文原始逻辑拆解
4.1 问题设定与失效的形式化
VLA 策略 π θ ( a t ∣ o t ) \pi_{\theta}(a_t \mid o_t) πθ(at∣ot) 把多传感器观测 o t = { o t m } m ∈ M o_t=\{o_t^m\}{m\in\mathcal{M}} ot={otm}m∈M 映射到动作分布,用示教数据 D \mathcal{D} D 做模仿学习。记 o t m o_t^m otm 为"只保留模态 m m m、其余都被污染"的观测。 π θ \pi\theta πθ 在 ( t , m ) (t,m) (t,m) 处发生模态纠缠,当它对 m m m 的行为依赖与 m m m 对任务的真实重要性不一致;这种不一致如 §2.1 所述有两种互补形式。这个形式化看似只是定义,但它把"鲁棒性"从模糊目标变成了可量化的、状态条件的目标,后面两个损失就是对这两种形式的直接对冲。
4.2 证据得分:视觉与触觉两种实例化
证据得分 E t , m ∈ 0 , 1 E_{t,m}\in0,1 Et,m∈0,1 衡量某传感器在某帧携带的任务相关信号量;跨模态在每帧归一化,捕捉的是相对而非绝对重要性。作者明确把它当启发式度量而非真值------它只负责指示当前帧更可能落入哪种失效模式,从而决定施加哪种正则。证据构造按传感器类型分别给出(原论文 §3.2)。
视觉实例化。 相机证据看任务相关几何的可见度:焦点物体(被操作物)与交互物体(与之交互的容器/目标)在视野里占的像素面积比。记 A t , m , k f o c a l A_{t,m,k}^{\mathrm{focal}} At,m,kfocal、 A t , m , k i n t e r A_{t,m,k}^{\mathrm{inter}} At,m,kinter 为各自面积比,聚合为 a t , m f o c a l = ∑ k A t , m , k f o c a l a_{t,m}^{\mathrm{focal}}=\sum_k A_{t,m,k}^{\mathrm{focal}} at,mfocal=∑kAt,m,kfocal、 a t , m i n t e r = ∑ k A t , m , k i n t e r a_{t,m}^{\mathrm{inter}}=\sum_k A_{t,m,k}^{\mathrm{inter}} at,minter=∑kAt,m,kinter。光用面积会误导------大交互物(如桌子)会让没看到焦点物体的相机也虚高。于是引入交互门 g t , m = 1 a t , m f o c a l \> ϵ f o c a l g_{t,m}=\mathbb{1}a_{t,m}\^{\\mathrm{focal}}\>\\epsilon_{\\mathrm{focal}} gt,m=1at,mfocal\>ϵfocal,只有同一相机看到焦点物体时才计入交互贡献: s t , m = a t , m f o c a l + α ⋅ g t , m ⋅ a t , m i n t e r s_{t,m}=a_{t,m}^{\mathrm{focal}}+\alpha\cdot g_{t,m}\cdot a_{t,m}^{\mathrm{inter}} st,m=at,mfocal+α⋅gt,m⋅at,minter。跨相机归一化得 E t , m = s t , m / ( max m ′ s t , m ′ + ε ) E_{t,m}=s_{t,m}/(\max_{m'} s_{t,m'}+\varepsilon) Et,m=st,m/(maxm′st,m′+ε),再加全局门 G t = 1 max m s t , m \> ϵ g l o b a l G_t=\mathbb{1}\\max_m s_{t,m}\>\\epsilon_{\\mathrm{global}} Gt=1maxmst,m\>ϵglobal,在没有任何相机有意义的"搜索帧"上关闭两个正则、只留基础模仿损失。仿真里用 BEHAVIOR-1K 的逐帧实例分割算证据;真机离线用 Grounding DINO v2 配手动 prompt 框 + SAM2 分割,分割只在训练期用。
触觉实例化。 触觉证据按接触结构分两档。稀疏接触档(抓、按、插等)里接触本身即任务事件,证据退化为二值指示 E t , t a c t i l e = 1 contact at t E_{t,\mathrm{tactile}}=\mathbb{1}\\text{contact at }t Et,tactile=1contact at t,思路与 TacVLA 的接触门相通。富接触档里接触贯穿整个子任务、二值接触没有帧级判别力,于是引入任务特征算子 ϕ t a s k \phi_{\mathrm{task}} ϕtask,把当前触觉观测映射到与目标特征的相似度 E t , t a c t i l e = ϕ t a s k ( o t t a c t i l e ) ∈ 0 , 1 E_{t,\mathrm{tactile}}=\phi_{\mathrm{task}}(o_t^{\mathrm{tactile}})\in0,1 Et,tactile=ϕtask(ottactile)∈0,1;本文评测里目标特征是表面的局部触觉模式(如裂纹), ϕ t a s k \phi_{\mathrm{task}} ϕtask 拿示教里的参考签名做比对。 ϕ t a s k \phi_{\mathrm{task}} ϕtask 的具体形式任务相关,但框架不绑死某一种。
这两段实例化是"证据构造与正则化解耦"的体现:视觉和触觉的证据来源截然不同,但拿到 E t , m E_{t,m} Et,m 之后套的是同一套铰链损失。
4.3 双铰链门控一致性损失
证据得分把两种失效与训练目标对接:低证据→不变性损失(对 nuisance sensitivity),高证据→充分性损失(对 single-modality insufficiency),中间灰区退回基础模仿损失。门控靠两个阈值 τ l o w < τ h i g h \tau_{\mathrm{low}}<\tau_{\mathrm{high}} τlow<τhigh 上的铰链权重实现:
公式(1):
w i n v ( E t , m ) = max ( 0 , τ l o w − E t , m τ l o w ) , w s u f f ( E t , m ) = max ( 0 , E t , m − τ h i g h 1 − τ h i g h ) w_{\mathrm{inv}}(E_{t,m})=\max\left(0,\frac{\tau_{\mathrm{low}}-E_{t,m}}{\tau_{\mathrm{low}}}\right),\qquad w_{\mathrm{suff}}(E_{t,m})=\max\left(0,\frac{E_{t,m}-\tau_{\mathrm{high}}}{1-\tau_{\mathrm{high}}}\right) winv(Et,m)=max(0,τlowτlow−Et,m),wsuff(Et,m)=max(0,1−τhighEt,m−τhigh)

如上图所示,左半是不变性损失 L i n v \mathcal{L}{\mathrm{inv}} Linv 的逻辑,右半是充分性损失 L s u f f \mathcal{L}{\mathrm{suff}} Lsuff 的逻辑。为了"探"这两个损失,需要一个污染算子 C m ( ⋅ ) \mathcal{C}_m(\cdot) Cm(⋅) 作用于模态 m m m,由此得到两种污染观测: o ~ t ( m ) \tilde{o}_t^{(m)} o~t(m)(只污染 m m m、其余完好)和 o t m o_t^m otm(只保留 m m m、其余全污染)。本文用随机擦除(random erasing)实例化 C m \mathcal{C}_m Cm,作用于所有视觉输入(含 GelSight 的 RGB 触觉图),但框架对具体污染方式是开放的。
记 v θ v_\theta vθ 为底层 π0.5 策略的 flow-matching 速度预测。不变性损失在低证据传感器上要求扰动不改变动作:
公式(2):
L i n v = ∑ t , m ∈ M G t ⋅ w i n v ( E t , m ) ⋅ ∥ v θ ( o t ) − v θ ( o ~ t ( m ) ) ∥ 2 2 \mathcal{L}{\mathrm{inv}}=\sum{t,m\in\mathcal{M}} G_t\cdot w_{\mathrm{inv}}(E_{t,m})\cdot\left\|v_\theta(o_t)-v_\theta(\tilde{o}_t^{(m)})\right\|_2^2 Linv=t,m∈M∑Gt⋅winv(Et,m)⋅ vθ(ot)−vθ(o~t(m)) 22
充分性损失在高证据传感器上要求"只留它"也给出与全传感器一致的动作:
公式(3):
L s u f f = ∑ t , m ∈ M G t ⋅ w s u f f ( E t , m ) ⋅ ∥ v θ ( o t ) − v θ ( o t m ) ∥ 2 2 \mathcal{L}{\mathrm{suff}}=\sum{t,m\in\mathcal{M}} G_t\cdot w_{\mathrm{suff}}(E_{t,m})\cdot\left\|v_\theta(o_t)-v_\theta(o_t^m)\right\|_2^2 Lsuff=t,m∈M∑Gt⋅wsuff(Et,m)⋅∥vθ(ot)−vθ(otm)∥22
最终训练目标是 flow-matching 损失加两个正则:
公式(4):
L = L f l o w + λ i n v L i n v + λ s u f f L s u f f \mathcal{L}=\mathcal{L}{\mathrm{flow}}+\lambda{\mathrm{inv}}\mathcal{L}{\mathrm{inv}}+\lambda{\mathrm{suff}}\mathcal{L}_{\mathrm{suff}} L=Lflow+λinvLinv+λsuffLsuff
其中 λ i n v , λ s u f f ≥ 0 \lambda_{\mathrm{inv}},\lambda_{\mathrm{suff}}\ge 0 λinv,λsuff≥0 平衡两个正则项。注意全局门 G t G_t Gt 和铰链权重是双重门: G t G_t Gt 先在无证据帧上整体关闭,铰链再按证据高低分流到两个损失,灰区自然落到基础模仿损失------这正是 §2.2 里"灰色帧怎么办"的答案:交给基础损失,不强行正则。
4.4 重要性采样降开销
按公式 (2)(3) 原样算,每步要对 ∣ M ∣ |\mathcal{M}| ∣M∣ 个模态各做一次污染前向,共 2 ∣ M ∣ 2|\mathcal{M}| 2∣M∣ 次额外前向。作者用无偏的重要性采样估计器把它压下来(原论文 §3.4、§D):对 batch 里每个样本 b b b,记 W b i n v = ∑ m w i n v ( E b , m ) W_b^{\mathrm{inv}}=\sum_m w_{\mathrm{inv}}(E_{b,m}) Wbinv=∑mwinv(Eb,m),按分类分布 p b , m i n v = w i n v ( E b , m ) / W b i n v p_{b,m}^{\mathrm{inv}}=w_{\mathrm{inv}}(E_{b,m})/W_b^{\mathrm{inv}} pb,minv=winv(Eb,m)/Wbinv 只采样一个模态 m b ⋆ m_b^\star mb⋆,只在该模态上算损失项再乘回 W b i n v W_b^{\mathrm{inv}} Wbinv:
公式(5):
L ^ i n v = ∑ b G t ⋅ W b i n v ⋅ ∥ v θ ( o b ) − v θ ( o ~ b ( m b ⋆ ) ) ∥ 2 2 \hat{\mathcal{L}}{\mathrm{inv}}=\sum_b G_t\cdot W_b^{\mathrm{inv}}\cdot\left\|v\theta(o_b)-v_\theta(\tilde{o}_b^{(m_b^\star)})\right\|_2^2 L^inv=b∑Gt⋅Wbinv⋅ vθ(ob)−vθ(o~b(mb⋆)) 22
L ^ s u f f \hat{\mathcal{L}}{\mathrm{suff}} L^suff 同理用 w s u f f w{\mathrm{suff}} wsuff 和 W b s u f f W_b^{\mathrm{suff}} Wbsuff。两个估计器都无偏: E L \^ i n v = L i n v \mathbb{E}\\hat{\\mathcal{L}}_{\\mathrm{inv}}=\mathcal{L}{\mathrm{inv}} EL\^inv=Linv, E L \^ s u f f = L s u f f \mathbb{E}\\hat{\\mathcal{L}}_{\\mathrm{suff}}=\mathcal{L}{\mathrm{suff}} EL\^suff=Lsuff(证明见附录 §D)。关键在于 W b i n v W_b^{\mathrm{inv}} Wbinv 这个重要性采样修正------少了它估计量会被向下偏置 W b i n v W_b^{\mathrm{inv}} Wbinv 倍;当 W b i n v = 0 W_b^{\mathrm{inv}}=0 Wbinv=0(无模态触发铰链)时回退到 1 / ∣ M ∣ 1/|\mathcal{M}| 1/∣M∣ 均匀先验采样,但损失贡献仍被 W b i n v = 0 W_b^{\mathrm{inv}}=0 Wbinv=0 置零。按铰链权重比例采样意味着算力集中在真有贡献的模态上,每步开销从 2 ∣ M ∣ 2|\mathcal{M}| 2∣M∣ 降到"与模态数无关的 3 次前向":1 次干净 + 1 次 L ^ i n v \hat{\mathcal{L}}{\mathrm{inv}} L^inv + 1 次 L ^ s u f f \hat{\mathcal{L}}{\mathrm{suff}} L^suff。
五、实验与证据:结果能支撑到什么程度
5.1 基准与评测设计
基准建在 BEHAVIOR-1K 上,取其官方逐帧实例分割与技能标注,聚焦挑战赛第二名的 12 个任务(1 个因标注截断剔除,剩 11 个可用),经三个视觉证据过滤子筛后重整成 47 个技能段:11 个导航(NAV)+ 36 个操作(MAN)。过滤逻辑与评测协议对齐:NAV 段保留"头相机有效、至少一个腕相机无用";MAN 段保留"头相机有效且恰好一个腕相机无用",以统一 NoUseless/UsefulOnly 的对比。候选 118 段经三道过滤降到 47 段(11 NAV + 36 MAN,见原论文表 7)。
评测分两套,同跑在这 47 段上(原论文 §4.2)。Suite 1 是推理诊断:只前向、不回滚,测每帧动作在模态扰动下的偏差 Δ \Delta Δ(扰动 MSE − 干净 MSE),只在任务相关动作维上算(NAV 取底盘、MAN 取躯干和双臂),便宜易算。Suite 2 是回滚评测:每段跑 20 次估成功率 SR,MAN 还报末端接触率 EC 和到目标最小距离 Dist,做任务级评估。基线两个:vanilla π0.5,以及在 π0.5 上加随机模态 token 替换的 ModDrop(即 12 的模态 dropout)。EGR 与两基线同架构、同训练数据。四类扰动工况贯穿全文:Clean(全传感器)、NoUseless(污染无用模态,验 nuisance sensitivity)、UsefulOnly(只留一个有效模态,验 single-modality insufficiency)、SingleUseful(恰好一个有效传感器时,合并 NoUseless 与 UsefulOnly);真机再加 RealDistractor(视野里放物理 OOD 物体)。
5.2 Q1:模态纠缠确实存在
vanilla π0.5 的行直接证实两种失效。如下表所示,NAV 的 SingleUseful 同时实现 NoUseless 与 UsefulOnly,动作偏差仍升 +31.4%;MAN 上单扰无用模态 +12.7%,只留有效模态 +158.5%。ModDrop 的偏差模式相近且绝对值更高,说明随机 dropout 没消除这种纠缠。
原论文表 1:Suite 1(推理诊断)各模态扰动下的动作偏差,Ratio 为相对 Full 的增幅,越低越好。
| Method | NAV ||| MAN |||||
| Method | Full | SingleUseful | Ratio | Full | NoUseless | Ratio | UsefulOnly | Ratio |
|---|---|---|---|---|---|---|---|---|
| vanilla π0.5 | 0.0616 | 0.0809 | +31.4% | 0.0020 | 0.0022 | +12.7% | 0.0052 | +158.5% |
| ModDrop | 0.0853 | 0.1172 | +37.4% | 0.0024 | 0.0026 | +10.9% | 0.0056 | +137.7% |
| EGR (ours) | 0.0780 | 0.0903 | +15.8% | 0.0023 | 0.0024 | +5.1% | 0.0051 | +121.8% |
回滚层面(下表)佐证同一结论:vanilla π0.5 在 MAN 上从 Full 12.5% 掉到 NoUseless 9.4% 再掉到 UsefulOnly 2.8%;NAV 上从 Full 42.3% 掉到 SingleUseful 15.5%。两套评测收敛:模态纠缠同时表现在动作层(表 1)和任务完成层(表 2)。
5.3 Q2:EGR 显著降低模态纠缠
主结果在下表 EGR 行。MAN 上 Full 12.5→16.4(+31%)、NoUseless 9.4→16.5(+75%)、UsefulOnly 2.8→6.1(+120%);NAV 上 Full 基本持平(42.3→40.9),SingleUseful 从 15.5 升到 37.3(+141%)。
原论文表 2:Suite 2(回滚)成功率 SR、接触率 EC、到目标最小距离 Dist,MAN 列报 SR/EC/Dist,加粗为该工况该指标最优。
| Method | NAV (n=11) || MAN (n=36), SR↑ / EC↑ / Dist↓ |||
| Method | Full | SingleUseful | Full | NoUseless | UsefulOnly |
|---|---|---|---|---|---|
| vanilla π0.5 | 42.27 | 15.45 | 12.50 / 52.78 / 0.25 | 9.44 / 47.22 / 0.26 | 2.78 / 22.78 / 0.45 |
| ModDrop | 40.00 | 15.45 | 7.50 / 40.97 / 0.29 | 6.81 / 38.89 / 0.29 | 2.78 / 22.36 / 0.47 |
| EGR (ours) | 40.91 | 37.27 | 16.39 / 50.00 / 0.26 | 16.53 / 53.89 / 0.25 | 6.11 / 30.14 / 0.37 |
两点值得注意。其一,鲁棒性增益不靠牺牲干净输入换来:MAN 的 Full SR 反而从 12.5% 涨到 16.4%(+31% 相对),说明证据门控正则顺带帮策略学到更多任务相关特征。其二,改善模式正好对上两个损失的构造:NoUseless 与 UsefulOnly 是被直接针对的,提升也最大。表 1 也印证:EGR 的动作偏差比 vanilla 和 ModDrop 都低(NAV SingleUseful 31.4%→15.8%;MAN UsefulOnly 158.5%→121.8%)。
统计显著性见原论文 §C.3:MAN 上 NoUseless、UsefulOnly 两工况 SR 相对两个基线均显著( p < 0.05 p<0.05 p<0.05,配对 Wilcoxon),NoUseless 对 ModDrop 边际( p = 0.061 p=0.061 p=0.061);Full 对 ModDrop p < 0.001 p<0.001 p<0.001、对 vanilla p = 0.065 p=0.065 p=0.065 属次级效应。NAV 因仅 11 段、Wilcoxon 在 SingleUseful 触底 p = 0.0625 p=0.0625 p=0.0625,但四个有差异的段全部偏向 EGR,瓶颈在统计功效而非效应方向。
5.4 Q3:真机跨具身迁移
两套真机具身差异很大(原论文 §4.5)。双臂平台是两台 Kinova + 三个 RGB 相机,传感器布局见对应任务图的放大插图,评 3 个短程任务(关微波炉门、把寿司放进锅、把鸡腿放盘上)和 1 个长程叠碗任务;视觉-触觉平台是单臂 MELFA ASSISTA + 一个 RGB + 两个 GelSight,评 2 个触觉特征定位任务(笔身序列号、板面裂纹),模拟视觉信息受限、靠触觉提供任务信号的工业检测场景。双臂有两个有效传感器,测 Clean/NoUseless/UsefulOnly;触觉平台右 GelSight 是唯一有效传感器,测 Clean/SingleUseful;两者都加 RealDistractor。

如上图所示,上排六张任务图横跨两套平台((a)(b) 为视觉-触觉平台的板面裂纹与笔身序列号;©-(f) 为双臂平台的关微波炉门、放寿司、放鸡腿、叠碗),下方放大图给出两套平台的传感器布局。双臂四任务平均(每工况 10 试 ×4 任务=40 试):Clean 70→80(+14%)、NoUseless 52.5→90(+71%)、UsefulOnly 25→72.5(+190%)、RealDistractor 30→85(+183%),最大相对增益在 RealDistractor------干扰物是策略从未见过的物理 OOD 对象,是各工况里最强的分布外信号。

如上图所示,每对柱子左灰为基线、右青为 EGR,上方标相对增益。触觉平台两任务平均(每工况 10 试 ×2 任务=20 试):Clean 90→85(−6%,落在试验噪声内)、SingleUseful 40→90(+125%)、RealDistractor 55→70(+27%)。统计上(原论文表 17、18,Fisher 精确检验):双臂的 NoUseless/UsefulOnly/RealDistractor 三工况均 p < 0.001 p<0.001 p<0.001,Clean 无显著差异(与 EGR 不针对干净性能一致);触觉平台 SingleUseful p = 0.0022 p=0.0022 p=0.0022,但 RealDistractor 仅 20 试汇总、 p = 0.51 p=0.51 p=0.51 未达显著------作者指出同一 RealDistractor 工况在双臂(40 试)上 p < 0.001 p<0.001 p<0.001 强显著,说明触觉那项是欠功效而非无效应。这正面回应了开头的第 6 个问题:触觉上 +27% 不是"没生效",而是被试次数拖住;EGR 的增益在合成扰动与物理干扰下都迁移到了截然不同的传感器组合上。
六、这篇工作的边界与可复现性
边界。 证据的两个实例化都来自任务结构:视觉靠可见的任务相关几何、触觉靠参考接触签名。这覆盖了相关信号可先验指定的场景,但不覆盖那些信号本身需要被学出来的场景,如手中物体重定向(in-hand reorientation)。把证据从数据里学出来------比如信息论目标或自监督特征发现------是与正则化机制正交的自然方向。仿真基准目前也只覆盖 BEHAVIOR-1K 50 个任务里的 12 个,扩到全部 50 个用同一套过滤与回放管线即可。
可复现性。 超参与训练配置都给了。EGR 自身超参见下表(原论文表 3)。
原论文表 3:EGR 自身超参。
| Symbol | Value | Description |
|---|---|---|
| λ_inv | 0.2 | L_inv 在总损失中的权重 |
| λ_suff | 0.1 | L_suff 权重(发布代码里记 lambda_solo) |
| τ_low | 0.2 | w_inv 激活的铰链膝点 |
| τ_high | 0.5 | w_suff 激活的铰链膝点 |
| α | 0.3 | 每相机分数 s_{t,m} 中门控交互物贡献的权重 |
| ε_focal | 1e-3 | 焦点物体面积上的交互门阈值 |
| ε_global | 1e-3 | 全局门 max_m s_{t,m} 上的阈值 |
| ε | 1e-8 | 跨相机归一化的数值稳定项 |
| set_mask | False | 被污染相机保留 image_mask=True 使 patch token 仍有效 |
训练循环(原论文表 6):在 π0.5 检查点上 warm-start,仅训 LoRA 适配器、基础权重冻结;batch 288,AdamW( β 1 = 0.9 , β 2 = 0.95 \beta_1=0.9,\beta_2=0.95 β1=0.9,β2=0.95),峰值 LR 2.5 × 10 − 5 2.5\times10^{-5} 2.5×10−5,余弦衰减、1000 步 warmup、5 万步、末 LR 0,梯度全局范数裁 1.0,bfloat16 模型 + float32 损失/参数累加,2× NVIDIA B200 跨设备 FSDP,PaliGemma 主干 gemma_2b_lora,动作专家 gemma_300m_lora,动作 horizon 32。污染算子分两套:训练期用随机矩形擦除(2--5 个矩形、总面积比 30%--80%、逐相机独立、像素级噪声填充),仿真部署用中心偏置黑色擦除(1--3 个矩形、30%--70%、高斯聚于图像中心)以近似大遮挡,真机用物理干扰物。证据所需的分割:仿真用 BEHAVIOR-1K 官方逐帧实例分割,真机离线用 Grounding DINO v2 + 手动 prompt 框 + SAM2,仅训练期用。逐格标准误、置信区间与显著性检验(Wilcoxon / Fisher)在原论文 §C 全列。
七、如果继续研究/落地,应该关注什么
- 把证据从"任务先验"升级为"学出来的"。 现在视觉证据靠焦点/交互物标注、触觉靠参考签名,都得先验指定。若要用信息论或自监督特征发现自动学证据,EGR 的正则化机器不动、只换证据源,是一条干净的研究线。
- 扩基准到 BEHAVIOR-1K 全 50 任务。 现在只 12 个任务、47 段,过滤与回放管线可复用,扩起来直接,能给出更稳的统计功效(尤其 NAV 那个触底的 p = 0.0625 p=0.0625 p=0.0625)。
- 补"灰区"建模。 中等证据帧目前退回基础损失,没人管;若灰区在真实部署中占比高,可考虑软过渡而非硬膝点。
- 落到更多 VLA 主干与更多模态。 本文只在 π0.5 上验证;EGR 是模态无关的训练目标,迁到 OpenVLA 等主干、或加深度/力矩等更多模态,能检验"证据-正则解耦"是否真的通用。
- 真机试次扩容。 触觉平台 RealDistractor 仅 20 试、 p = 0.51 p=0.51 p=0.51 是欠功效;补试次到与双臂可比的量级,才能把触觉那条 +27% 坐实。
八、术语与概念速查
| 术语 | 含义 / 在本文中的角色 |
|---|---|
| vanilla π0.5 | 基线之一:纯 flow-matching 模仿学习的 π0.5,不加任何模态正则。 |
| ModDrop | 基线之二:在 π0.5 训练时随机替换模态 token,实现 12 的模态 dropout。 |
| Clean | 评测工况:所有传感器完好,作为对照基线。 |
| NoUseless | 评测工况:只污染"无用"模态,验 nuisance sensitivity。 |
| UsefulOnly | 评测工况:只保留单个有效模态、其余全污染,验 single-modality insufficiency。 |
| SingleUseful | 评测工况:恰好一个有效传感器时,合并 NoUseless 与 UsefulOnly 为一个工况。 |
| RealDistractor | 真机专属工况:视野里放物理 OOD 干扰物,非合成的鲁棒性探针。 |
| Suite 1 | 推理诊断:只前向不回滚,报每帧动作偏差 Δ,便宜易算。 |
| Suite 2 | 回滚评测:每段 20 次 rollout,报 SR/EC/Dist,任务级评估。 |
| Δ | Suite 1 指标:扰动 MSE − 干净 MSE,只在任务相关动作维上算。 |
| SR / EC / Dist | 成功率 / 末端接触率 / 到目标最小距离,Suite 2 的三项指标。 |
| 训练期污染 C m \mathcal{C}_m Cm | 随机擦除(2--5 矩形、30%--80%),作用于所有视觉输入含 GelSight RGB。 |
| 部署期污染 | 仿真用中心偏置黑色擦除近似大遮挡;真机用物理干扰物。 |
| 焦点/交互物体 | 焦点物体=被操作物,交互物体=与之交互的容器/目标;视觉证据的核心。 |
| 交互门 g t , m g_{t,m} gt,m | 仅当同一相机看到焦点物体时才计入交互物贡献,防大物体虚高证据。 |
| 全局门 G t G_t Gt | 无相机有证据的"搜索帧"上整体关闭两正则、只留基础模仿损失。 |
| 稀疏/富接触档 | 触觉证据两档:前者二值接触指示,后者用任务特征算子 ϕ t a s k \phi_{\mathrm{task}} ϕtask 比对参考签名。 |
| v θ v_\theta vθ | π0.5 的 flow-matching 速度预测,两个损失都要求它在扰动/单模态下与干净一致。 |
| BEHAVIOR-1K | 1000 项日常活动的具身仿真基准,本文基准与仿真分割的来源。 |
九、拓展思考:值得继续扩展研究与思考的创新点
- 证据得分的不确定性建模。 现在 E t , m E_{t,m} Et,m 是个点估计;若把它换成带不确定度的分布,铰链权重可以在"证据本身没把握"时自动收缩,或许能缓解灰区与膝点敏感。
- 从"一致性"到"因果"。 EGR 的两个损失本质是动作一致性约束;若引入因果干预(如对某模态做反事实扰动并要求动作不变),能把" nuisance sensitivity"从统计一致推到因果不变,理论更硬但计算更贵。
- 证据门控与注意力门控的混合。 TacVLA 式硬门控适合单模态单线索、EGR 式软门控适合状态相关;两者能否在同一策略里分层------先用架构门控剔掉显然无关的模态,再用 EGR 在剩余模态上做状态相关正则------值得探索。
- 在线/自举证据。 真机证据现在靠离线 Grounding Dino+SAM2 分割;若策略自己产出"我在看哪个物体"的在线估计并据此算证据,就能去掉离线分割依赖、走向完全自监督。
- 跨任务证据迁移。 同类任务的参考触觉签名或焦点/交互物定义能否复用,决定了 EGR 从"每任务配证据"走向"一类任务一套证据先验"的工程可行性。
线索、EGR 式软门控适合状态相关;两者能否在同一策略里分层------先用架构门控剔掉显然无关的模态,再用 EGR 在剩余模态上做状态相关正则------值得探索。 - 在线/自举证据。 真机证据现在靠离线 Grounding Dino+SAM2 分割;若策略自己产出"我在看哪个物体"的在线估计并据此算证据,就能去掉离线分割依赖、走向完全自监督。
- 跨任务证据迁移。 同类任务的参考触觉签名或焦点/交互物定义能否复用,决定了 EGR 从"每任务配证据"走向"一类任务一套证据先验"的工程可行性。