【论文解读】一篇读懂LAWM-3D:从 DreamDojo 的 2D 潜动作到 3D 感知,关键不是加多视角而是三道防泄漏设计

论文:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models(Nankai University / Tsinghua University / Harbin Institute of Technology / EPFL,AAAI 2027)

发布时间:2026 年 8 月 6 日(arXiv v1)

作者:Jiarui Yang、Jiale Zhang、Jiawei Li、Hang Guo、Wen Huang、Jinpeng Wang、Peidong Liu、Shu-Tao Xia(共 8 人)

核心一句话:直接把多视角视频喂给潜动作模型反而掉点------LAWM-3D 用"统一跨视角动作 tokenization + 对齐 VGGT 几何特征 + 非单射 RGB-D 联合重建"三道紧耦合设计堵住未来帧外观泄漏,在 WorldArena 16 项指标上拿到 SOTA,潜动作与真实动作的互信息比最强基线 MVP-LAM 高约 15%。

核心关键词

  • 潜动作模型(LAM, Latent Action Model):从无标注视频里自监督学出"动作表示",绕开昂贵的动作标注;DreamDojo 把它做成了 VAE。
  • 世界模型(World Model):环境的"内心模拟器",给定当前观测和一个动作就能前向 rollout 未来,支撑规划与决策。
  • 3D 感知潜动作(3D-aware latent action):本文的目标------让学到的潜动作真正编码 3D 运动/几何,而不是 2D 像素外观变化。
  • 未来帧外观泄漏(future-frame appearance leakage):相邻帧训练目标下,编码器能直接"偷看"未来帧的 RGB,把潜动作退化成未来像素的压缩表示,这是本文要堵的核心漏洞。
  • 几何表示对齐(geometric representation alignment):把编码器中间层特征对齐到冻结的 3D 基础模型 VGGT,显式注入跨视角一致的几何先验。
  • 非单射 RGB-D 联合重建(non-injective RGB-D joint reconstruction):解码器额外预测深度,而深度对编码器不可见,从而切断"未来 RGB 走捷径"的通路。
  • 两阶段范式(human pretrain → robot finetune):先用大规模人类视频预训练潜动作与世界模型,再用少量真实机器人交互微调对齐动作空间。

带着问题阅读

  1. 多视角视频天然带有 3D 信息,为什么"直接加进 LAM 训练"反而让性能掉点?
  2. 三个设计(统一 tokenization / VGGT 几何对齐 / 非单射 RGB-D 重建)各自堵的是哪条泄漏路径?为什么必须"紧耦合"而非简单堆叠?
  3. 用人类视频学到的潜动作,怎么迁移到机器人------一个动作空间完全不同的平台?
  4. 16 项 SOTA 指标里,哪些是 3D 感知真正起的作用、哪些只是视觉质量持平?
  5. 依赖同步多视角数据与冻结的 VGGT,这套方法的现实天花板在哪?

一、核心导读

世界模型让智能体不必和真实环境交互就能做前向 rollout 与规划,但把它搬到"开放世界具身智能"上一直卡在两件事:动作标注太贵、不同平台动作空间异构。潜动作模型(LAM)给了一条出路------直接从海量无标注人类视频里自监督学动作表示,DreamDojo 把它做成 VAE:用相邻帧推断一个潜动作,再去重建未来观测,逼潜空间抓住关键状态转移。

但 DreamDojo 这类方法几乎都只在单视角、2D 像素空间里打转,学到的潜动作反映不了真正的 3D 运动语义。一个朴素的想法是:多视角视频天然带 3D,把它加进训练不就行了?LAWM-3D 的第一个结论恰恰是否定的------直接加多视角,性能不升反降。原因有三:在像素空间做潜动作提取引入大量任务无关信息;相邻帧目标下编码器能直接利用未来帧 RGB 走捷径(外观泄漏);多视角观测只是 2D 投影,没有显式跨视角几何约束,学不出一致的 3D 表示。

如该图所示,LAWM-3D 的整体框架围绕一个核心判断展开:把 3D 感知真正注入潜动作,靠的不是堆数据,而是堵住泄漏。于是作者提出三个紧耦合设计------统一跨视角动作 tokenization(让动作本身视角不变)、对齐 VGGT 几何特征(给显式跨视角几何对应)、非单射 RGB-D 联合重建(切断未来帧外观捷径)。这三者不是简单叠加,而是由"防泄漏 + 注几何"这一统一动机串起来。在此基础上,用大规模人类视频预训练世界模型、再用真实机器人交互微调对齐动作空间。实验上,LAWM-3D 在 WorldArena 的 16 项指标里拿到 SOTA,潜动作与真实动作的互信息比最强基线 MVP-LAM 高约 15%,并在 OOD 泛化上超过参数量大得多的 DreamDojo-14B。

二、问题背景:作者到底想解决什么

2.1 动作标注瓶颈与潜动作模型的出场

世界模型本质是环境的"内心模拟器":给定当前观测和一个动作,预测未来观测,从而支撑规划。这条路线在数据充沛的封闭环境里很有效,但一到开放世界就遇到两个硬约束------大规模显式动作标注昂贵且难扩展,不同机器人平台的动作空间又高度异构,难以跨平台迁移。

潜动作模型(LAM)正是为缓解这个瓶颈而生:直接从大规模无标注人类视频里自监督学动作表示。代表性工作里,Genie 把潜动作当成可控生成的条件信号,CoMo、DreamDojo 把它当成统一的中间动作表示,借此减少对昂贵动作标注的依赖、提升跨任务泛化。DreamDojo 的具体做法是把 LAM 写成 VAE------用相邻观测推断一个潜动作 a \mathbf{a} a,再去重建未来帧,从而鼓励潜空间抓住状态转移。

2.2 单视角 2D 潜动作的三个局限

绝大多数 LAM 只用单视角视频,且主要在 2D 像素空间建模,缺乏对 3D 运动和交互的显式推理,学到的潜动作反映不了真正的 3D 运动语义,进而拖累下游世界模型在预测与规划上的表现。

作者进一步指出,"直接加多视角"之所以无效,根源在三处:

  1. 像素空间做潜动作提取,引入大量任务无关信息,模型优先拟合像素重建而非运动语义;
  2. 相邻帧训练目标下,未来帧 RGB 可被编码器直接利用,潜动作退化为未来像素分布的压缩表示,而非动作语义;
  3. 多视角观测只是 2D 投影,缺乏显式跨视角几何约束,学不出一致的 3D 表示。

这三条合起来,构成了本文真正要回答的问题:怎样让"多视角数据"真的把 3D 感知注入潜动作,而不是变成新的干扰源? 这是后面三个设计的共同靶心。

三、核心思路:用一句主线串起来

把 3D 感知注入潜动作,靠的不是堆多视角数据,而是三道防泄漏的紧耦合设计------统一跨视角动作 tokenization 让动作本身视角不变;对齐 VGGT 给出显式跨视角几何对应;非单射 RGB-D 联合重建切断未来帧外观捷径。三者由"防泄漏 + 注几何"同一动机驱动:没有 tokenization 的统一聚合,跨视角信息各说各话;没有几何对齐,多视角仍只是无约束的 2D 投影;没有非单射深度,编码器依旧能从未来 RGB 走捷径。三道关一起把"多视角冗余"转成"视角不变、物理可落地"的潜动作,再经两阶段范式喂给世界模型。

四、方法展开:沿着论文原始逻辑拆解

4.1 总体:潜动作自编码器 + 条件世界模型,三阶段训练

如该图所示,LAWM-3D 由一个潜动作自编码器和一个条件世界模型组成,按三阶段训练以提升泛化与跨域适应:(1) 在大规模多视角 + 单视角视频上训练 LAM,抽出视角不变的动作表示;(2) 用带伪动作标签的人类视频预训练世界模型,学到"动作→未来观测"的动力学映射;(3) 在真实机器人交互数据上微调,把潜动作对齐到真实控制信号,支撑下游控制与规划。理解这条线,就能明白后面所有设计都是为"让第 (1) 步的潜动作真的具备 3D 感知"服务。

4.2 3D 感知潜动作模型:多视角 VAE 与统一 tokenization

作者把 LAM 写成多视角 VAE,从多视角观测里学视角不变的潜动作。给定一组同步的多视角观测:

公式(1):

F t = { f t v } v = 1 V F_t=\{f_t^v\}_{v=1}^{V} Ft={ftv}v=1V

它包含一个 ego 视角和 V V V 个 exo 视角,模型以相邻观测 F t : t + 1 F_{t:t+1} Ft:t+1 为输入,学一个刻画 t → t + 1 t\to t+1 t→t+1 动力学的潜动作 a \mathbf{a} a。具体地,输入帧被切成 16 × 16 16\times16 16×16 patch、映射成 token 序列,与动作 token a t : t + 1 a_{t:t+1} at:t+1 拼接,再加视角嵌入与旋转位置编码(RoPE)------视角嵌入区分不同相机,时间信息由位置编码隐式建模。

编码器是时空 Transformer( L L L 层,每层交替空间自注意力与时间自注意力加前馈网络)。由于注意力双向, t + 1 t+1 t+1 的表示会隐含 t t t 的信息,所以同一视角的帧对 f t : t + 1 f_{t:t+1} ft:t+1 只保留编码后的 a t + 1 a_{t+1} at+1 token。随后跨视角聚合(如池化)得到统一潜表示,映射到高斯参数 ( μ , log ⁡ σ ) (\mu,\log\sigma) (μ,logσ),再经重参数化得到最终潜动作 a \mathbf{a} a。解码器是空间 Transformer,在当前帧 f t v f_t^v ftv 与潜动作 a \mathbf{a} a 条件下预测未来帧 f t + 1 v f_{t+1}^v ft+1v。整体目标沿用 β \beta β-VAE 形式:

公式(2):

L R e c ( f t + 1 v ) = E q ϕ ( a ^ ∣ f t : t + 1 v ) log ⁡ p θ ( f t + 1 v ∣ a , f t v ) − β   D K L ( q ϕ ( a ∣ f t : t + 1 v )   ∥   p ( a ) ) \mathcal{L}{\mathrm{Rec}}(f{t+1}^{v})=\mathbb{E}{q\phi(\hat{\mathbf{a}}\mid f_{t:t+1}^{v})}\big\\log p_\\theta(f_{t+1}\^{v}\\mid \\mathbf{a},f_t\^v)\\big-\beta\,D_{\mathrm{KL}}\big(q_\phi(\mathbf{a}\mid f_{t:t+1}^{v})\,\|\,p(\mathbf{a})\big) LRec(ft+1v)=Eqϕ(a^∣ft:t+1v)logpθ(ft+1v∣a,ftv)−βDKL(qϕ(a∣ft:t+1v)∥p(a))

统一 tokenization 的关键在于"视角不变":作者假设 3D 空间里的动作在不同视角下是不变的,模型该抓的是跨视角一致的运动结构,而非视角特定的 2D 像素变化。为此训练时对输入视角集合做随机视角掩码(至少留一视角),解码阶段从保留子集里随机选一个视角重建------这逼编码器在观测不完整时也能推断一致的潜动作,从而对视角变化更鲁棒。受益于共享的潜动作表示,LAM 能在多视角与单视角数据混合上联合训练;推理时自然退化为单视角输入而保持稳定性能。这一步解决的是"跨视角信息怎么统一聚合",但光聚合还不够,下一节直面"未来帧 RGB 走捷径"。

4.3 防泄漏设计一:非单射 RGB-D 联合重建

虽然潜动作 a \mathbf{a} a 被设计成视角不变,但只靠像素重建损失有个致命隐患:编码器以帧对 f t : t + 1 f_{t:t+1} ft:t+1 为输入,纯重建目标会鼓励捷径学习 ------未来帧 f t + 1 f_{t+1} ft+1 的 RGB 被直接压进潜变量 a \mathbf{a} a,使 a \mathbf{a} a 退化成"未来像素分布的编码"而非动作语义,瓦解世界模型的预测能力。

作者的对策是在解码阶段引入非单射深度预测 作为辅助监督,而深度对编码器不可见:解码器拿当前帧与其深度图拼接,联合预测 { f t + 1 , d t + 1 } \{f_{t+1}, d_{t+1}\} {ft+1,dt+1},用联合重建损失 L R e c ( { f t + 1 v , d t + 1 v } ) \mathcal{L}{\mathrm{Rec}}(\{f{t+1}^{v}, d_{t+1}^{v}\}) LRec({ft+1v,dt+1v}) 优化。深度提供视角一致的几何线索、对外观变化不敏感,这套机制有效压制 RGB 信息泄漏,逼模型聚焦于几何上有意义的动态区域。"非单射"的含义在此:解码器从 a \mathbf{a} a 既要重建 RGB 又要重建深度,而深度信息编码器拿不到------ a \mathbf{a} a 无法只靠未来 RGB 同时满足两者,被迫编码真正的运动/几何。

如该图所示,本方法在 ego 视角深度预测上明显更准、空间更一致,第三行还展示了大运动预测的准确性------这说明非单射深度监督确实让潜动作带上了 3D 场景理解,而不只是像素拟合。需要强调:这是"堵泄漏",不是"加监督信息到编码器",正是它与 UniLACT 单视角深度监督的关键差别------后者更接近直接注入,本文刻意让深度只出现在解码端以防捷径。

4.4 防泄漏设计二:几何表示对齐到 VGGT

光靠重建和深度监督,仍不足以从根本上强制学出跨视角一致的 3D 结构。作者再补一刀:引入几何对齐约束,显式注入 3D 先验。受 Geometry Forcing 启发,但定位不同------Geometry Forcing 把 VGGT 全部特征对齐到扩散模型,本文则对齐 ViT 编码器的中间层"空间-语义"特征,更直接地约束几何一致性。设编码器中间特征 h ∈ R K × V × P × D h\in\mathbb{R}^{K\times V\times P\times D} h∈RK×V×P×D( K K K 层、 V V V 视角、 P P P patch、 D D D 维),对应 VGGT 几何特征 y ∈ R K × V × P ′ × D ′ y\in\mathbb{R}^{K\times V\times P'\times D'} y∈RK×V×P′×D′。VGGT 用交替的帧内/帧间注意力显式建模多视角关系,其特征天然编码跨视角一致的 3D 结构。先用投影头 f ϕ f_\phi fϕ 把 h h h 映到与 y y y 同空间,做余弦相似度的方向对齐:

公式(3):

L Angular = − 1 K V P ∑ k , v , p cos ⁡ ( y k , v , p ,   f ϕ ( h k , v , p ) ) \mathcal{L}{\text{Angular}}=-\frac{1}{KVP}\sum{k,v,p}\cos\big(y_{k,v,p},\,f_\phi(h_{k,v,p})\big) LAngular=−KVP1k,v,p∑cos(yk,v,p,fϕ(hk,v,p))

只对方向会丢幅度,直接上 MSE 又易训练不稳,于是再加预测头 g ψ g_\psi gψ 在归一化特征上回归完整几何表示:

公式(4):

L Scale = 1 K V P ∑ k , v , p ∥ g ψ ( f ϕ ( h k , v , p ) ∥ f ϕ ( h k , v , p ) ∥ 2 ) − y k , v , p ∥ 2 2 \mathcal{L}{\text{Scale}}=\frac{1}{KVP}\sum{k,v,p}\Big\|g_\psi\Big(\tfrac{f_\phi(h_{k,v,p})}{\|f_\phi(h_{k,v,p})\|2}\Big)-y{k,v,p}\Big\|_2^2 LScale=KVP1k,v,p∑ gψ(∥fϕ(hk,v,p)∥2fϕ(hk,v,p))−yk,v,p 22

LAM 总损失把联合重建与两项加权对齐损失合在一起:

公式(5):

L L A M = L Rec + λ Angular L Angular + λ Scale L Scale \mathcal{L}{\mathrm{LAM}}=\mathcal{L}{\text{Rec}}+\lambda_{\text{Angular}}\mathcal{L}{\text{Angular}}+\lambda{\text{Scale}}\mathcal{L}_{\text{Scale}} LLAM=LRec+λAngularLAngular+λScaleLScale

实现上对齐 L = 24 L=24 L=24 层中的中间区段 h = 6 , 11 h=6,11 h=6,11,潜动作维数 32, β = 10 − 6 \beta=10^{-6} β=10−6, λ Angular = 0.5 \lambda_{\text{Angular}}=0.5 λAngular=0.5、 λ Scale = 0.05 \lambda_{\text{Scale}}=0.05 λScale=0.05。为什么对齐中间层而非浅层/深层,留到消融里讲------浅层偏外观、深层太任务专一,中间层既已捕获空间-语义结构又留有编码动态的弹性,是最佳监督区。

4.5 世界模型:从潜动作到未来观测

3D 感知潜动作更能抓住真实世界动力学,也就更适合世界模型预训练。为缓解真实机器人数据稀缺导致的泛化瓶颈,作者用人类视频 + 伪动作做预训练,骨干选 Cosmos-Predict2.5。预训练时先把人类视频切成时间 chunk,抽出潜动作表示拼成动作序列,再经 MLP 投影到与世界模型时间步嵌入同维,加到时间步嵌入上、共同注入每个 DiT block 的 AdaLN 模块。

后训练阶段用每段潜视频首帧位姿作参考锚点,把动作空间改写成相对动作空间(相对该锚点的位姿增量),沿用同一注入机制;并重置动作 MLP 第一层、与所有预训练参数一起全参微调。除标准 Cosmos 目标 L flow \mathcal{L}_{\text{flow}} Lflow 外,再加 DreamDojo 的时序一致性损失:

公式(6):

L W M ( θ ) = L flow ( θ ) + λ w m   E ∑ i = 1 K − 1 ∥ ( v \^ i + 1 − v \^ i ) − ( v i + 1 − v i ) ∥ 2 \mathcal{L}{\mathrm{WM}}(\theta)=\mathcal{L}{\text{flow}}(\theta)+\lambda_{wm}\,\mathbb{E}\Big\\sum_{i=1}\^{K-1}\\big\\\|(\\hat v\^{i+1}-\\hat v\^i)-(v\^{i+1}-v\^i)\\big\\\|\^2\\Big LWM(θ)=Lflow(θ)+λwmEi=1∑K−1 (v\^i+1−v\^i)−(vi+1−vi) 2

其中 v i v^i vi 是视频潜序列里第 i i i 帧的速度。这条相对动作空间 + MLP 重注入的路线,正是回答"人类视频潜动作怎么迁移到机器人"的关键:不是让潜动作直接等于机器人控制量,而是把动作空间对齐到"相对首帧位姿增量"这一平台无关的表示上,再用少量机器人数据微调对齐。

4.6 训练数据与实现细节

人类操作视频用三个数据集:多视角的 Ego-Exo4D (约 1286 小时、740 名参与者、123 个环境、13 座城市,每序列同步采集 ego + 4--5 个第三视角,覆盖烹饪/运动/演奏等技能型活动)、Assembly101 (4321 段玩具拆装视频、约 513 小时、8 台静态相机 + 4 台头戴 ego)、单视角 EgoDex (829 小时、约 9000 万帧、33.8 万次任务演示、194 项桌面操作)。LAM 预训练还加入 AgiBot-World、RT-1、Language-Table、DROID。最大视角数 V = 7 V=7 V=7,LAM 输入分辨率 320 × 240 320\times240 320×240,世界模型用单视角 640 × 480 640\times480 640×480,视频统一处理成 13 帧(首帧作条件、余 12 帧作预测目标)。训练用 H20 GPU 从头预训练,LAM 批 128 训 60 万步、世界模型批 256 训 30 万步,全程维护 EMA 用于评测与生成。这些规模提示复现门槛不低------见 §六。

五、实验与证据:结果能支撑到什么程度

5.1 潜动作模型对比:RGB 与深度都赢

作者对比 LAPA、UniLACT、CoMo、MVP-LAM、DreamDojo,并构造更强基线 DreamDojo-D(给 DreamDojo 加深度解码器并全参微调)。如下表,LAWM-3D 在 Ego-Exo4D 与 Assembly101 的 RGB、深度两项上全面领先;相对 DreamDojo-D 进一步说明多视角输入确有收益。

Method EgoExo4D RGB PSNR↑ EgoExo4D RGB SSIM↑ EgoExo4D Depth PSNR↑ EgoExo4D Depth SSIM↑ Assembly101 RGB PSNR↑ Assembly101 RGB SSIM↑ Assembly101 Depth PSNR↑ Assembly101 Depth SSIM↑
LAPA 30.75 0.842 / / 31.26 0.867 / /
UniLACT 30.97 0.847 32.58 0.880 31.66 0.875 33.91 0.911
CoMo 31.85 0.864 / / 32.96 0.891 / /
DreamDojo 32.91 0.901 / / 33.43 0.922 / /
DreamDojo-D 32.56 0.893 33.54 0.907 33.12 0.907 34.35 0.921
LAWM-3D 33.38 0.936 35.62 0.939 35.76 0.944 35.85 0.948

注意 LAPA/CoMo/DreamDojo 不报深度("/"),因为他们本就没有深度建模能力------这也侧面说明"3D 感知"并非这些 2D 潜动作方法的天然属性。附录里的动作迁移、多视角注意力可视化、互信息估计、线性探针进一步佐证潜动作的有效性与 3D 感知(见 §5.5、§5.6)。

5.2 世界模型视频质量:16 项指标 SOTA

视频生成质量用机器人世界模型基准 WorldArena 评测,对比 GigaWorld-0、Genie Envisioner、RoboMaster、WoW、IRASim、Cosmos 2.5、DreamDojo(Posttrain),所有有公开代码的基线在与 DreamDojo 相同设置( 640 × 480 640\times480 640×480、13 帧)下微调。为便于阅读,把 16 项指标按六个维度分组、方法转置为列,加粗各行最优:

维度 / 指标 GigaWorld Genie RoboMaster Cosmos2.5 DreamDojo WoW IRASim Ours
视觉质量 Image Quality↑ 0.463 0.229 0.353 0.440 0.476 0.460 0.347 0.491
视觉质量 Aesthetic↑ 0.411 0.326 0.405 0.355 0.411 0.381 0.365 0.397
视觉质量 JEPA Sim↑ 0.437 0.334 0.302 0.903 0.915 0.744 0.916 0.920
运动质量 Dynamic Deg↑ 0.614 0.674 0.658 0.592 0.603 0.454 0.419 0.618
运动质量 Flow Score↑ 0.320 0.090 0.153 0.260 0.304 0.271 0.211 0.320
运动质量 Motion Smooth↑ 0.778 0.694 0.700 0.735 0.771 0.781 0.692 0.789
内容一致 Subject Cons↑ 0.734 0.770 0.810 0.804 0.812 0.812 0.813 0.815
内容一致 Background Cons↑ 0.832 0.883 0.903 0.895 0.909 0.893 0.898 0.913
物理 adher Photometric↑ 0.179 0.205 0.341 0.355 0.356 0.221 0.350 0.361
物理 Interaction↑ 0.529 0.205 0.533 0.541 0.558 0.538 0.567 0.578
3D 精度 Trajectory Acc↑ 0.159 0.074 0.122 0.294 0.322 0.212 0.265 0.350
3D 精度 Depth Acc↑ 0.618 0.851 0.809 0.862 0.873 0.727 0.870 0.889
可控性 Perspectivity↑ 0.760 0.520 0.738 0.763 0.795 0.749 0.782 0.805
可控性 Instruction Fol↑ 0.607 0.208 0.569 0.611 0.680 0.573 0.648 0.731
可控性 Semantic Align↑ 0.851 0.855 0.846 0.857 0.883 0.881 0.859 0.892
可控性 Action Follow↑ 0.116 0.018 0.082 0.070 0.087 0.049 0.059 0.095

如该表与上图所示,本文在绝大多数指标上拿到 SOTA。值得辨析的是:在纯视觉保真度上,部分前作(如 DreamDojo 的 JEPA 相似度、WoW 的平滑度)仍有优势,本方法只是"高度竞争";真正的拉开差距发生在 运动质量、3D 精度、可控性(尤其 Instruction/Action Follow、Perspectivity)------这正与"3D 感知潜动作"的卖点对齐:视觉质量持平的同时,动作保真与空间结构理解显著领先。Action Follow 这一列基线普遍极低(0.05--0.12),本方法 0.095 也只是相对领先而非绝对高,说明"动作可控"仍是世界模型的公认难题,3D 感知潜动作改善的是相对位次而非终点。

5.3 泛化:2B 打 14B

沿用 DreamDojo 的 OOD 评测协议,在 GR1_robot 数据集上后训练,在三个 OOD 基准(In-lab、EgoDex、DreamDojo-HV)上评测 rollout。本文一致超过 DreamDojo 各档:

Methods In-lab PSNR↑ In-lab SSIM↑ In-lab LPIPS↓ EgoDex PSNR↑ EgoDex SSIM↑ EgoDex LPIPS↓ DreamDojo-HV PSNR↑ DreamDojo-HV SSIM↑ DreamDojo-HV LPIPS↓
Cosmos-Predict2.5 20.576 0.774 0.222 19.952 0.787 0.219 18.274 0.754 0.236
DreamDojo-2B 21.114 0.774 0.222 20.411 0.775 0.226 18.813 0.747 0.238
DreamDojo-14B 21.413 0.788 0.208 20.525 0.787 0.213 18.924 0.751 0.228
Ours (2B) 21.465 0.792 0.207 20.542 0.796 0.197 19.034 0.777 0.211

如该表与上图所示,2B 的本方法在所有 OOD 基准上超过 14B 的 DreamDojo------参数量小一个量级却泛化更强,这是"3D 感知潜动作"迁移收益的直接证据。定性上,如该图所示,本方法在与香蕉交互、方块空间定位等场景里物理合理性更强,说明 3D 感知潜动作帮世界模型更有效地学到真实物理与 3D 空间结构,而不只停留在表层运动模仿。

5.4 消融:多视角单独加反而掉点,对齐才是主因

组件消融以 DreamDojo 的 LAM 为基线,在 InLab 上做:Case1 只加多视角数据;Case2 只加几何对齐;Case3 再加深度解码;Case4 多视角 + 几何对齐;Default 为完整模型。

Setting MV. Geo. Depth LAM PSNR↑ LAM SSIM↑ WM PSNR↑ WM SSIM↑
Baseline 29.31 0.886 21.22 0.782
Case1 28.97 0.872 20.53 0.711
Case2 29.84 0.906 21.36 0.789
Case3 29.69 0.912 21.42 0.788
Case4 29.92 0.919 21.64 0.793
Default 30.56 0.933 21.68 0.797

这张表是全文最关键的证据,因为它直接回答了开篇那个"反直觉"结论:Case1 只加多视角,LAM 与世界模型指标双双下降 (PSNR 29.31→28.97、WM 0.782→0.711)------多视角带来的跨视角外观差异,纯重建目标根本消解不了。Case2 单加几何对齐则全面提升,说明对齐机制本身是性能提升的主要来源。Case4 把多视角与对齐合起来更强,Default 加上深度最优。结论是:几何对齐提供了"吃下多视角数据"所必需的跨视角一致性,而多视角反过来又给对齐喂了更丰富的几何证据------二者互补而非独立,缺一则多视角从"资产"变"负债"。

数据消融进一步验证人类视频预训练的价值:

如该图所示,四种策略(不预训练 / 仅机器人 / 仅人类视频 / 人 + 机联合)里联合预训练最优,把平均归一化分从 1.0000 提到 1.0887;更值得注意的是仅人类视频预训练比仅机器人预训练收益更大,且收敛明显更快------说明多样人类交互动力学提供的是更通用的时序先验、更好的初始化,能减少下游适配步数。

5.5 世界模型当策略评估器与在线选择器

附录把世界模型从"生成器"延伸到"决策工具"。在自建的 MuJoCo 操作套件(8 项桌面任务:推、抓、堆、抽屉、倒、扫、插、折)上,世界模型全程冻结、仅靠离线轨迹训练。离线策略评估 上,世界模型想象出的回报与真实环境回报高度相关,Spearman 秩相关 ρ = 0.952 \rho=0.952 ρ=0.952,仅按预测选最优 checkpoint 的 Regret@1 只有 0.040------说明它抓住的是决策相关动力学而非"视觉上像"的未来。

进一步把它当在线策略选择器 :每步让多个 BC checkpoint 各提一个动作,用世界模型多步想象( H = 8 H=8 H=8)+ 价值头打分,选分最高者执行。如上图所示,自适应选择在高方差策略组上把成功率从最优单 checkpoint 的 53% 提到 70%(绝对 +17%,近乎均匀采样的 2 倍);在收敛组上虽空间小仍稳定占优。这指向一个实用结论:多个静态 checkpoint 被动态拼成一个自适应控制器,且收益与候选策略多样性正相关。长时程 rollout 上:

如该图所示,LAWM-3D 在长时程生成里保持更高视觉质量与时序一致性,标注区域显示它在动作跟随、交互建模、3D 理解上更稳,避免了基线常见的物体状态漂移、交互不一致、视觉伪影------这正是 3D 感知潜动作在长程预测稳定性上的回报。

5.6 潜动作空间分析:跨视角不变 + 信息更富 + 更可线性恢复

附录从四个角度验证潜动作确实"3D 感知"了。跨视角迁移 :从视角 A 的相邻两帧抽出潜动作 a t a_t at,配视角 B 的观测特征预测其未来特征,预测仍保目标视角的运动动力学------说明潜动作编码的是跨视角共享的时序信息。

视角不变性:随机取 100 个人类视频片段,对每个"片段-视角"对抽 32 维表示算余弦相似度。如该图所示,本方法呈现更清晰的对角块结构------同一底层运动跨视角更近、不同片段仍可区分,说明多视角训练有效提升了视角鲁棒性而不损可判别性。

动作信息量化 :估计潜动作 Z Z Z 与真实机器人动作 A A A 的互信息:

公式(7):

I ( Z ; A ) I(Z;A) I(Z;A)

用三种估计器(KSG 非参数 k 近邻、BA 变分下界、MINE 基于 Donsker--Varadhan)在 Bridge V2 上测,本方法在三种估计器上一致最高,比最强基线 MVP-LAM 平均高约 15%------3D 几何监督让潜空间与真实物理动作更紧凑相关,而非纠缠视角/背景变化。

动作表示线性可恢复性 :冻结潜表示 z t z_t zt,只训线性映射预测真实动作:

公式(8):

a ^ t = W z t + b \hat a_t=Wz_t+b a^t=Wzt+b

用 NMSE 评测(先 PCA 统一到 128 维、再把不同动作 horizon 换算成净相对动作保证公平)。本方法在 Bridge V2 与 LIBERO 系列 OOD 上 NMSE 最低,在长 horizon 的 LIBERO-Long 上优势更明显------说明潜动作既准编码动作语义,又捕获了跨环境可泛化的物理动态结构。

5.7 几何对齐设计分析:选哪层、权重多敏感、VGGT 是否不可替代

作者用三组对照回答几何对齐的设计问题。对齐哪段层 :浅层 1,6 偏外观收益有限,深层 19,24 太任务专一会被过度约束,中间区段 6,11 最优(PSNR 30.56);过窄 6,8 监督不足,过宽 6,16 或全层 1,24 挤占动作建模容量略降。权重敏感性 :模型对宽范围权重鲁棒,角损失主导( λ Angular = 0.5 \lambda_{\text{Angular}}=0.5 λAngular=0.5 最佳,过大与重建争资源),尺度损失辅助( λ Scale = 0.05 \lambda_{\text{Scale}}=0.05 λScale=0.05 稳,过大训练不稳)------默认配置无须逐数据集精调。VGGT 是否不可替代:换成 DINOv2(2D 语义)、Depth-Anything-V2(单目深度)、DUSt3R(多视角几何)都优于无对齐,但多视角几何模型(DUSt3R、VGGT)增益最大,VGGT 最优------因其交替帧内/帧间注意力同时建模几何与多视角对应,监督最完整。也就是说,收益来自"注入 3D 几何先验"本身而非某个特定模型,框架兼容其他 3D 基础模型。

对齐目标 RGB PSNR↑ RGB SSIM↑
None (Rec. only) 29.31 0.886
DINOv2 (2D semantic) 29.78 0.907
Depth-Anything-V2 30.02 0.916
DUSt3R 30.31 0.926
VGGT (ours) 30.56 0.933

为验证 VGGT 能否给潜动作学习提供可靠 3D 监督,作者把 Assembly101 的同步多视角视频喂给冻结 VGGT 做几何重建:

如该图所示,VGGT 在多种视角下都能准确重建 3D 场景结构------这从源头支撑了"用多视角人类视频做 VGGT 对齐"的可行性。此外,潜动作聚合策略上 Mean Pooling 最优(RGB 33.56/Depth 36.58),优于 Max/Attention/Concat------因不同视角对应同一底层动作,均值聚合在汇总跨视角共享动态的同时抑制了视角/遮挡/光照噪声。

六、这篇工作的边界与可复现性

对 3D 基础模型的依赖:几何对齐靠冻结 VGGT,潜表示质量被 VGGT 编码的几何先验"封顶"。在重遮挡、透明/反射物体、极端视角等超出 VGGT 训练分布的场景,几何特征可能不可靠、监督变弱。框架虽兼容其他 3D 模型,但基础模型误差如何向潜动作空间传播尚无系统研究。

对同步多视角数据的依赖:跨视角一致性约束需要时间同步、多标定视角的录制,而这类多视角人类操作数据(如 Assembly101)相对海量单视角网路视频仍稀缺,限制了预训练数据规模与场景/动作多样性。把对齐机制推广到非同步或单视角视频(经视图合成或伪多视角生成)是重要方向。

离线深度监督的噪声:深度由单目 Depth-Anything-V2 离线预测,本身有噪且只给相对而非度量深度,可能带来尺度模糊与跨帧/跨视角不一致;引入度量或跨视角一致深度、或训练中联合精修深度,可进一步强化几何约束。

训练成本与规模:辅助模块在 rollout 推理时零开销(LAM 编码器仅训练时前向、占比 <1%,深度模型仅离线预处理),但 LAM 与世界模型从头预训练仍需大量算力(大 batch、数十万步、H20 GPU)。受资源限制,最大世界模型实验止于 2B 主干,14B 上的 3D 感知建模scaling 行为未充分探索。额外 GPU 内存主要来自冻结模块参数与前向激活:单视角约 2GB、七视角约 9GB,多视角的算力增量主要来自更长的潜 token 序列(由 DiT 的 context-parallel 处理,扩展性良好)。

评测范围:聚焦实验室与 OOD 基准上的人类/机器人操作,潜动作空间向更多样 embodiment、动态/可变形物体、长程组合任务的泛化尚未充分验证;真实世界闭环部署也未充分验证。

可复现性:训练数据全部公开(Ego-Exo4D/Assembly101/EgoDex/AgiBot-World/RT-1/Language-Table/DROID)、骨干 Cosmos-Predict2.5 与对齐目标 VGGT/Depth-Anything-V2 均公开,超参齐全。但截至 arXiv v1,作者未公开官方代码、权重或项目主页,加上从头预训练的高算力门槛,第三方完全复现成本不低;arXiv 源码包可逐图复现图表,是当前最易拿到的入口。

七、如果继续研究/落地,应该关注什么

  • 把"防泄漏"做成通用原则:非单射监督的核心是"用编码器看不到的信息做监督"。把这套思路从深度推广到法向、光流、语义分割、甚至可微物理量,值得系统化研究。
  • 3D 基础模型误差的传播与校准:量化 VGGT 在困难场景下的几何误差如何污染潜动作,并研究自适应权重或不确定性感知对齐来抑制坏监督。
  • 摆脱同步多视角:用视图合成/伪多视角把单视角网路视频纳入对齐框架,是数据规模化的关键瓶颈。
  • scaling 到 14B 与更大主干:2B 上有效不代表 14B 上线性获益;3D 感知建模在更大模型上是更受益还是被稀释,需要专门实验。
  • 真实世界闭环 :当前 WorldArena 与 MuJoCo 套件偏离线/仿真评测,把"世界模型当策略评估器( ρ = 0.952 \rho=0.952 ρ=0.952)"落到真机闭环选择,是离实用最近的一步。
  • 策略多样性上限:在线选择收益与候选策略多样性正相关,混入不同架构/训练过程的策略集合可能进一步提升。
  • 度量深度与可变形物体:度量或多视角一致深度能缓解尺度模糊;可变形/长程组合任务是泛化的下一关。

八、术语与概念速查

  • LAPA:Latent Action Pretraining from Videos,单视角潜动作预训练的代表基线,无深度建模。
  • UniLACT:单视角下用深度监督增强 3D 理解的 LAM;本文与之差别在用"非单射"深度(仅解码端)防捷径。
  • CoMo:从互联网视频学连续潜运动的 LAM 基线。
  • MVP-LAM:靠跨视角重建约束学视角不变动作的 LAM;依赖合成或严格对齐多视角,本文改用真实人类多视角 + 统一 tokenization。
  • DreamDojo / DreamDojo-D:把 LAM 写成 VAE、用人类视频预训练世界模型的基线;DreamDojo-D 是作者给 DreamDojo 加深度解码器 + 全参微调构造的强基线。
  • Cosmos-Predict2.5:视频基础模型,本文世界模型骨干(DiT + Wan2.1 VAE + UMT5 文本编码)。
  • VGGT:Visual Geometry Grounded Transformer,冻结的 3D 基础模型,用交替帧内/帧间注意力建模多视角几何,本文对齐目标。
  • Depth-Anything-V2:单目深度估计器,仅离线生成深度监督,训练/推理时不加载。
  • WorldArena:机器人世界模型评测基准,16 项指标横跨视觉质量/运动/一致/物理/3D/可控六维。
  • Ego-Exo4D / Assembly101 / EgoDex:人类操作预训练数据(多视角 ego+exo / 多视角拆装 / 单视角桌面灵巧操作)。
  • β-VAE:带 KL 权重 β 的变分自编码器,本文 LAM 的训练框架,β=10⁻⁶ 弱化先验约束以保留动作信息。
  • AdaLN / DiT:自适应层归一化 / 扩散 Transformer,潜动作经 MLP 投影后加到时间步嵌入、注入各 DiT block 的 AdaLN。
  • RoPE:旋转位置编码,编码器里区分视角嵌入之外的时序/位置信息。
  • 重参数化 :从高斯参数 ( μ , log ⁡ σ ) (\mu,\log\sigma) (μ,logσ) 采样潜动作的标准 VAE 技巧。
  • NMSE:归一化均方误差,线性探针评估潜动作能否线性恢复真实动作的指标,越低越好。
  • 互信息估计器 KSG / BA / MINE:分别基于 k 近邻非参数、变分下界、Donsker--Varadhan 表示估计高维连续变量互信息,本文用三种交叉验证稳健性。
  • context-parallel DiT:把长潜序列分片并行处理,使多视角带来的更长 token 序列不爆显存、扩展性良好。
  • 相对动作空间:以每段潜视频首帧位姿为锚点、用位姿增量表示动作,平台无关,是人类潜动作迁移到机器人的对齐接口。
  • Regret@1:仅按世界模型预测选最优策略后、相对真实最优的后悔值;本文 0.040,说明预测选型可信。

九、拓展思考:值得继续扩展研究与思考的创新点

  1. 把"泄漏诊断"当设计原则。本文最值钱的方法论不是三个设计本身,而是"先证明朴素做法为何失败、再针对失败原因设计"这一思路------多视角单独加为何掉点被精确定位为三条泄漏路径,每个设计各堵一条。这种"负结果驱动设计"可推广到任何"加数据/加模态反而失效"的场景:先做受控消融定位失效机制,再对症下药,而不是盲目堆组件。
  2. 非单射监督作为解耦的通用机制。深度只出现在解码端、编码器看不到------本质是用"编码器不可见的信息"逼潜变量编码真正的因果因子而非相关捷径。这比"加更多监督"更根本,可推广到法向、语义、可微物理量等任何"相关但非因果"的捷径场景,是一条相对独立的表示学习路线。
  3. 冻结基础模型当几何锚。VGGT 全程冻结、仅作对齐目标------这暗示一种范式:用强基础模型提供"免费几何先验",让下游轻量模型继承其跨视角一致性而不必重学,几乎零额外推理成本。值得系统研究"基础模型误差→下游潜表示"的传播链路与自适应门控(坏监督时自动降权)。
  4. 人类→机器人的平台无关桥。相对动作空间(相对首帧位姿增量)+ MLP 重注入,把异构动作空间对齐到一个平台无关的表示接口。这比强求"潜动作=真实动作"更现实,可启发跨 embodiment 的统一动作空间设计------潜动作不必与某平台控制量同构,只要可线性/微调对齐即可。
  5. 世界模型当免交互评估器 。 ρ = 0.952 \rho=0.952 ρ=0.952 的想象---真实相关、Regret@1=0.040,意味着纯离线训练的世界模型能当低成本策略评估器与在线选择器。若成立,"世界模型"就从"生成器"升级为"模型-based RL 的评估与决策中枢",对样本效率与安全探索意义重大------值得在更广任务上验证其因果保真度的边界:它学到的到底是决策相关动力学,还是恰好相关的视觉统计?
    门控(坏监督时自动降权)。
  6. 人类→机器人的平台无关桥。相对动作空间(相对首帧位姿增量)+ MLP 重注入,把异构动作空间对齐到一个平台无关的表示接口。这比强求"潜动作=真实动作"更现实,可启发跨 embodiment 的统一动作空间设计------潜动作不必与某平台控制量同构,只要可线性/微调对齐即可。
  7. 世界模型当免交互评估器 。 ρ = 0.952 \rho=0.952 ρ=0.952 的想象---真实相关、Regret@1=0.040,意味着纯离线训练的世界模型能当低成本策略评估器与在线选择器。若成立,"世界模型"就从"生成器"升级为"模型-based RL 的评估与决策中枢",对样本效率与安全探索意义重大------值得在更广任务上验证其因果保真度的边界:它学到的到底是决策相关动力学,还是恰好相关的视觉统计?
相关推荐
Bright Data14 小时前
小米新发布的 Robotics-1 在向市场传递什么信息?
训练数据·具身智能·视频数据
m0_5474866620 小时前
《机器人学与具身智能》全套课件PDF2026
机器人·具身智能
huangns21 小时前
汽车座椅、脚垫3D扫描数字化打版怎么做,需要哪些设备?
3d
云飞云共享云桌面1 天前
非标装备厂降本方案|8‑10 人三维研发共用一台主机,兼容SolidWorks等多款 3D 绘图软件
运维·服务器·3d·自动化·负载均衡·制造
一根数据线2 天前
不用无人机也不用软件,AI也能直接从地图生成3D模型?
人工智能·3d·3d建模·无人机·倾斜摄影·造形家·场地建模
dalong103 天前
WPF:3D网格构建和渲染的三个核心
3d
dalong103 天前
WPF:3D顶点共享与法线设置对光照效果的影响
3d·wpf
摩尔线程3 天前
摩尔线程LiteGS入选ECCV 2026 高质量3DGS训练迎来效率突破
3d·摩尔线程
白拾3 天前
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练