论文:LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models(Nankai University / Tsinghua University / Harbin Institute of Technology / EPFL,AAAI 2027)
发布时间:2026 年 8 月 6 日(arXiv v1)
作者:Jiarui Yang、Jiale Zhang、Jiawei Li、Hang Guo、Wen Huang、Jinpeng Wang、Peidong Liu、Shu-Tao Xia(共 8 人)
核心一句话:直接把多视角视频喂给潜动作模型反而掉点------LAWM-3D 用"统一跨视角动作 tokenization + 对齐 VGGT 几何特征 + 非单射 RGB-D 联合重建"三道紧耦合设计堵住未来帧外观泄漏,在 WorldArena 16 项指标上拿到 SOTA,潜动作与真实动作的互信息比最强基线 MVP-LAM 高约 15%。
核心关键词
- 潜动作模型(LAM, Latent Action Model):从无标注视频里自监督学出"动作表示",绕开昂贵的动作标注;DreamDojo 把它做成了 VAE。
- 世界模型(World Model):环境的"内心模拟器",给定当前观测和一个动作就能前向 rollout 未来,支撑规划与决策。
- 3D 感知潜动作(3D-aware latent action):本文的目标------让学到的潜动作真正编码 3D 运动/几何,而不是 2D 像素外观变化。
- 未来帧外观泄漏(future-frame appearance leakage):相邻帧训练目标下,编码器能直接"偷看"未来帧的 RGB,把潜动作退化成未来像素的压缩表示,这是本文要堵的核心漏洞。
- 几何表示对齐(geometric representation alignment):把编码器中间层特征对齐到冻结的 3D 基础模型 VGGT,显式注入跨视角一致的几何先验。
- 非单射 RGB-D 联合重建(non-injective RGB-D joint reconstruction):解码器额外预测深度,而深度对编码器不可见,从而切断"未来 RGB 走捷径"的通路。
- 两阶段范式(human pretrain → robot finetune):先用大规模人类视频预训练潜动作与世界模型,再用少量真实机器人交互微调对齐动作空间。
带着问题阅读
- 多视角视频天然带有 3D 信息,为什么"直接加进 LAM 训练"反而让性能掉点?
- 三个设计(统一 tokenization / VGGT 几何对齐 / 非单射 RGB-D 重建)各自堵的是哪条泄漏路径?为什么必须"紧耦合"而非简单堆叠?
- 用人类视频学到的潜动作,怎么迁移到机器人------一个动作空间完全不同的平台?
- 16 项 SOTA 指标里,哪些是 3D 感知真正起的作用、哪些只是视觉质量持平?
- 依赖同步多视角数据与冻结的 VGGT,这套方法的现实天花板在哪?
一、核心导读
世界模型让智能体不必和真实环境交互就能做前向 rollout 与规划,但把它搬到"开放世界具身智能"上一直卡在两件事:动作标注太贵、不同平台动作空间异构。潜动作模型(LAM)给了一条出路------直接从海量无标注人类视频里自监督学动作表示,DreamDojo 把它做成 VAE:用相邻帧推断一个潜动作,再去重建未来观测,逼潜空间抓住关键状态转移。
但 DreamDojo 这类方法几乎都只在单视角、2D 像素空间里打转,学到的潜动作反映不了真正的 3D 运动语义。一个朴素的想法是:多视角视频天然带 3D,把它加进训练不就行了?LAWM-3D 的第一个结论恰恰是否定的------直接加多视角,性能不升反降。原因有三:在像素空间做潜动作提取引入大量任务无关信息;相邻帧目标下编码器能直接利用未来帧 RGB 走捷径(外观泄漏);多视角观测只是 2D 投影,没有显式跨视角几何约束,学不出一致的 3D 表示。

如该图所示,LAWM-3D 的整体框架围绕一个核心判断展开:把 3D 感知真正注入潜动作,靠的不是堆数据,而是堵住泄漏。于是作者提出三个紧耦合设计------统一跨视角动作 tokenization(让动作本身视角不变)、对齐 VGGT 几何特征(给显式跨视角几何对应)、非单射 RGB-D 联合重建(切断未来帧外观捷径)。这三者不是简单叠加,而是由"防泄漏 + 注几何"这一统一动机串起来。在此基础上,用大规模人类视频预训练世界模型、再用真实机器人交互微调对齐动作空间。实验上,LAWM-3D 在 WorldArena 的 16 项指标里拿到 SOTA,潜动作与真实动作的互信息比最强基线 MVP-LAM 高约 15%,并在 OOD 泛化上超过参数量大得多的 DreamDojo-14B。
二、问题背景:作者到底想解决什么
2.1 动作标注瓶颈与潜动作模型的出场
世界模型本质是环境的"内心模拟器":给定当前观测和一个动作,预测未来观测,从而支撑规划。这条路线在数据充沛的封闭环境里很有效,但一到开放世界就遇到两个硬约束------大规模显式动作标注昂贵且难扩展,不同机器人平台的动作空间又高度异构,难以跨平台迁移。
潜动作模型(LAM)正是为缓解这个瓶颈而生:直接从大规模无标注人类视频里自监督学动作表示。代表性工作里,Genie 把潜动作当成可控生成的条件信号,CoMo、DreamDojo 把它当成统一的中间动作表示,借此减少对昂贵动作标注的依赖、提升跨任务泛化。DreamDojo 的具体做法是把 LAM 写成 VAE------用相邻观测推断一个潜动作 a \mathbf{a} a,再去重建未来帧,从而鼓励潜空间抓住状态转移。
2.2 单视角 2D 潜动作的三个局限
绝大多数 LAM 只用单视角视频,且主要在 2D 像素空间建模,缺乏对 3D 运动和交互的显式推理,学到的潜动作反映不了真正的 3D 运动语义,进而拖累下游世界模型在预测与规划上的表现。
作者进一步指出,"直接加多视角"之所以无效,根源在三处:
- 像素空间做潜动作提取,引入大量任务无关信息,模型优先拟合像素重建而非运动语义;
- 相邻帧训练目标下,未来帧 RGB 可被编码器直接利用,潜动作退化为未来像素分布的压缩表示,而非动作语义;
- 多视角观测只是 2D 投影,缺乏显式跨视角几何约束,学不出一致的 3D 表示。
这三条合起来,构成了本文真正要回答的问题:怎样让"多视角数据"真的把 3D 感知注入潜动作,而不是变成新的干扰源? 这是后面三个设计的共同靶心。
三、核心思路:用一句主线串起来
把 3D 感知注入潜动作,靠的不是堆多视角数据,而是三道防泄漏的紧耦合设计------统一跨视角动作 tokenization 让动作本身视角不变;对齐 VGGT 给出显式跨视角几何对应;非单射 RGB-D 联合重建切断未来帧外观捷径。三者由"防泄漏 + 注几何"同一动机驱动:没有 tokenization 的统一聚合,跨视角信息各说各话;没有几何对齐,多视角仍只是无约束的 2D 投影;没有非单射深度,编码器依旧能从未来 RGB 走捷径。三道关一起把"多视角冗余"转成"视角不变、物理可落地"的潜动作,再经两阶段范式喂给世界模型。
四、方法展开:沿着论文原始逻辑拆解
4.1 总体:潜动作自编码器 + 条件世界模型,三阶段训练

如该图所示,LAWM-3D 由一个潜动作自编码器和一个条件世界模型组成,按三阶段训练以提升泛化与跨域适应:(1) 在大规模多视角 + 单视角视频上训练 LAM,抽出视角不变的动作表示;(2) 用带伪动作标签的人类视频预训练世界模型,学到"动作→未来观测"的动力学映射;(3) 在真实机器人交互数据上微调,把潜动作对齐到真实控制信号,支撑下游控制与规划。理解这条线,就能明白后面所有设计都是为"让第 (1) 步的潜动作真的具备 3D 感知"服务。
4.2 3D 感知潜动作模型:多视角 VAE 与统一 tokenization
作者把 LAM 写成多视角 VAE,从多视角观测里学视角不变的潜动作。给定一组同步的多视角观测:
公式(1):
F t = { f t v } v = 1 V F_t=\{f_t^v\}_{v=1}^{V} Ft={ftv}v=1V
它包含一个 ego 视角和 V V V 个 exo 视角,模型以相邻观测 F t : t + 1 F_{t:t+1} Ft:t+1 为输入,学一个刻画 t → t + 1 t\to t+1 t→t+1 动力学的潜动作 a \mathbf{a} a。具体地,输入帧被切成 16 × 16 16\times16 16×16 patch、映射成 token 序列,与动作 token a t : t + 1 a_{t:t+1} at:t+1 拼接,再加视角嵌入与旋转位置编码(RoPE)------视角嵌入区分不同相机,时间信息由位置编码隐式建模。
编码器是时空 Transformer( L L L 层,每层交替空间自注意力与时间自注意力加前馈网络)。由于注意力双向, t + 1 t+1 t+1 的表示会隐含 t t t 的信息,所以同一视角的帧对 f t : t + 1 f_{t:t+1} ft:t+1 只保留编码后的 a t + 1 a_{t+1} at+1 token。随后跨视角聚合(如池化)得到统一潜表示,映射到高斯参数 ( μ , log σ ) (\mu,\log\sigma) (μ,logσ),再经重参数化得到最终潜动作 a \mathbf{a} a。解码器是空间 Transformer,在当前帧 f t v f_t^v ftv 与潜动作 a \mathbf{a} a 条件下预测未来帧 f t + 1 v f_{t+1}^v ft+1v。整体目标沿用 β \beta β-VAE 形式:
公式(2):
L R e c ( f t + 1 v ) = E q ϕ ( a ^ ∣ f t : t + 1 v ) log p θ ( f t + 1 v ∣ a , f t v ) − β D K L ( q ϕ ( a ∣ f t : t + 1 v ) ∥ p ( a ) ) \mathcal{L}{\mathrm{Rec}}(f{t+1}^{v})=\mathbb{E}{q\phi(\hat{\mathbf{a}}\mid f_{t:t+1}^{v})}\big\\log p_\\theta(f_{t+1}\^{v}\\mid \\mathbf{a},f_t\^v)\\big-\beta\,D_{\mathrm{KL}}\big(q_\phi(\mathbf{a}\mid f_{t:t+1}^{v})\,\|\,p(\mathbf{a})\big) LRec(ft+1v)=Eqϕ(a^∣ft:t+1v)logpθ(ft+1v∣a,ftv)−βDKL(qϕ(a∣ft:t+1v)∥p(a))
统一 tokenization 的关键在于"视角不变":作者假设 3D 空间里的动作在不同视角下是不变的,模型该抓的是跨视角一致的运动结构,而非视角特定的 2D 像素变化。为此训练时对输入视角集合做随机视角掩码(至少留一视角),解码阶段从保留子集里随机选一个视角重建------这逼编码器在观测不完整时也能推断一致的潜动作,从而对视角变化更鲁棒。受益于共享的潜动作表示,LAM 能在多视角与单视角数据混合上联合训练;推理时自然退化为单视角输入而保持稳定性能。这一步解决的是"跨视角信息怎么统一聚合",但光聚合还不够,下一节直面"未来帧 RGB 走捷径"。
4.3 防泄漏设计一:非单射 RGB-D 联合重建
虽然潜动作 a \mathbf{a} a 被设计成视角不变,但只靠像素重建损失有个致命隐患:编码器以帧对 f t : t + 1 f_{t:t+1} ft:t+1 为输入,纯重建目标会鼓励捷径学习 ------未来帧 f t + 1 f_{t+1} ft+1 的 RGB 被直接压进潜变量 a \mathbf{a} a,使 a \mathbf{a} a 退化成"未来像素分布的编码"而非动作语义,瓦解世界模型的预测能力。
作者的对策是在解码阶段引入非单射深度预测 作为辅助监督,而深度对编码器不可见:解码器拿当前帧与其深度图拼接,联合预测 { f t + 1 , d t + 1 } \{f_{t+1}, d_{t+1}\} {ft+1,dt+1},用联合重建损失 L R e c ( { f t + 1 v , d t + 1 v } ) \mathcal{L}{\mathrm{Rec}}(\{f{t+1}^{v}, d_{t+1}^{v}\}) LRec({ft+1v,dt+1v}) 优化。深度提供视角一致的几何线索、对外观变化不敏感,这套机制有效压制 RGB 信息泄漏,逼模型聚焦于几何上有意义的动态区域。"非单射"的含义在此:解码器从 a \mathbf{a} a 既要重建 RGB 又要重建深度,而深度信息编码器拿不到------ a \mathbf{a} a 无法只靠未来 RGB 同时满足两者,被迫编码真正的运动/几何。

如该图所示,本方法在 ego 视角深度预测上明显更准、空间更一致,第三行还展示了大运动预测的准确性------这说明非单射深度监督确实让潜动作带上了 3D 场景理解,而不只是像素拟合。需要强调:这是"堵泄漏",不是"加监督信息到编码器",正是它与 UniLACT 单视角深度监督的关键差别------后者更接近直接注入,本文刻意让深度只出现在解码端以防捷径。
4.4 防泄漏设计二:几何表示对齐到 VGGT
光靠重建和深度监督,仍不足以从根本上强制学出跨视角一致的 3D 结构。作者再补一刀:引入几何对齐约束,显式注入 3D 先验。受 Geometry Forcing 启发,但定位不同------Geometry Forcing 把 VGGT 全部特征对齐到扩散模型,本文则对齐 ViT 编码器的中间层"空间-语义"特征,更直接地约束几何一致性。设编码器中间特征 h ∈ R K × V × P × D h\in\mathbb{R}^{K\times V\times P\times D} h∈RK×V×P×D( K K K 层、 V V V 视角、 P P P patch、 D D D 维),对应 VGGT 几何特征 y ∈ R K × V × P ′ × D ′ y\in\mathbb{R}^{K\times V\times P'\times D'} y∈RK×V×P′×D′。VGGT 用交替的帧内/帧间注意力显式建模多视角关系,其特征天然编码跨视角一致的 3D 结构。先用投影头 f ϕ f_\phi fϕ 把 h h h 映到与 y y y 同空间,做余弦相似度的方向对齐:
公式(3):
L Angular = − 1 K V P ∑ k , v , p cos ( y k , v , p , f ϕ ( h k , v , p ) ) \mathcal{L}{\text{Angular}}=-\frac{1}{KVP}\sum{k,v,p}\cos\big(y_{k,v,p},\,f_\phi(h_{k,v,p})\big) LAngular=−KVP1k,v,p∑cos(yk,v,p,fϕ(hk,v,p))
只对方向会丢幅度,直接上 MSE 又易训练不稳,于是再加预测头 g ψ g_\psi gψ 在归一化特征上回归完整几何表示:
公式(4):
L Scale = 1 K V P ∑ k , v , p ∥ g ψ ( f ϕ ( h k , v , p ) ∥ f ϕ ( h k , v , p ) ∥ 2 ) − y k , v , p ∥ 2 2 \mathcal{L}{\text{Scale}}=\frac{1}{KVP}\sum{k,v,p}\Big\|g_\psi\Big(\tfrac{f_\phi(h_{k,v,p})}{\|f_\phi(h_{k,v,p})\|2}\Big)-y{k,v,p}\Big\|_2^2 LScale=KVP1k,v,p∑ gψ(∥fϕ(hk,v,p)∥2fϕ(hk,v,p))−yk,v,p 22
LAM 总损失把联合重建与两项加权对齐损失合在一起:
公式(5):
L L A M = L Rec + λ Angular L Angular + λ Scale L Scale \mathcal{L}{\mathrm{LAM}}=\mathcal{L}{\text{Rec}}+\lambda_{\text{Angular}}\mathcal{L}{\text{Angular}}+\lambda{\text{Scale}}\mathcal{L}_{\text{Scale}} LLAM=LRec+λAngularLAngular+λScaleLScale
实现上对齐 L = 24 L=24 L=24 层中的中间区段 h = 6 , 11 h=6,11 h=6,11,潜动作维数 32, β = 10 − 6 \beta=10^{-6} β=10−6, λ Angular = 0.5 \lambda_{\text{Angular}}=0.5 λAngular=0.5、 λ Scale = 0.05 \lambda_{\text{Scale}}=0.05 λScale=0.05。为什么对齐中间层而非浅层/深层,留到消融里讲------浅层偏外观、深层太任务专一,中间层既已捕获空间-语义结构又留有编码动态的弹性,是最佳监督区。
4.5 世界模型:从潜动作到未来观测
3D 感知潜动作更能抓住真实世界动力学,也就更适合世界模型预训练。为缓解真实机器人数据稀缺导致的泛化瓶颈,作者用人类视频 + 伪动作做预训练,骨干选 Cosmos-Predict2.5。预训练时先把人类视频切成时间 chunk,抽出潜动作表示拼成动作序列,再经 MLP 投影到与世界模型时间步嵌入同维,加到时间步嵌入上、共同注入每个 DiT block 的 AdaLN 模块。
后训练阶段用每段潜视频首帧位姿作参考锚点,把动作空间改写成相对动作空间(相对该锚点的位姿增量),沿用同一注入机制;并重置动作 MLP 第一层、与所有预训练参数一起全参微调。除标准 Cosmos 目标 L flow \mathcal{L}_{\text{flow}} Lflow 外,再加 DreamDojo 的时序一致性损失:
公式(6):
L W M ( θ ) = L flow ( θ ) + λ w m E ∑ i = 1 K − 1 ∥ ( v \^ i + 1 − v \^ i ) − ( v i + 1 − v i ) ∥ 2 \mathcal{L}{\mathrm{WM}}(\theta)=\mathcal{L}{\text{flow}}(\theta)+\lambda_{wm}\,\mathbb{E}\Big\\sum_{i=1}\^{K-1}\\big\\\|(\\hat v\^{i+1}-\\hat v\^i)-(v\^{i+1}-v\^i)\\big\\\|\^2\\Big LWM(θ)=Lflow(θ)+λwmEi=1∑K−1 (v\^i+1−v\^i)−(vi+1−vi) 2
其中 v i v^i vi 是视频潜序列里第 i i i 帧的速度。这条相对动作空间 + MLP 重注入的路线,正是回答"人类视频潜动作怎么迁移到机器人"的关键:不是让潜动作直接等于机器人控制量,而是把动作空间对齐到"相对首帧位姿增量"这一平台无关的表示上,再用少量机器人数据微调对齐。
4.6 训练数据与实现细节
人类操作视频用三个数据集:多视角的 Ego-Exo4D (约 1286 小时、740 名参与者、123 个环境、13 座城市,每序列同步采集 ego + 4--5 个第三视角,覆盖烹饪/运动/演奏等技能型活动)、Assembly101 (4321 段玩具拆装视频、约 513 小时、8 台静态相机 + 4 台头戴 ego)、单视角 EgoDex (829 小时、约 9000 万帧、33.8 万次任务演示、194 项桌面操作)。LAM 预训练还加入 AgiBot-World、RT-1、Language-Table、DROID。最大视角数 V = 7 V=7 V=7,LAM 输入分辨率 320 × 240 320\times240 320×240,世界模型用单视角 640 × 480 640\times480 640×480,视频统一处理成 13 帧(首帧作条件、余 12 帧作预测目标)。训练用 H20 GPU 从头预训练,LAM 批 128 训 60 万步、世界模型批 256 训 30 万步,全程维护 EMA 用于评测与生成。这些规模提示复现门槛不低------见 §六。
五、实验与证据:结果能支撑到什么程度
5.1 潜动作模型对比:RGB 与深度都赢
作者对比 LAPA、UniLACT、CoMo、MVP-LAM、DreamDojo,并构造更强基线 DreamDojo-D(给 DreamDojo 加深度解码器并全参微调)。如下表,LAWM-3D 在 Ego-Exo4D 与 Assembly101 的 RGB、深度两项上全面领先;相对 DreamDojo-D 进一步说明多视角输入确有收益。
| Method | EgoExo4D RGB PSNR↑ | EgoExo4D RGB SSIM↑ | EgoExo4D Depth PSNR↑ | EgoExo4D Depth SSIM↑ | Assembly101 RGB PSNR↑ | Assembly101 RGB SSIM↑ | Assembly101 Depth PSNR↑ | Assembly101 Depth SSIM↑ |
|---|---|---|---|---|---|---|---|---|
| LAPA | 30.75 | 0.842 | / | / | 31.26 | 0.867 | / | / |
| UniLACT | 30.97 | 0.847 | 32.58 | 0.880 | 31.66 | 0.875 | 33.91 | 0.911 |
| CoMo | 31.85 | 0.864 | / | / | 32.96 | 0.891 | / | / |
| DreamDojo | 32.91 | 0.901 | / | / | 33.43 | 0.922 | / | / |
| DreamDojo-D | 32.56 | 0.893 | 33.54 | 0.907 | 33.12 | 0.907 | 34.35 | 0.921 |
| LAWM-3D | 33.38 | 0.936 | 35.62 | 0.939 | 35.76 | 0.944 | 35.85 | 0.948 |
注意 LAPA/CoMo/DreamDojo 不报深度("/"),因为他们本就没有深度建模能力------这也侧面说明"3D 感知"并非这些 2D 潜动作方法的天然属性。附录里的动作迁移、多视角注意力可视化、互信息估计、线性探针进一步佐证潜动作的有效性与 3D 感知(见 §5.5、§5.6)。
5.2 世界模型视频质量:16 项指标 SOTA
视频生成质量用机器人世界模型基准 WorldArena 评测,对比 GigaWorld-0、Genie Envisioner、RoboMaster、WoW、IRASim、Cosmos 2.5、DreamDojo(Posttrain),所有有公开代码的基线在与 DreamDojo 相同设置( 640 × 480 640\times480 640×480、13 帧)下微调。为便于阅读,把 16 项指标按六个维度分组、方法转置为列,加粗各行最优:
| 维度 / 指标 | GigaWorld | Genie | RoboMaster | Cosmos2.5 | DreamDojo | WoW | IRASim | Ours |
|---|---|---|---|---|---|---|---|---|
| 视觉质量 Image Quality↑ | 0.463 | 0.229 | 0.353 | 0.440 | 0.476 | 0.460 | 0.347 | 0.491 |
| 视觉质量 Aesthetic↑ | 0.411 | 0.326 | 0.405 | 0.355 | 0.411 | 0.381 | 0.365 | 0.397 |
| 视觉质量 JEPA Sim↑ | 0.437 | 0.334 | 0.302 | 0.903 | 0.915 | 0.744 | 0.916 | 0.920 |
| 运动质量 Dynamic Deg↑ | 0.614 | 0.674 | 0.658 | 0.592 | 0.603 | 0.454 | 0.419 | 0.618 |
| 运动质量 Flow Score↑ | 0.320 | 0.090 | 0.153 | 0.260 | 0.304 | 0.271 | 0.211 | 0.320 |
| 运动质量 Motion Smooth↑ | 0.778 | 0.694 | 0.700 | 0.735 | 0.771 | 0.781 | 0.692 | 0.789 |
| 内容一致 Subject Cons↑ | 0.734 | 0.770 | 0.810 | 0.804 | 0.812 | 0.812 | 0.813 | 0.815 |
| 内容一致 Background Cons↑ | 0.832 | 0.883 | 0.903 | 0.895 | 0.909 | 0.893 | 0.898 | 0.913 |
| 物理 adher Photometric↑ | 0.179 | 0.205 | 0.341 | 0.355 | 0.356 | 0.221 | 0.350 | 0.361 |
| 物理 Interaction↑ | 0.529 | 0.205 | 0.533 | 0.541 | 0.558 | 0.538 | 0.567 | 0.578 |
| 3D 精度 Trajectory Acc↑ | 0.159 | 0.074 | 0.122 | 0.294 | 0.322 | 0.212 | 0.265 | 0.350 |
| 3D 精度 Depth Acc↑ | 0.618 | 0.851 | 0.809 | 0.862 | 0.873 | 0.727 | 0.870 | 0.889 |
| 可控性 Perspectivity↑ | 0.760 | 0.520 | 0.738 | 0.763 | 0.795 | 0.749 | 0.782 | 0.805 |
| 可控性 Instruction Fol↑ | 0.607 | 0.208 | 0.569 | 0.611 | 0.680 | 0.573 | 0.648 | 0.731 |
| 可控性 Semantic Align↑ | 0.851 | 0.855 | 0.846 | 0.857 | 0.883 | 0.881 | 0.859 | 0.892 |
| 可控性 Action Follow↑ | 0.116 | 0.018 | 0.082 | 0.070 | 0.087 | 0.049 | 0.059 | 0.095 |

如该表与上图所示,本文在绝大多数指标上拿到 SOTA。值得辨析的是:在纯视觉保真度上,部分前作(如 DreamDojo 的 JEPA 相似度、WoW 的平滑度)仍有优势,本方法只是"高度竞争";真正的拉开差距发生在 运动质量、3D 精度、可控性(尤其 Instruction/Action Follow、Perspectivity)------这正与"3D 感知潜动作"的卖点对齐:视觉质量持平的同时,动作保真与空间结构理解显著领先。Action Follow 这一列基线普遍极低(0.05--0.12),本方法 0.095 也只是相对领先而非绝对高,说明"动作可控"仍是世界模型的公认难题,3D 感知潜动作改善的是相对位次而非终点。
5.3 泛化:2B 打 14B
沿用 DreamDojo 的 OOD 评测协议,在 GR1_robot 数据集上后训练,在三个 OOD 基准(In-lab、EgoDex、DreamDojo-HV)上评测 rollout。本文一致超过 DreamDojo 各档:
| Methods | In-lab PSNR↑ | In-lab SSIM↑ | In-lab LPIPS↓ | EgoDex PSNR↑ | EgoDex SSIM↑ | EgoDex LPIPS↓ | DreamDojo-HV PSNR↑ | DreamDojo-HV SSIM↑ | DreamDojo-HV LPIPS↓ |
|---|---|---|---|---|---|---|---|---|---|
| Cosmos-Predict2.5 | 20.576 | 0.774 | 0.222 | 19.952 | 0.787 | 0.219 | 18.274 | 0.754 | 0.236 |
| DreamDojo-2B | 21.114 | 0.774 | 0.222 | 20.411 | 0.775 | 0.226 | 18.813 | 0.747 | 0.238 |
| DreamDojo-14B | 21.413 | 0.788 | 0.208 | 20.525 | 0.787 | 0.213 | 18.924 | 0.751 | 0.228 |
| Ours (2B) | 21.465 | 0.792 | 0.207 | 20.542 | 0.796 | 0.197 | 19.034 | 0.777 | 0.211 |

如该表与上图所示,2B 的本方法在所有 OOD 基准上超过 14B 的 DreamDojo------参数量小一个量级却泛化更强,这是"3D 感知潜动作"迁移收益的直接证据。定性上,如该图所示,本方法在与香蕉交互、方块空间定位等场景里物理合理性更强,说明 3D 感知潜动作帮世界模型更有效地学到真实物理与 3D 空间结构,而不只停留在表层运动模仿。
5.4 消融:多视角单独加反而掉点,对齐才是主因
组件消融以 DreamDojo 的 LAM 为基线,在 InLab 上做:Case1 只加多视角数据;Case2 只加几何对齐;Case3 再加深度解码;Case4 多视角 + 几何对齐;Default 为完整模型。
| Setting | MV. | Geo. | Depth | LAM PSNR↑ | LAM SSIM↑ | WM PSNR↑ | WM SSIM↑ |
|---|---|---|---|---|---|---|---|
| Baseline | 29.31 | 0.886 | 21.22 | 0.782 | |||
| Case1 | √ | 28.97 | 0.872 | 20.53 | 0.711 | ||
| Case2 | √ | 29.84 | 0.906 | 21.36 | 0.789 | ||
| Case3 | √ | √ | 29.69 | 0.912 | 21.42 | 0.788 | |
| Case4 | √ | √ | 29.92 | 0.919 | 21.64 | 0.793 | |
| Default | √ | √ | √ | 30.56 | 0.933 | 21.68 | 0.797 |
这张表是全文最关键的证据,因为它直接回答了开篇那个"反直觉"结论:Case1 只加多视角,LAM 与世界模型指标双双下降 (PSNR 29.31→28.97、WM 0.782→0.711)------多视角带来的跨视角外观差异,纯重建目标根本消解不了。Case2 单加几何对齐则全面提升,说明对齐机制本身是性能提升的主要来源。Case4 把多视角与对齐合起来更强,Default 加上深度最优。结论是:几何对齐提供了"吃下多视角数据"所必需的跨视角一致性,而多视角反过来又给对齐喂了更丰富的几何证据------二者互补而非独立,缺一则多视角从"资产"变"负债"。
数据消融进一步验证人类视频预训练的价值:

如该图所示,四种策略(不预训练 / 仅机器人 / 仅人类视频 / 人 + 机联合)里联合预训练最优,把平均归一化分从 1.0000 提到 1.0887;更值得注意的是仅人类视频预训练比仅机器人预训练收益更大,且收敛明显更快------说明多样人类交互动力学提供的是更通用的时序先验、更好的初始化,能减少下游适配步数。
5.5 世界模型当策略评估器与在线选择器
附录把世界模型从"生成器"延伸到"决策工具"。在自建的 MuJoCo 操作套件(8 项桌面任务:推、抓、堆、抽屉、倒、扫、插、折)上,世界模型全程冻结、仅靠离线轨迹训练。离线策略评估 上,世界模型想象出的回报与真实环境回报高度相关,Spearman 秩相关 ρ = 0.952 \rho=0.952 ρ=0.952,仅按预测选最优 checkpoint 的 Regret@1 只有 0.040------说明它抓住的是决策相关动力学而非"视觉上像"的未来。

进一步把它当在线策略选择器 :每步让多个 BC checkpoint 各提一个动作,用世界模型多步想象( H = 8 H=8 H=8)+ 价值头打分,选分最高者执行。如上图所示,自适应选择在高方差策略组上把成功率从最优单 checkpoint 的 53% 提到 70%(绝对 +17%,近乎均匀采样的 2 倍);在收敛组上虽空间小仍稳定占优。这指向一个实用结论:多个静态 checkpoint 被动态拼成一个自适应控制器,且收益与候选策略多样性正相关。长时程 rollout 上:

如该图所示,LAWM-3D 在长时程生成里保持更高视觉质量与时序一致性,标注区域显示它在动作跟随、交互建模、3D 理解上更稳,避免了基线常见的物体状态漂移、交互不一致、视觉伪影------这正是 3D 感知潜动作在长程预测稳定性上的回报。
5.6 潜动作空间分析:跨视角不变 + 信息更富 + 更可线性恢复
附录从四个角度验证潜动作确实"3D 感知"了。跨视角迁移 :从视角 A 的相邻两帧抽出潜动作 a t a_t at,配视角 B 的观测特征预测其未来特征,预测仍保目标视角的运动动力学------说明潜动作编码的是跨视角共享的时序信息。

视角不变性:随机取 100 个人类视频片段,对每个"片段-视角"对抽 32 维表示算余弦相似度。如该图所示,本方法呈现更清晰的对角块结构------同一底层运动跨视角更近、不同片段仍可区分,说明多视角训练有效提升了视角鲁棒性而不损可判别性。

动作信息量化 :估计潜动作 Z Z Z 与真实机器人动作 A A A 的互信息:
公式(7):
I ( Z ; A ) I(Z;A) I(Z;A)
用三种估计器(KSG 非参数 k 近邻、BA 变分下界、MINE 基于 Donsker--Varadhan)在 Bridge V2 上测,本方法在三种估计器上一致最高,比最强基线 MVP-LAM 平均高约 15%------3D 几何监督让潜空间与真实物理动作更紧凑相关,而非纠缠视角/背景变化。

动作表示线性可恢复性 :冻结潜表示 z t z_t zt,只训线性映射预测真实动作:
公式(8):
a ^ t = W z t + b \hat a_t=Wz_t+b a^t=Wzt+b
用 NMSE 评测(先 PCA 统一到 128 维、再把不同动作 horizon 换算成净相对动作保证公平)。本方法在 Bridge V2 与 LIBERO 系列 OOD 上 NMSE 最低,在长 horizon 的 LIBERO-Long 上优势更明显------说明潜动作既准编码动作语义,又捕获了跨环境可泛化的物理动态结构。

5.7 几何对齐设计分析:选哪层、权重多敏感、VGGT 是否不可替代
作者用三组对照回答几何对齐的设计问题。对齐哪段层 :浅层 1,6 偏外观收益有限,深层 19,24 太任务专一会被过度约束,中间区段 6,11 最优(PSNR 30.56);过窄 6,8 监督不足,过宽 6,16 或全层 1,24 挤占动作建模容量略降。权重敏感性 :模型对宽范围权重鲁棒,角损失主导( λ Angular = 0.5 \lambda_{\text{Angular}}=0.5 λAngular=0.5 最佳,过大与重建争资源),尺度损失辅助( λ Scale = 0.05 \lambda_{\text{Scale}}=0.05 λScale=0.05 稳,过大训练不稳)------默认配置无须逐数据集精调。VGGT 是否不可替代:换成 DINOv2(2D 语义)、Depth-Anything-V2(单目深度)、DUSt3R(多视角几何)都优于无对齐,但多视角几何模型(DUSt3R、VGGT)增益最大,VGGT 最优------因其交替帧内/帧间注意力同时建模几何与多视角对应,监督最完整。也就是说,收益来自"注入 3D 几何先验"本身而非某个特定模型,框架兼容其他 3D 基础模型。
| 对齐目标 | RGB PSNR↑ | RGB SSIM↑ |
|---|---|---|
| None (Rec. only) | 29.31 | 0.886 |
| DINOv2 (2D semantic) | 29.78 | 0.907 |
| Depth-Anything-V2 | 30.02 | 0.916 |
| DUSt3R | 30.31 | 0.926 |
| VGGT (ours) | 30.56 | 0.933 |
为验证 VGGT 能否给潜动作学习提供可靠 3D 监督,作者把 Assembly101 的同步多视角视频喂给冻结 VGGT 做几何重建:

如该图所示,VGGT 在多种视角下都能准确重建 3D 场景结构------这从源头支撑了"用多视角人类视频做 VGGT 对齐"的可行性。此外,潜动作聚合策略上 Mean Pooling 最优(RGB 33.56/Depth 36.58),优于 Max/Attention/Concat------因不同视角对应同一底层动作,均值聚合在汇总跨视角共享动态的同时抑制了视角/遮挡/光照噪声。
六、这篇工作的边界与可复现性
对 3D 基础模型的依赖:几何对齐靠冻结 VGGT,潜表示质量被 VGGT 编码的几何先验"封顶"。在重遮挡、透明/反射物体、极端视角等超出 VGGT 训练分布的场景,几何特征可能不可靠、监督变弱。框架虽兼容其他 3D 模型,但基础模型误差如何向潜动作空间传播尚无系统研究。
对同步多视角数据的依赖:跨视角一致性约束需要时间同步、多标定视角的录制,而这类多视角人类操作数据(如 Assembly101)相对海量单视角网路视频仍稀缺,限制了预训练数据规模与场景/动作多样性。把对齐机制推广到非同步或单视角视频(经视图合成或伪多视角生成)是重要方向。
离线深度监督的噪声:深度由单目 Depth-Anything-V2 离线预测,本身有噪且只给相对而非度量深度,可能带来尺度模糊与跨帧/跨视角不一致;引入度量或跨视角一致深度、或训练中联合精修深度,可进一步强化几何约束。
训练成本与规模:辅助模块在 rollout 推理时零开销(LAM 编码器仅训练时前向、占比 <1%,深度模型仅离线预处理),但 LAM 与世界模型从头预训练仍需大量算力(大 batch、数十万步、H20 GPU)。受资源限制,最大世界模型实验止于 2B 主干,14B 上的 3D 感知建模scaling 行为未充分探索。额外 GPU 内存主要来自冻结模块参数与前向激活:单视角约 2GB、七视角约 9GB,多视角的算力增量主要来自更长的潜 token 序列(由 DiT 的 context-parallel 处理,扩展性良好)。
评测范围:聚焦实验室与 OOD 基准上的人类/机器人操作,潜动作空间向更多样 embodiment、动态/可变形物体、长程组合任务的泛化尚未充分验证;真实世界闭环部署也未充分验证。
可复现性:训练数据全部公开(Ego-Exo4D/Assembly101/EgoDex/AgiBot-World/RT-1/Language-Table/DROID)、骨干 Cosmos-Predict2.5 与对齐目标 VGGT/Depth-Anything-V2 均公开,超参齐全。但截至 arXiv v1,作者未公开官方代码、权重或项目主页,加上从头预训练的高算力门槛,第三方完全复现成本不低;arXiv 源码包可逐图复现图表,是当前最易拿到的入口。
七、如果继续研究/落地,应该关注什么
- 把"防泄漏"做成通用原则:非单射监督的核心是"用编码器看不到的信息做监督"。把这套思路从深度推广到法向、光流、语义分割、甚至可微物理量,值得系统化研究。
- 3D 基础模型误差的传播与校准:量化 VGGT 在困难场景下的几何误差如何污染潜动作,并研究自适应权重或不确定性感知对齐来抑制坏监督。
- 摆脱同步多视角:用视图合成/伪多视角把单视角网路视频纳入对齐框架,是数据规模化的关键瓶颈。
- scaling 到 14B 与更大主干:2B 上有效不代表 14B 上线性获益;3D 感知建模在更大模型上是更受益还是被稀释,需要专门实验。
- 真实世界闭环 :当前 WorldArena 与 MuJoCo 套件偏离线/仿真评测,把"世界模型当策略评估器( ρ = 0.952 \rho=0.952 ρ=0.952)"落到真机闭环选择,是离实用最近的一步。
- 策略多样性上限:在线选择收益与候选策略多样性正相关,混入不同架构/训练过程的策略集合可能进一步提升。
- 度量深度与可变形物体:度量或多视角一致深度能缓解尺度模糊;可变形/长程组合任务是泛化的下一关。
八、术语与概念速查
- LAPA:Latent Action Pretraining from Videos,单视角潜动作预训练的代表基线,无深度建模。
- UniLACT:单视角下用深度监督增强 3D 理解的 LAM;本文与之差别在用"非单射"深度(仅解码端)防捷径。
- CoMo:从互联网视频学连续潜运动的 LAM 基线。
- MVP-LAM:靠跨视角重建约束学视角不变动作的 LAM;依赖合成或严格对齐多视角,本文改用真实人类多视角 + 统一 tokenization。
- DreamDojo / DreamDojo-D:把 LAM 写成 VAE、用人类视频预训练世界模型的基线;DreamDojo-D 是作者给 DreamDojo 加深度解码器 + 全参微调构造的强基线。
- Cosmos-Predict2.5:视频基础模型,本文世界模型骨干(DiT + Wan2.1 VAE + UMT5 文本编码)。
- VGGT:Visual Geometry Grounded Transformer,冻结的 3D 基础模型,用交替帧内/帧间注意力建模多视角几何,本文对齐目标。
- Depth-Anything-V2:单目深度估计器,仅离线生成深度监督,训练/推理时不加载。
- WorldArena:机器人世界模型评测基准,16 项指标横跨视觉质量/运动/一致/物理/3D/可控六维。
- Ego-Exo4D / Assembly101 / EgoDex:人类操作预训练数据(多视角 ego+exo / 多视角拆装 / 单视角桌面灵巧操作)。
- β-VAE:带 KL 权重 β 的变分自编码器,本文 LAM 的训练框架,β=10⁻⁶ 弱化先验约束以保留动作信息。
- AdaLN / DiT:自适应层归一化 / 扩散 Transformer,潜动作经 MLP 投影后加到时间步嵌入、注入各 DiT block 的 AdaLN。
- RoPE:旋转位置编码,编码器里区分视角嵌入之外的时序/位置信息。
- 重参数化 :从高斯参数 ( μ , log σ ) (\mu,\log\sigma) (μ,logσ) 采样潜动作的标准 VAE 技巧。
- NMSE:归一化均方误差,线性探针评估潜动作能否线性恢复真实动作的指标,越低越好。
- 互信息估计器 KSG / BA / MINE:分别基于 k 近邻非参数、变分下界、Donsker--Varadhan 表示估计高维连续变量互信息,本文用三种交叉验证稳健性。
- context-parallel DiT:把长潜序列分片并行处理,使多视角带来的更长 token 序列不爆显存、扩展性良好。
- 相对动作空间:以每段潜视频首帧位姿为锚点、用位姿增量表示动作,平台无关,是人类潜动作迁移到机器人的对齐接口。
- Regret@1:仅按世界模型预测选最优策略后、相对真实最优的后悔值;本文 0.040,说明预测选型可信。
九、拓展思考:值得继续扩展研究与思考的创新点
- 把"泄漏诊断"当设计原则。本文最值钱的方法论不是三个设计本身,而是"先证明朴素做法为何失败、再针对失败原因设计"这一思路------多视角单独加为何掉点被精确定位为三条泄漏路径,每个设计各堵一条。这种"负结果驱动设计"可推广到任何"加数据/加模态反而失效"的场景:先做受控消融定位失效机制,再对症下药,而不是盲目堆组件。
- 非单射监督作为解耦的通用机制。深度只出现在解码端、编码器看不到------本质是用"编码器不可见的信息"逼潜变量编码真正的因果因子而非相关捷径。这比"加更多监督"更根本,可推广到法向、语义、可微物理量等任何"相关但非因果"的捷径场景,是一条相对独立的表示学习路线。
- 冻结基础模型当几何锚。VGGT 全程冻结、仅作对齐目标------这暗示一种范式:用强基础模型提供"免费几何先验",让下游轻量模型继承其跨视角一致性而不必重学,几乎零额外推理成本。值得系统研究"基础模型误差→下游潜表示"的传播链路与自适应门控(坏监督时自动降权)。
- 人类→机器人的平台无关桥。相对动作空间(相对首帧位姿增量)+ MLP 重注入,把异构动作空间对齐到一个平台无关的表示接口。这比强求"潜动作=真实动作"更现实,可启发跨 embodiment 的统一动作空间设计------潜动作不必与某平台控制量同构,只要可线性/微调对齐即可。
- 世界模型当免交互评估器 。 ρ = 0.952 \rho=0.952 ρ=0.952 的想象---真实相关、Regret@1=0.040,意味着纯离线训练的世界模型能当低成本策略评估器与在线选择器。若成立,"世界模型"就从"生成器"升级为"模型-based RL 的评估与决策中枢",对样本效率与安全探索意义重大------值得在更广任务上验证其因果保真度的边界:它学到的到底是决策相关动力学,还是恰好相关的视觉统计?
门控(坏监督时自动降权)。 - 人类→机器人的平台无关桥。相对动作空间(相对首帧位姿增量)+ MLP 重注入,把异构动作空间对齐到一个平台无关的表示接口。这比强求"潜动作=真实动作"更现实,可启发跨 embodiment 的统一动作空间设计------潜动作不必与某平台控制量同构,只要可线性/微调对齐即可。
- 世界模型当免交互评估器 。 ρ = 0.952 \rho=0.952 ρ=0.952 的想象---真实相关、Regret@1=0.040,意味着纯离线训练的世界模型能当低成本策略评估器与在线选择器。若成立,"世界模型"就从"生成器"升级为"模型-based RL 的评估与决策中枢",对样本效率与安全探索意义重大------值得在更广任务上验证其因果保真度的边界:它学到的到底是决策相关动力学,还是恰好相关的视觉统计?