结合代码读3DGS&世界模型论文(3)——3DGS & 世界模型新工作GaussianDream论文及代码解读

CVPR 2026 3DGS & 世界模型新工作GaussianDWM论文及代码解读

  • [一、论文简介 🌟](#一、论文简介 🌟)
    • [1.1 基本信息](#1.1 基本信息)
    • [1.2 论文引言 & 主要贡献](#1.2 论文引言 & 主要贡献)
    • [1.3 相关工作](#1.3 相关工作)
  • [二、方法论 🍀](#二、方法论 🍀)
    • [2.1 GaussianDream 概述(Overview of GaussianDream)](#2.1 GaussianDream 概述(Overview of GaussianDream))
    • [2.2 当前高斯重建(Current Gaussian Reconstruction)](#2.2 当前高斯重建(Current Gaussian Reconstruction))
    • [2.3 未来高斯预测(Future Gaussian Prediction)](#2.3 未来高斯预测(Future Gaussian Prediction))
    • [2.4 GaussianDream 训练与高效推理(GaussianDream Training and Efficient Inference)](#2.4 GaussianDream 训练与高效推理(GaussianDream Training and Efficient Inference))
    • [2.5 结论](#2.5 结论)
  • [三、论文实验部分 🧪](#三、论文实验部分 🧪)
    • [3.1 实施细节](#3.1 实施细节)
    • [3.2 主要实验结果(Main Results)](#3.2 主要实验结果(Main Results))
    • [3.3 消融研究( Ablation Study)](#3.3 消融研究( Ablation Study))
  • [四、论文代码解读 💻](#四、论文代码解读 💻)
  • 写在最后

写在前面:此博客为3DGS & 世界模型方向论文工作介绍(暂未开通新的GitHub仓库)。如果想了解此前关于3DGS的加速压缩新工作,可以关注笔者的Github仓库:Awesome-3DGS-Compress-Accelerate

一、论文简介 🌟

1.1 基本信息

  • 📖 题目:GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation
  • 🏫 单位: Tuojing Intelligence;University of Chinese Academy of Sciences;Institute of Automation, Chinese Academy of Sciences;Tsinghua University;Zhejiang University;Beihang University;Carnegie Mellon University;The University of Hong Kong
  • 🌍 主页:https://github.com/TuojingAI/GaussianDream
  • 🀄️ 论文摘要:视觉语言动作(VLA)策略通过将预训练视觉语言模型中的语义先验迁移到动作生成中,推动了语言条件下机器人操作的发展。然而,标准的动作模仿学习通常缺乏对显式三维空间信息、密集几何监督以及未来环境演化的充分建模,而这些因素对于精确的机器人交互都至关重要。为了解决这些问题,论文提出了 GaussianDream,一种前馈式三维高斯世界模型插件。具体而言,论文在编码器中引入了可学习的 GaussianDream 查询,使模型能够捕获当前帧的三维空间结构以及短期未来演化。在训练过程中,潜在的 GaussianDream 前缀分别经过静态重建头和未来预测头,用于生成当前三维高斯场景状态以及未来高斯演化状态。当前分支通过 RGB 渲染和深度进行监督,未来分支则使用未来 RGB、深度以及伪三维场景流信号进行监督。在推理过程中,GaussianDream 移除所有辅助头,仅保留学习到的前缀来条件化动作生成,无需在测试时进行高斯重建或未来预测。实验结果表明,GaussianDream 在多个机器人操作基准上取得了当前最优水平,在 LIBERO、RoboCasa Human-50 和真实机器人任务上分别达到 98.4%、54.8% 和 50.0% 的成功率。与现有三维增强型 VLA 方法相比,GaussianDream 在取得较高准确率的同时,相较于基于视频的世界模型还具有更高的推理效率。

    图1 操控策略范式比较。与二维策略、三维增强策略以及视频/潜在世界模型相比,GaussianDream采用当前高斯重建和未来高斯预测,从机器人视频中学习结构化的三维监督,同时保持高效的前缀式动作生成。

1.2 论文引言 & 主要贡献

  通用机器人操作是具身智能中的一项基础任务,其目标是使智能体能够与环境进行物理交互,从而完成语言指导下的目标。近年来,视觉语言动作(VLA)模型,例如 RT-2、OpenVLA、π0 和 π0.5,通过将预训练视觉语言模型中的语义先验直接迁移到物理控制环路中,显著推动了该领域的发展。这些架构利用视觉语言模型的先验知识来增强操作能力、指令遵循能力以及任务泛化能力。

  尽管标准 VLA 范式具有较强的指令遵循能力和语义泛化能力,但其训练过程在很大程度上仍由行为克隆主导,这限制了模型的进一步发展。现有架构的一个根本缺陷在于其空间信息和几何信息表达不足 。由于预训练视觉语言模型主要在二维像素网格上运行,三维空间结构和接触约束通常只能被隐式编码在视觉潜变量和动作标签中,因此控制环路容易受到细微几何执行误差的影响,例如抓取点发生偏移。此外,这种范式没有充分利用图像观测中蕴含的密集视觉和空间监督信号。机器人轨迹记录了关于物体布局、外观线索和深度结构的大量高维信息,而标准的动作模仿目标主要在每个时间步监督即时控制指令,导致丰富的像素级几何信号未能得到充分利用。因此,现有 VLA 策略通常只是通过动作标签隐式地学习环境动力学,而没有通过显式的内部环境模拟和未来状态监督来建模环境演化。尽管新兴的机器人世界模型已经证明,预测未来环境状态能够有效提升动作学习能力和策略鲁棒性,但标准 VLA 通常缺乏预测交互之后环境如何演化的显式机制。这限制了模型在不同且复杂的操作场景中的泛化能力,因为这些场景的执行结果往往取决于短期状态变化。

  为了解决上述局限,近期的先进方法大体可以分为两类,但这两类方法在高性能实时闭环控制方面仍然存在不足。

  第一类方法是三维增强型策略网络(3D-enhanced policy networks) ,尝试将显式几何结构注入 VLA 框架。然而,这些方法大多依赖点云或深度图等表示来静态地固定当前场景配置,对于动态未来环境模拟的支持仍然有限。第二类方法是新兴的机器人世界模型(robotic world models),通过在像素空间、潜空间或动作空间中预测未来状态来实现主动环境推理。尽管少数近期探索性工作尝试将三维高斯表示引入预测框架,但将此类世界模型无缝集成到主流 VLA 架构中仍然面临严重的结构和运行问题。由于这些生成式预测通常需要迭代式体素优化或计算量较大的视觉自回归展开,因此会在推理过程中引入显著的计算开销,难以部署在高频率机器人控制环路中。因此,如何在保持简洁、轻量级推理流程的同时,为可执行的 VLA 模型赋予统一的显式三维空间对齐、密集监督和未来预测能力,仍然是一个亟待解决的关键问题。

  为弥合这些差距,论文提出了 GaussianDream,一种专为语言条件机器人操作设计的统一前馈式三维高斯世界模型框架。GaussianDream 不在不受约束的隐空间中运行,也不依赖计算量较大的视频展开,而是在结构化的三维高斯空间中重建并预测物理环境状态,从而将预训练 VLA 的语义能力与三维表示的几何精度结合起来。具体而言,论文设计了一种非对称的训练与推理架构,将 GaussianDream 作为具有几何感知能力的插件。在训练过程中,轻量级的时空推理编码器通过可学习查询,从时间序列观测中提取具有三维感知能力的特征。随后,这些表示分别由两个相互解耦的辅助组件进行处理:用于当前场景重建的静态高斯头,以及用于未来几何变化预测的动态、时间跨度条件高斯头。整个流程通过密集的像素级 RGB 渲染、深度估计以及伪三维场景流监督进行端到端优化,将普通机器人轨迹转换为丰富的结构化学习信号。关键在于,在在线推理过程中,所有辅助解码头都会被移除。策略仅保留紧凑且信息丰富的 GaussianDream 前缀,用于条件化动作生成,从而无需在测试时进行高斯解码、几何渲染、视频展开或额外规划。论文在 LIBERO、RoboCasa Human-50 以及真实机器人任务上进行了广泛实验。结果表明,GaussianDream 取得了较强且具有竞争力的性能,并在多个对空间能力要求较高的设置中获得了最佳结果。同时,实验还显示,未来预测模拟与可执行控制指令之间具有紧密的时空对齐关系。

  论文的主要贡献如下:

  • 统一的三维高斯世界模型。论文提出了 GaussianDream,一种将语言条件 VLA 策略与结构化三维高斯表示相结合的前馈式框架。

  • 时空表示与密集监督。GaussianDream 通过统一设计解决了 VLA 中的三个关键瓶颈:显式三维空间对齐、来自机器人轨迹的像素级密集几何监督,以及短期预测式环境模拟。

  • 高效的非对称插件。GaussianDream 在训练阶段使用完整的三维重建和未来预测提供监督,而在部署阶段移除辅助解码组件,从而避免测试时的高斯解码、渲染、视频展开以及额外规划器。

  • 实证验证。论文在 LIBERO、RoboCasa Human-50 和真实机器人任务上进行了实验,结果显示 GaussianDream 具有较强且具有竞争力的性能;相关分析还验证了预测式环境模拟与动作生成之间的时空对齐关系。

  

1.3 相关工作

  视觉语言机器人策略(Vision-language robot policies.) 视觉语言动作(VLA)模型将预训练的视觉语言表示适配到机器人控制中,从而实现语言条件下的操作。RT-1 和 RT-2 展示了扩展机器人数据规模以及迁移视觉语言先验对于动作生成的益处。Octo、OpenVLA、π0 和 π0.5 进一步推动了开放词汇指令遵循、连续动作建模以及通用策略学习的发展。近期研究还从动作标记化、可部署性、语音条件、力感知和移动操作等方面对模型进行了改进。尽管这些模型具有较强的语义先验,但其监督信号仍主要由动作模仿构成,因此机器人视频中的密集时空证据只能通过视觉潜变量和动作标签被间接编码。GaussianDream 保留了 VLA 的动作接口,同时引入显式的三维高斯重建、密集几何监督以及未来高斯预测。

  三维增强型操作策略(3D-enhanced manipulation policies.) 越来越多的研究通过注入显式几何信息来改进机器人策略。GeoVLA、StereoVLA、VLA-4D、SwiftVLA、BridgeVLA 和 Any3D-VLA 分别引入深度信息、立体视觉线索、四维特征、点云或投影式三维表示。QDepth-VLA、Spatial Forcing、GeoAware-VLA 和 VGA 则进一步探索了深度监督、几何正则化以及以几何为中心的骨干网络。这些方法表明,显式几何信息有助于定位、空间推理以及具有物理约束的控制。然而,大多数方法只是利用几何信息固定当前场景,而没有对交互之后的状态演化进行明确建模。GeoPredict 通过未来关键点轨迹和深度监督下的高斯预测,向预测式几何建模迈进了一步。GaussianDream 则将当前场景重建与基于时间跨度条件的未来预测统一为一个训练阶段的插件,把机器人轨迹转换为密集的 RGB、深度以及伪三维场景流监督信号。

  机器人操作中的世界模型(World models for robotic manipulation.) 世界模型和世界动作模型通过预测未来状态来学习比单步行为克隆更丰富的时间结构。DreamZero、Cosmos Policy、LingBot-VA、Motus、WorldVLA 和 Fast-WAM 分别预测未来观测、动作、价值、潜在状态,或其中的组合,以提升长时域控制能力和泛化能力。许多此类方法在 RGB 像素、视频潜变量或动作空间中建模未来,因此预测状态没有被显式组织为可执行的三维几何结构;此外,自回归式或基于扩散的展开也可能增加推理成本。近期研究还探索了将高斯表示用于操作或预测式几何建模,包括 ManiGaussian、GWM 和 GeoPredict。相比之下,GaussianDream 直接在结构化三维高斯空间中学习未来预测,并在推理阶段移除辅助解码头,仅保留紧凑的前缀用于动作生成。

  

二、方法论 🍀

2.1 GaussianDream 概述(Overview of GaussianDream)

图 2 GaussianDream 概览。训练期间,时间序列视觉特征和可学习的 GaussianDream 查询生成一个紧凑的前缀,该前缀被解码为当前和未来的三维高斯状态,用于 RGB、深度以及伪三维场景流监督。推理期间,所有辅助高斯解码头都会被移除,仅使用该前缀来条件化动作生成。

  令 o t o_t ot 表示当前的多视角观测, o t − K : t o_{t-K:t} ot−K:t 表示短期历史观测, l l l 表示语言指令, s t s_t st 表示机器人状态。GaussianDream 保留基础连续动作策略的动作接口,同时通过学习到的前缀标记 Z t G D Z_t^{GD} ZtGD 扩展其多模态上下文。在实际使用中,GaussianDream 前缀由机器人视角的时间序列观测构建而成,该观测序列为三维重建和未来预测提供一致的空间上下文。该前缀由一个具有时间建模能力的三维感知编码器生成:

Z t G D = F ω ( o t − K : t , Q G D ) , (1) Z_t^{GD}=F_\omega(o_{t-K:t},Q^{GD}),\tag{1} ZtGD=Fω(ot−K:t,QGD),(1)

  其中, Q G D Q^{GD} QGD 表示可学习的 GaussianDream 查询, F ω F_\omega Fω 表示第 2.3 节中的时间高斯演化(Temporal Gaussian Evolution,TGE)模块。图像、语言和 GaussianDream 标记共享 2048 维的 PaliGemma/Gemma-2B 前缀空间,而动作专家使用 1024 维的隐藏空间。论文使用三个上下文帧 { t − 10 , t − 5 , t } \{t-10,t-5,t\} {t−10,t−5,t},以提供稀疏的运动线索。

  在训练过程中,同一个前缀由两个辅助高斯头进行解码:

G t = R ϕ ( Z t G D , o t ) , G ^ t + Δ = D ψ ( G t , Z t G D , Δ ) . (2) G_t=R_\phi(Z_t^{GD},o_t),\qquad \hat{G}{t+\Delta}=D\psi(G_t,Z_t^{GD},\Delta).\tag{2} Gt=Rϕ(ZtGD,ot),G^t+Δ=Dψ(Gt,ZtGD,Δ).(2)

  其中, R ϕ R_\phi Rϕ 将前缀映射为可渲染的当前高斯状态 G t G_t Gt,而 D ψ D_\psi Dψ 预测带有时间跨度条件的未来高斯变化。上述解码器仅作为训练阶段的监督接口。策略根据原始多模态输入和 GaussianDream 前缀生成动作:

a t = π θ ( o t , l , s t ; Z t G D ) . (3) a_t=\pi_\theta(o_t,l,s_t;Z_t^{GD}).\tag{3} at=πθ(ot,l,st;ZtGD).(3)

  因此,GaussianDream 将重建监督和预测监督迁移到推理阶段使用的前缀中,而不是用测试阶段的模拟器取代策略。

  

2.2 当前高斯重建(Current Gaussian Reconstruction)

  当前重建分支要求 GaussianDream 前缀表示一个可渲染的三维场景状态,从而提供显式的三维空间对齐。学习到的前缀 Z t G D Z_t^{GD} ZtGD 充当紧凑的三维高斯潜在表示,同时捕获当前场景几何结构和短期交互动力学。其时间演化能力将在第 2.3 节中进一步建模。

  论文将 1024 个 GaussianDream 标记重塑为具有空间组织结构的 32 × 32 32\times32 32×32 潜在网格,使前缀能够保留空间局部性和密集几何结构。随后,高斯解码器对该潜在网格进行上采样,生成密集特征图:

F t G = B G r i d G ( Z t G D ) , F t G ∈ R 256 × 256 × 128 . (4) F_t^G=B^G_{\mathrm{Grid}}\left(Z_t^{GD}\right), \qquad F_t^G\in\mathbb{R}^{256\times256\times128}.\tag{4} FtG=BGridG(ZtGD),FtG∈R256×256×128.(4)

  其中, 256 × 256 256\times256 256×256 的空间分辨率对应于密集高斯布局预测,128 维特征通道则编码用于后续高斯属性估计的共享几何和外观信息。

  随后,论文使用轻量级预测头构建当前高斯场景状态。几何头预测深度、旋转、尺度和不透明度;外观头则以当前 RGB 观测 o t o_t ot 为条件,估计一阶球谐函数系数:

D t , Θ t g e o = H g e o ( F t G ) , Θ t a p p = H a p p ( F t G , o t ) . (5) D_t,\Theta_t^{geo}=H^{geo}(F_t^G), \qquad \Theta_t^{app}=H^{app}(F_t^G,o_t).\tag{5} Dt,Θtgeo=Hgeo(FtG),Θtapp=Happ(FtG,ot).(5)

  论文利用 D t D_t Dt 将表示反投影为高斯中心 μ i t \mu_i^t μit,并预测相应的高斯属性 θ i t \theta_i^t θit:

G t = A ( D t , Θ t ) = { ( μ i t , θ i t ) } i = 1 N t , (6) G_t=A(D_t,\Theta_t) =\left\{(\mu_i^t,\theta_i^t)\right\}_{i=1}^{N_t},\tag{6} Gt=A(Dt,Θt)={(μit,θit)}i=1Nt,(6)

  其中, Θ t = ( Θ t g e o , Θ t a p p ) \Theta_t=(\Theta_t^{geo},\Theta_t^{app}) Θt=(Θtgeo,Θtapp),且 N t = 256 × 256 N_t=256\times256 Nt=256×256。

  重建得到的高斯场景随后被渲染,用于 RGB 和深度监督。通过要求前缀重建显式的三维几何结构,该分支向策略表示中注入密集的空间结构,同时为未来演化预测提供静态高斯模板。

  

2.3 未来高斯预测(Future Gaussian Prediction)

  当前重建规定了时间 t t t 的场景状态,但无法监督场景在交互之后如何演化。为了从机器人视频中提取密集的时间结构,GaussianDream 在结构化三维空间中预测短期高斯演化。

  给定 o t − K : t o_{t-K:t} ot−K:t,论文利用 VGGT 提取多尺度的三维感知图像块特征。由于 VGGT 通过全局帧注意力学习到了较强的静态三维先验,但对于时间交互动力学的监督相对较弱,因此论文引入可学习的 GaussianDream 查询,在对空间几何进行聚合的同时,对跨时间的未来演化进行建模。对于每个上下文帧,论文将 VGGT 特征池化为 32 × 32 32\times32 32×32 网格,并将其投影为时间标记:

P t − K : t ( m ) = W m P 32 × 32 ( E V G G T ( m ) ( o t − K : t ) ) , (7) P_{t-K:t}^{(m)}=W^mP_{32\times32} \left( E_{\mathrm{VGGT}}^{(m)}(o_{t-K:t}) \right),\tag{7} Pt−K:t(m)=WmP32×32(EVGGT(m)(ot−K:t)),(7)

  其中, m m m表示特征尺度。

  时间高斯演化(TGE)模块使时间标记与可学习的 GaussianDream 查询进行交互。首先,将 2048 维查询投影到 512 维时间空间中;随后,查询与来自多帧的 VGGT 特征进行融合;最后,再将其投影回前缀空间。TGE 包含 12 个注意力模块和 8 个注意力头,并交替执行逐帧空间交互和时间槽时间注意力,从而联合捕获当前三维结构与未来几何演化。当前时间步的输出被用作 GaussianDream 前缀:

Z t G D = Proj ⁡ 512 → 2048 TGE ⁡ ( Proj ⁡ 2048 → 512 ( Q G D ) , { P t − K : t ( m ) } m = 1 M ) t . (8) Z_t^{GD}=\operatorname{Proj}_{512\rightarrow2048} \left \\operatorname{TGE} \\left( \\operatorname{Proj}_{2048\\rightarrow512}(Q\^{GD}), \\left\\{P_{t-K:t}\^{(m)}\\right\\}_{m=1}\^{M} \\right)_t \\right.\tag{8} ZtGD=Proj512→2048TGE(Proj2048→512(QGD),{Pt−K:t(m)}m=1M)t.(8)

  给定当前高斯状态 G t = { ( μ i t , θ i t ) } i = 1 N t G_t=\left\{(\mu_i^t,\theta_i^t)\right\}_{i=1}^{N_t} Gt={(μit,θit)}i=1Nt,动态头预测带有时间跨度条件的中心位移:

ν t ( Δ ) = H v e l ( B p r e d ( Z t G D ) , e Δ ) , Δ X t ( Δ ) = α Δ ν t ( Δ ) , μ ^ t + Δ , i = μ t , i + Δ x i ( Δ ) , G ^ t + Δ = { ( μ ^ t + Δ , i , θ t , i ) } i = 1 N t . (9) \nu_t^{(\Delta)}=H_{\mathrm{vel}} \left( B_{\mathrm{pred}}(Z_t^{GD}),e_\Delta \right), \Delta X_t^{(\Delta)}=\alpha_\Delta\nu_t^{(\Delta)}, \\ \hat{\mu}{t+\Delta,i}=\mu{t,i}+\Delta x_{i}^{(\Delta)}, \hat{G}{t+\Delta}=\left\{\left(\hat{\mu}{t+\Delta,i},\theta_{t,i}\right)\right\}_{i=1}^{N_t}.\tag{9} νt(Δ)=Hvel(Bpred(ZtGD),eΔ),ΔXt(Δ)=αΔνt(Δ),μ^t+Δ,i=μt,i+Δxi(Δ),G^t+Δ={(μ^t+Δ,i,θt,i)}i=1Nt.(9)

  其中, e Δ e_\Delta eΔ 是可学习的时间跨度嵌入, α Δ \alpha_\Delta αΔ 是时间尺度因子。由于机器人交互通常表现出非均匀的运动模式和随时间变化的不确定性,时间跨度嵌入 e Δ e_\Delta eΔ 使模型能够区分不同预测时间跨度下的动态模式。未来状态复用非位置属性 θ t i \theta_t^i θti,重点预测由交互引起的几何变化,同时保留当前高斯模板。论文对从 t + 1 t+1 t+1 到 t + 5 t+5 t+5 的时间跨度进行监督。

  

2.4 GaussianDream 训练与高效推理(GaussianDream Training and Efficient Inference)

  GaussianDream 采用非对称策略:密集的高斯重建和预测用于监督训练,而在线控制阶段只保留紧凑的前缀。

  阶段一:GaussianDream 预训练(Stage I: GaussianDream pretraining. ) 论文首先在不进行动作学习的情况下训练重建头和预测头。对于每条示范序列,RGB 帧与伪深度以及根据相邻帧构建的伪三维场景流目标进行配对。GaussianDream 的目标函数结合了当前重建和未来预测:

L G D = λ c u r d e p t h L c u r d e p t h + λ c u r r e n d e r L c u r r e n d e r + ∑ Δ ∈ H w Δ ( λ d e p t h L Δ d e p t h + λ r e n d e r L Δ r e n d e r + λ f l o w L Δ f l o w ) . ( 10 ) \mathcal{L}{GD}= \lambda{\mathrm{cur}}^{\mathrm{depth}} \mathcal{L}{\mathrm{cur}}^{\mathrm{depth}} + \lambda{\mathrm{cur}}^{\mathrm{render}} \mathcal{L}{\mathrm{cur}}^{\mathrm{render}} + \sum{\Delta\in\mathcal{H}} w_\Delta \left( \lambda^{\mathrm{depth}} \mathcal{L}{\Delta}^{\mathrm{depth}} + \lambda^{\mathrm{render}} \mathcal{L}{\Delta}^{\mathrm{render}} + \lambda^{\mathrm{flow}} \mathcal{L}_{\Delta}^{\mathrm{flow}} \right). \quad{(10)} LGD=λcurdepthLcurdepth+λcurrenderLcurrender+Δ∈H∑wΔ(λdepthLΔdepth+λrenderLΔrender+λflowLΔflow).(10)

  深度损失和渲染损失监督当前高斯渲染结果以及未来高斯渲染结果;场景流损失则在有效性掩码下,使预测的中心位移与伪三维场景流保持一致。该阶段将机器人视频转换为密集的时空监督信号,而不是仅将其作为带有动作标签的轨迹使用。为了实现稳定优化,预测时间跨度会逐步扩展。

  阶段二:GaussianDream 条件策略学习(GaussianDream-conditioned policy learning. ) 预训练完成后,论文使用辅助高斯损失联合训练策略,以保持前缀的时空结构。令 c t = ( o t , l , s t ; Z t G D ) c_t=(o_t,l,s_t;Z_t^{GD}) ct=(ot,l,st;ZtGD),动作损失为:

L a c t = E τ , ϵ , a t ∗ ∥ v θ ( τ ϵ + ( 1 − τ ) a t ∗ , c t , τ ) − ( ϵ − a t ∗ ) ∥ 2 2 . (11) \mathcal{L}{act}= \mathbb{E}{\tau,\epsilon,a_t^*} \left \\left\\\| v_\\theta \\left(\\tau\\epsilon+(1-\\tau)a_t\^\*, c_t,\\tau \\right) - (\\epsilon-a_t\^\*) \\right\\\|_2\^2 \\right. \tag{11} Lact=Eτ,ϵ,at∗∥vθ(τϵ+(1−τ)at∗,ct,τ)−(ϵ−at∗)∥22.(11)

  其中, ϵ ∼ N ( 0 , I ) \epsilon\sim\mathcal{N}(0,I) ϵ∼N(0,I), τ \tau τ从流匹配时间分布中采样。论文联合优化以下目标: L = L a c t + λ G D L G D \mathcal{L}=\mathcal{L}{act}+\lambda{GD}\mathcal{L}_{GD} L=Lact+λGDLGD。动作损失使前缀适应可执行控制,而辅助高斯损失则保持其时空结构。

  推理(Inference.) 在测试阶段,GaussianDream 将时间缓冲区编码为前缀标记,并将其注入策略上下文中。所有渲染、深度、速度以及高斯解码头都会被移除。基础策略使用标准去噪过程采样动作,不进行未来展开、测试时渲染、高斯解码或额外规划。因此,GaussianDream 在保留训练阶段三维监督的同时,维持了轻量级的在线控制流程。

  

2.5 结论

  

  

三、论文实验部分 🧪

3.1 实施细节

  论文在仿真和真实世界机器人操作环境中评估 GaussianDream。实验考察以下四个问题:与强大的 VLA、三维增强型方法和世界模型基线相比,GaussianDream 是否能够提升空间精确的操作性能;所学习的前缀是否能够迁移到物理执行中;当前重建和未来预测是否具有互补作用;以及渲染损失和深度损失是否能够提供有用的密集监督。

  仿真基准 论文在 LIBERO 和 RoboCasa 上进行评估。对于 LIBERO,论文遵循 Spatial、Object、Goal 和 Long 四种评测协议,每项任务使用 50 条示范轨迹和 50 次评估试验。对于 RoboCasa,论文在 Human-50 少样本设置下进行实验,涵盖 24 个长时域厨房任务,每项任务在 5 个场景中进行 50 次试验。上述基准共同覆盖空间推理、物体定位、目标条件操作以及长时域家庭任务。

  真实机器人评估 论文在真实机器人上将 GaussianDream 与基础的 π 0.5 \pi_{0.5} π0.5策略进行比较。如图 3 所示,评测任务涵盖属性定位、空间关系、堆叠与拆分,以及长时域执行。这些场景用于评估 GaussianDream 前缀在摄像机噪声、实体差异和物理执行误差下是否仍然有效。

图 3 覆盖属性定位、空间关系、堆叠与拆分以及长时域执行的真实机器人任务。

  

3.2 主要实验结果(Main Results)

  LIBERO GaussianDream 在 LIBERO 上取得了较强的性能,尤其是在空间定位和目标条件执行方面。表 1 显示,GaussianDream 的平均成功率达到 98.4%,并在 Spatial 和 Goal 评测中取得最高分。为保证实现的一致性,论文报告了 Spatial Forcing 的 PyTorch 实现结果。GaussianDream 的性能超过了多种三维增强型策略,包括 GeoVLA、VLA-4D、3D-CAVLA、QDepth-VLA 和 Spatial Forcing。LingBot-VA 获得了最高的平均分,但其控制过程使用了更大的自回归视频动作流程;相比之下,GaussianDream 仅将预测用作训练阶段的监督,并保持基于前缀的推理方式。

  RoboCasa GaussianDream 在 RoboCasa 中空间精度要求较高的抓取与放置任务上展现出最明显的优势。如表 2 所示,GaussianDream 达到 54.8%的最高平均成功率,并在抓取与放置任务上取得最强性能。这表明,重建和预测能够提升对定位敏感的机器人操作能力。尽管 GeoPredict 在门和抽屉任务以及其他任务上领先,GaussianDream 仍然超过 Being-H0.5,并取得最高的平均成绩。

  真实机器人 GaussianDream 同样改善了物理执行性能。在所有场景组中,GaussianDream 都取得了提升。如表 3 所示,GaussianDream 将基础 π 0.5 \pi_{0.5} π0.5策略的平均成功率从 34.4%提高到 50.0%,在各类场景中均获得了性能增益。其中,空间关系和长时域场景的提升最为明显,这表明 GaussianDream 前缀为动作生成提供了额外的几何上下文。

  定性分析 定性结果进一步验证了 GaussianDream 的核心设计:当前重建提供显式的空间定位能力,而未来预测捕获短期几何演化。图 4 展示了当前重建和未来预测的深度渲染结果。重建结果保留了当前帧中准确的物体布局,而预测的未来状态在连续步骤之间保持了时间一致性。此外,可视化结果还表明,GaussianDream 能够有效地建模物体交互和协调运动。这些观察结果说明,GaussianDream 能够从连续的观测帧中学习结构化的时空表示。

  

3.3 消融研究( Ablation Study)

  组件分析 消融实验确认,GaussianDream 同时受益于当前重建和未来预测。如表 4 所示,仅使用当前重建时,模型达到 97.0%的性能,表明将观测重建为高斯状态能够提供较强的空间先验。加入未来预测后,性能提升至 97.5%,说明短期状态变化监督能够在当前帧定位之外带来额外收益。这支持了以下设计:静态头构建空间模板,动态头学习由交互引起的状态变化。

  监督分析 渲染损失和深度损失提供了互补的密集监督。加入渲染损失后,仅使用重建的模型性能从 97.0%提升至 97.3%,表明图像级一致性有助于使预测的高斯表示与观测结果对齐。当保留未来预测和渲染损失、但移除深度损失时,性能下降至 97.2%,说明仅依靠 RGB 一致性无法充分约束度量几何结构。完整模型达到 98.4%,验证了重建、预测、渲染和深度监督所发挥的互补作用。

  高级世界知识(High-level World Knowledge) 与其他世界模型和场景生成框架相比,论文设计了一种能够在不同层级控制场景生成的双条件引导框架。该部分的消融结果如表4所示。可以观察到,论文方法在长序列预测和大视角变化条件下表现更好,这证明了引入世界知识的有效性。

  

四、论文代码解读 💻

  待补充。

  

写在最后

  由于笔者🖊️精力有限且本文更多的目的是通过📒博客记录学习过程并分享更多知识,因此文中部分描述不太具体,如有不太理解💫的地方可在评论区👀留言。非特殊赶deadline⏰或假期⛱️期间,笔者会经常上线回复💬。如有不便之处,请海涵~

  如果想了解更多关于3DGS的加速⏰压缩⚡️新工作,可以关注笔者的Github仓库:Awesome-3DGS-Compress-Accelerate

  另外,创造不易,转载请注明出处💗💗💗~

相关推荐
lilian23320 小时前
HarmonyOS 7 新特性(十三)|3DGS 模型加载、交互与性能回退
3d·交互·harmonyos
DolitD1 天前
云流技术深度剖析:单服务器下如何实现3D应用的多实例并发?
java·服务器·前端·3d·云原生·云计算
Liudef061 天前
腾讯混元Hunyuan3D-Part:重新定义3D部件生成的革命性架构
人工智能·3d·架构·腾讯混元hunyuan3d
2601_967659892 天前
大学实训室网络仿真环境搭建:Ranplan 3D射线跟踪双版本技术解析
网络·3d
七77.2 天前
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation
3d·agent·世界模型
rockingdingo3 天前
Codex Claude 智能体做3D/潮玩/IP设计——装上Craftsman Agent工匠智能体Skills 游泳男孩IP案例分享
网络协议·tcp/ip·3d
3D可视化大侠3 天前
数字孪生时空数据可视化:CIMPro 孪大师中的轨迹与粒子实现
3d·信息可视化
LONGZETECH3 天前
新能源汽车动力电池实训教学痛点与虚拟仿真技术解决方案
c语言·3d·unity·架构·汽车·汽车教学软件
爱分享的康康3 天前
从“识别已知”到“发现未知”:3D通用目标检测如何打开智驾感知新边界
人工智能·目标检测·3d