【世界模型】MotionForesight:视频模型应用于未来的三维场景流预测


标题: Re-purposing Video Models for Future 3D Scene-Flow Prediction

约翰霍普金斯大学计算机科学系

motionforesight.github.io

目录

摘要

  人类能够通过被动观察推断物体可能如何运动:例如,杯子可能会被提起、抽屉可能会滑动、盖子可能会旋转关闭。此类预测揭示了在现实世界中行动所需的交互物理效应。我们研究如何从人类与物体的普通单目视频中学习这种预期能力。

  给定一段短时观测视频上下文,MotionForesight可预测被操控物体上各点的未来三维轨迹 。这将交互预测问题转化为一个以物体为中心的三维运动预测任务,且无需对物体属性作任何假设。我们的核心见解在于:视频预测模型已编码了关于人类交互过程中物体运动方式的丰富先验知识。我们将这些先验信息从像素级预测转向未来的三维场景流预测。我们基于一个预训练的视频模型构建的密集三维跟踪器,从完整视频片段中生成伪真实轨迹,并仅利用观测帧训练预测器 。未来的RGB图像和几何信息替换为学习到的mask latent,并训练一个轻量级适配器,将回顾性跟踪表示转换为前向预测器,同时冻结大型视频处理模块和跟踪模块。仅需使用4万段人类视频且无需语言等辅助输入,MotionForesight便能泛化至多种分布外的物体、环境、视角及交互场景。其性能亦显著优于那些使用超过百万段训练视频的更大规模模型。这些结果表明,我们可以高效地将视频先验信息重新利用为具身智能所需的显式几何预测。

图2:MotionForesight能够从被动采集的人体视频中预测未来的参考锚定3D轨迹。给定观测到的RGB帧 以及通过单目深度估计获得的pointmap ,在前 T 1 T_1 T1帧内,该模型可对接下来的 T 2 T_2 T2步未来期间被操纵物体的运动进行预测。其输出一个覆盖被操纵物体上各点的显式3D轨迹场,且无需依赖刚体或类别特定的运动参数化方法。

  

一、相关工作

  1. 视觉预测与世界模型

  构建关于视觉世界演变过程的模型,长期以来一直是计算机视觉与机器人领域的核心问题。先前的研究致力于预测未来的像素或潜在状态,以支持规划、控制及表征学习 13--16;而较新的研究方法则通过视频扩散、预测性视觉表征以及学习型潜行动作模型17--23 等手段扩展了这一思路。这些方法能够捕捉到有效的时序规律,但其预测结果通常以RGB帧、视频特征或受动作影响的潜态表示,且未包含显式的物体级几何信息。本研究基于视频模型所学习的时序先验知识,但在输出表征方面有所创新:MotionForesight并非生成未来的像素或抽象特征,而是预测被操纵物体上各点未来的度量三维运动。

17.Gen2Act: Human video generation in novel scenarios enables generalizable robot manipulation
18.Video prediction policy: A generalist robot policy with predictive visual representations
19.Video generators are robot policies
20.Learning latent action world models in the wild
21.V-JEPA 2: Self-supervised video models enable understanding, prediction and planning
22.Dream to control: Learning behaviors by latent imagination
23.Contrastive learning of structured world models

  1. 从人类视频中推断交互线索

  诸如Something-Something24、YouCook25、EPIC-Kitchens26、 EGTEA 27和Ego4D28等大规模数据集 ,使得模型能够直接从视频中 学习人与物体的交互先验知识。其中,有一类研究致力于预测未来的动作标签、活跃物体、接触区域、手部轨迹及交互热点 29--36;另一类研究则利用大规模活动与接触观测数据来学习人类与物体的交互方式 37,38;更近期的方法则可预测受语言或上下文条件影响的手部轨迹 39,40,而机器人学习方法则能预测二维点轨迹、掩膜或视觉标记------这些结果可作为与具身性无关的规划方案8,9,41。这些方法均能从人类视频中提取可执行的交互线索,但其预测结果大多仍停留在语义层面、以手部为中心或与图像平面相关。相比之下,MotionForesight则能预测场景中各点的连续三维轨迹,直接表征交互行为产生的物理效应,无需依赖语言/动作标签。

24 The "Something Something" video database for learning and evaluating visual common sense.
25 A thousand frames in just a few words: Lingual description of videos through latent topics and sparse object stitching.
26 Scaling egocentric vision: The EPIC-KITCHENS dataset.
27 In the eye of beholder: Joint learning of gaze and actions in first person video.
28 Ego4D: Around the world in 3,000 hours of egocentric video.
29 Forecasting human-object interaction: Joint prediction of motor attention and actions in first person video.
30 Human--object interaction prediction in videos through gaze following.
31 ContactGrasp: Functional multi-finger grasp synthesis from contact.
32 Human hands as probes for interactive object understanding.
33 Joint hand motion and interaction hotspots prediction from egocentric videos.
34 Where2Act: From pixels to actions for articulated 3d objects.
35 Newtonian image understanding: Unfolding the dynamics of objects in static images.
36 Grounded human-object interaction hotspots from video.
37 Understanding human hands in contact at internet scale.
38 Guide to the carnegie mellon university multimodal activity database.

  1. 三维几何提取与预测(显式)

  早期方法可 基于视觉观测估计三维手部与物体的位姿42--46,或从RGB及RGB-D输入中 恢复6自由度物体位姿47--50;近期系统则提供了视频分割与单张图像三维重建的互补工具 :SAM 251可在视频序列中传播掩膜,而trellis52与SAM 3D53则能从图像中重建三维几何结构;在自动驾驶与移动机器人领域,未来几何预测的研究亦聚焦于 LiDAR、点云及智能体轨迹预测方向54--56;在操作任务方面,相关方法可预测受语言条件约束的6自由度轨迹6、将人类轨迹迁移至机器人实体57,或在语言指令、目标设定、RGB-D数据或机器人动作等条件影响下预测物体位姿、点运动及场景流 7,58,59;与之相对,MotionForesight能够从单目RGB视频中预测密集且参考锚定的稠密三维轨迹,使得同一表示形式可描述刚性、关节型及可变形运动54--56;与本研究同期,MolmoMotion 同样预测了密切相关的目标------未来度量型三维轨迹,但其创新之处在于:基于短时长RGB历史记录与意图动作的语言描述,构建了目标条件化的预测框架,并仅需预测物体上8个点的运动轨迹 5。该模型基于MolmoMotion-1M数据集进行训练------这是一个基于动作描述且基于物体的语料库,由116万段多样化的视频构建而成;而MotionForesight则基于4万段单目SSv2人机交互视频进行训练,且未接收任何语言或动作输入。因此,这两项研究虽均采用点轨迹输出表示,但所采用的监督机制截然不同:前者是从广泛的视频语料库中获取基于语言的意图以实现稀疏点预测,而后者则是通过观察到的人机交互行为来实现对密集3D流的被动视觉预判。

  1. 场景流与点跟踪:基础运动表征

  经典的及基于学习的场景流方法可估计观测帧之间的稠密三维运动;而近期的跟踪器则通过相机运动、遮挡以及非刚性形变来恢复长距离对应关系11,60--65。这些方法主要采用回顾式策略:即在观察到相关帧后,再估算各点的移动位置。我们利用这一能力,既可用于构建伪真实标注监督信号,也可用于定义模型的输出接口。随后,我们将回顾式跟踪转化为预测任务------通过隐藏未来的观测数据,并要求经过跟踪优化的视频骨干网络预测参考帧中物体点将在哪些帧可用前发生何种移动。

输入 :观察到的前 T 1 T_1 T1 帧 RGB 视频前缀 I 0 : T 1 − 1 I_{0:T_1-1} I0:T1−1。

输出 :在参考帧 a = 0 a=0 a=0 中采样的物体查询点集 Q \mathcal{Q} Q,在未来 T 2 T_2 T2 个时间步的 3D 位置。

坐标系表征 :运动轨迹与点云转换并统一表达在最后一次观测到的相机坐标系 ( t = T 1 − 1 t = T_1 - 1 t=T1−1)下,以消除相机本身运动带来的视运动干扰。

默认设置 : T 1 = 7 T_1 = 7 T1=7(观察帧数), T 2 = 15 T_2 = 15 T2=15(预测未来帧数),总序列长度 T = 22 T = 22 T=22。

  

二、数据准备:从 RGB 视频到 3D 伪标签

  由于普通的单目人机交互视频缺乏 3D 轨迹真值,模型利用离线 Pipeline 自动构建 3D 轨迹伪标签(Pseudo-Ground-Truth Targets):

  • 分割与追踪: 在关键帧(Anchor Frame)使用 SAM 初始化物体掩码,前后传播获取完整 Mask。
  • 三维重建 : 使用单目深度估计(DepthAnything3)结合相机姿态估算,构建时间对齐的 3D 点图(Pointmap) P t P_t Pt。
  • 轨迹提取 : 运行 3D 追踪模型(TrackCraft3R)获得整个 Video Clip 内物体采样点 q q q 的 3D 轨迹,并统一变换到最后观察帧的相机坐标系下,记为真值轨迹 X t ( q ) X_t(q) Xt(q)。

💡 核心思想: 完整视频 Clip 仅用于生成伪标签;训练和推理时严格对模型遮蔽未来帧的信息。

  

三、观察帧的视觉与几何上下文 (Observed Visual-Geometry Context)

  对于输入的观察帧 ( t < T 1 t < T_1 t<T1),将外观与几何信息相结合,拼接生成视觉-几何隐变量(Visual-Geometry Latent) c t c_t ct: c t = E rgb ( I t ) ; E pm ( P t ) , t < T 1 c_t = \left E\^{\\text{rgb}}(I_t) ; E\^{\\text{pm}}(P_t) \\right, \quad t < T_1 ct=Ergb(It);Epm(Pt),t<T1

I t , P t I_t, P_t It,Pt 分别为 t t t 时刻的 RGB 图像与 3D 点图; E rgb , E pm E^{\text{rgb}}, E^{\text{pm}} Ergb,Epm 分别为 RGB 和 Pointmap 的 VAE 编码器。互补: RGB 捕获外观、接触与交互动作细节;Pointmap 提供三维度量结构与已知运动

  

图3:架构。保留了TrackCraft3R 的双潜在结构:观测帧 可生成标准的RGB与pointmap几何latent;未来的几何槽位则由学习得到的 mask latent 填充;帧0的轨迹/query latent 会在所有时间戳上重复使用,而时序RoPE机制则用于分配目标未来时间点;一个经过冻结处理的视频DiT网络结合小型新LoRA微调模块,可预测未来的残差轨迹潜在变量,随后由冻结的轨迹解码器将这些潜在变量转换为未来的跟踪点地图。

四、未来的掩码表示与查询表达 (Masked Future and Query Representation)

  对于需要预测的未来帧:

1.未来帧 ( t ≥ T 1 t \ge T_1 t≥T1)几何遮蔽 : 未来的视觉-几何隐变量使用 可学习的掩码隐变量(Learned Mask Latent) c mask c_{\text{mask}} cmask 来占位

2.查询表达 (Query Sequence): 将参考帧(如 t = 0 t=0 t=0)提取的点查询/追踪隐变量 z track ( 0 ) z_{\text{track}}^{(0)} ztrack(0) 在时间维度上重复广播到所有帧 t t t,赋予模型要预测"哪个物体点"的指导。

3.结合 Temporal RoPE : 引入时间旋转位置编码(Temporal RoPE),向模型明确指示目标预测的具体未来时间点 t t t。

  

五、Diffusion Transformer 预测器

1.参数效率 : 冻结预训练视频 DiT 的大部分权重,仅插入轻量级的 LoRA 模块进行训练。

2.解码 : DiT 输出未来的Residual-Track Latents,送入冻结的追踪解码器 D track D_{\text{track}} Dtrack,解码恢复出预测的 3D 轨迹/点图 X ^ t ( q ) \hat{X}t(q) X^t(q): X ^ t ( q ) = D track ( z predict , q ) \hat{X}t(q) = D{\text{track}}(z{\text{predict}}, q) X^t(q)=Dtrack(zpredict,q)

六、预测监督与损失函数 (Forecasting Supervision and Objective)

  为了同时兼容密集点图 (Dense Pointmaps)与稀疏追踪点 (Sparse Tracked Points),模型提出了统一的 Query-Point 接口,并引入有效性掩码 v t q ∈ { 0 , 1 } v_{tq} \in \{0, 1\} vtq∈{0,1} 表示点 q q q 在 t t t 时刻是否有有效监督。

  坐标空间解码损失 (Decoded Coordinate-Space Loss):直接在解码后的坐标空间上计算,划分为 历史观察帧重构未来运动预测 两部分: L dec = λ obs ∑ t < T 1 ∑ q v t q ∥ X ^ t ( q ) − X t ( q ) ∥ 2 2 ∑ t < T 1 ∑ q v t q + ϵ + λ fut ∑ t ≥ T 1 ∑ q v t q ∥ X ^ t ( q ) − X t ( q ) ∥ 2 2 ∑ t ≥ T 1 ∑ q v t q + ϵ \mathcal{L}{\text{dec}} = \lambda{\text{obs}} \frac{\sum_{t < T_1} \sum_q v_{tq} \left\Vert{} \hat{X}t(q) - X_t(q) \right\Vert{}2^2}{\sum{t < T_1} \sum_q v{tq} + \epsilon} + \lambda_{\text{fut}} \frac{\sum_{t \ge T_1} \sum_q v_{tq} \left\Vert{} \hat{X}t(q) - X_t(q) \right\Vert{}2^2}{\sum{t \ge T_1} \sum_q v{tq} + \epsilon} Ldec=λobs∑t<T1∑qvtq+ϵ∑t<T1∑qvtq X^t(q)−Xt(q) 22+λfut∑t≥T1∑qvtq+ϵ∑t≥T1∑qvtq X^t(q)−Xt(q) 22

密集点图 (Dense Pointmaps:适于完整 RGB-D 或密集重建信息的 Video Clips):在参考帧上利用物体掩码(Mask)采样大量的物体表面的点 q q q;从密集追踪点图(TrackCraft3R的伪标签)中直接读取其在未来各个时刻 t t t 的对应 3D 坐标 X t ( q ) X_t(q) Xt(q);点 q q q 在 t t t 时刻未越界、未被严重遮挡且点图深度有效,则 v t q = 1 v_{tq} = 1 vtq=1;反之 v t q = 0 v_{tq} = 0 vtq=0。
稀疏追踪点 (Sparse Tracked Points:适于稀疏关键点/特征点追踪如 TAPIR、CoTracker 的 Clips):不从 Mask 中采样,直接使用原生的追踪点作为查询点 q q q

  • 权重 ( λ fut ≫ λ obs \lambda_{\text{fut}} \gg \lambda_{\text{obs}} λfut≫λobs): 未来预测项赋予更高的权重,强迫模型在缺少未来图像的前提下学会向外推算(Extrapolate)物体的未来运动。

  • 历史项 ( λ obs \lambda_{\text{obs}} λobs): 较低权重的观察项用于稳定从追踪模型继承来的接口表达。

  • 反向传播: 梯度穿过冻结的 Track Decoder 进行更新。

  

实验

    1. 视频先验信息的利用:预训练的视频骨干网络能否有效适配未来的三维轨迹预测任务?
    1. 与人类视频的扩展:随着更多(在数量和多样性方面)的人类交互视频的加入,预测性能如何提升?
    1. 非分布外泛化:所学习的预测方法在超出微调分布的情况下,其泛化能力如何?
    1. 辅助监督的作用:在未使用语言或动作标签的情况下进行训练------与采用此类信息的方法相比,表现如何?

  数据集使用Something-Something V2(SSv2)24中的40K条人-物交互视频 对MotionForesight模型进行训练。在训练或推理过程中,该模型均未接收SSv2的动作标签、语言指令或辅助动作标注。在150段留出的SSv2视频和50段独立录制的手机视频上进行了评估。这些手机视频来自家庭和办公室场景,其中包含此前未曾出现过的物体、环境、视角及拍摄条件,从而提供了分布外(OOD)评估。指标:平均位移误差(ADE)、最终位移误差(FDE)以及预测结果落在固定距离阈值内的比例(PWT)。

图4:未来3D轨迹预测的定性结果。仅基于观测到的视频片段,MotionForesight即可预测出合理的物体运动,包括举升、平移、旋转、受限滑动以及局部非刚性运动。可视化结果展示了首个与末个观测帧的点地图,以及叠加在末个观测帧上的未来预测3D轨迹。

表1:SSv2与 OOD 手机视频的对比。所有方法均采用相同的观测间隔和预测时域。横线以下的行包含真实动作描述,因此比MotionForesight利用了更多的测试时信息。需注意的是,MolmoMotion使用来自不同来源的100万段视频进行训练;而MotionForesight则使用来自SSv2的4万段RGB视频进行训练。

相关推荐
开开心心就好6 小时前
视频播放器完美解码集成三款播放器切换使用
前端·人工智能·智能手机·电脑·音视频·virtualenv·pygame
cuijiecheng20186 小时前
RK3588音视频播放器方案对比
音视频
海带紫菜菠萝汤6 小时前
MSE (Media Source Extensions) 实战:流媒体分块加载与自适应码率
前端·javascript·音视频
七牛云行业应用7 小时前
ComfyUI + MiniMax H3 实战教程:全模态视频生成,API 和本地两种玩法
人工智能·大模型·音视频
AIVOClaw容剪7 小时前
AI 成片系统搭建如何让矩阵号差异化从「同一脚本 50 个号发」变成「反推提示词每号一版」——5 模块防止同质化被判搬运 · AI 视频智能体平台
人工智能·矩阵·音视频
AUV11077 小时前
SaaS 产品演示视频怎么做:从目标、脚本、演示数据到交付的可复现流水线
音视频·saas·产品演示
春末的南方城市7 小时前
消费级显卡迎来实时视频生成!FastVideo 开源 FastWan-QAD,RTX 5090 实现 1.8 秒生成 5 秒 480P 视频!
人工智能·深度学习·计算机视觉·aigc·音视频
OH_TPC8 小时前
【鸿蒙优选三方库】@ohos/ijkplayer:在鸿蒙上像 B 站一样流畅播视频
华为·音视频·harmonyos·鸿蒙
ue星空9 小时前
【Godot】AudioStreamPlayer2D音频播放
游戏引擎·音视频·godot