【论文阅读】Whole-Body Conditioned Egocentric Video Prediction

论文泛读

基础信息

题目:Whole-Body Conditioned Egocentric Video Prediction

时间:2025年6月(arXiv)

机构:UC Berkeley、Meta FAIR、NYU

关键词:egocentric video prediction, whole-body pose, diffusion transformer

一句话总结

作者想让模型根据"人怎么动身体"预判第一人称画面会怎么变,于是用全身 3D 姿态当控制信号来生成未来视角视频,比只用简单导航控制的方法更贴近真实动作带来的视觉变化。

为什么要做

已有第一人称视频预测多用速度、朝向这类粗控制,几乎不管手臂、躯干等全身动作。现实中伸手、转身都会立刻改变你看到的内容,缺了全身条件,模型很难真正按人的动作去"想象"接下来看到什么。

做了什么

输入是过去几帧第一人称画面,加上一串相对 3D 姿态变化(根部位移与各关节相对旋转)。画面先压成潜变量,再用条件 Diffusion Transformer 按动作逐步去噪,自回归生成下一帧;训练时随机跳帧,让模型也能学几秒后的变化。和已有方法最实质的区别是:控制信号从低维导航指令换成了结构化的全身姿态轨迹。

结果如何

在超前约 2 秒的单步预测上,感知与语义相似度、生成质量都好于同类条件 Diffusion 基线;拆成前进、转身、举手等原子动作时,大模型也更跟得上。长期能滚到约 16 秒,但越远越糊;用预测画面挑动作做规划只有定性示例,证据偏弱。

最后记住

值得记住的是:用真实同步的第一人称视频 + 全身动捕,证明"怎么动"可以直接驱动"会看到什么"。主要局限是规划仍很初步(多只动单臂、靠图像相似度选动作),且未条件化任务意图。

相关推荐
Raas1001 小时前
大模型网关和API网关区别是什么?MAI Gateway统一AI流量治理
java·大数据·运维·人工智能·gateway·企业级·ai网关
Lab_AI1 小时前
从代理到自研,从工具到平台:创腾科技的AI for Science破局之路
人工智能·ai·ai for science·ai4s·ai+材料创新·ai+药物发现·ai+药物研发
YOLO数据集集合1 小时前
无人机检测与追踪数据集 | 无人机检测 反无人机 低空安防 目标追踪 YOLO格式9010期
人工智能·yolo·目标检测·计算机视觉·无人机·无人机检测
SL-staff1 小时前
APS排产规则底座实践:如何用生产全局配置统一自动拆分、成批基数与齐套策略
大数据·数据库·人工智能·智能制造·aps·mes·排产规则
BioRunYiXue1 小时前
RACE技术全攻略:从全长克隆到靶基因验证
java·javascript·网络·人工智能·科技·算法·eclipse
七点半.1 小时前
LLM 工程能力
人工智能·llm
F&C嘉准传感器1 小时前
超细聚焦光纤传感模组:微米级极小光斑,精密微型元器件组装定位零偏差
人工智能·安全·目标检测·自动化·产品运营
CodeBlog-star1 小时前
Codex Harness 全面开源:OpenAI的 AI Agent 底层执行框架
人工智能·开源·openai·codex·harness
MartinYeung51 小时前
[论文学习]BadRobot:物理世界中具身大语言模型智能体的越狱攻击
人工智能·学习·语言模型