
它不只记录人怎么动,也记录人在哪里动、脚踩在哪里,以及周围地形是什么形状。
------野外 4D 人体 - 地形对齐
目录
[01 只看动作,机器人不知道脚应该落在哪里](#01 只看动作,机器人不知道脚应该落在哪里)
[02 三类传感器分别记录身体、轨迹和场景](#02 三类传感器分别记录身体、轨迹和场景)
[03 数据集不算大,但把复杂地形和接触关系保留下来](#03 数据集不算大,但把复杂地形和接触关系保留下来)
[04 从人体示范到 G1,中间还要解决身体差异](#04 从人体示范到 G1,中间还要解决身体差异)
[05 五厘米为什么会成为一道坎?](#05 五厘米为什么会成为一道坎?)
[06 一套更完整的数据方法](#06 一套更完整的数据方法)
让人形机器人模仿人类走路,并不只是把膝盖抬到相似的角度。
走上台阶、踩过踏石或沿着窄梁横移时,真正决定动作能否完成的,是脚在什么时间、落到什么位置,以及身体与周围地形保持什么关系。
但现有不少人体运动数据只记录"人怎么动",没有完整保留"人在哪里动"。
为此,来自苏黎世联邦理工学院、斯坦福大学、加州大学伯克利分校和慕尼黑工业大学的团队提出 EgoHTR。他们用惯性动捕服记录身体运动,用第一视角智能眼镜提供全局轨迹,再用便携式 3D 扫描仪重建环境,把人体姿态、脚部接触和场景几何对齐到同一个坐标系中。
这篇工作没有做一个更大的动作库,而是回答一个更基础的问题:
如果人类示范要真正用于复杂地形上的机器人学习,动作数据究竟还缺什么?
01 只看动作,机器人不知道脚应该落在哪里
模仿学习可以利用人类动作先验,帮助机器人缩小强化学习的搜索范围。
对平地行走而言,参考动作主要告诉机器人关节应该怎样变化;
但到了踏石、横梁、箱体和废墟等环境,动作与场景之间的关系就不能再被省略。
同一个抬腿动作,落在踏石中央和落在边缘的结果完全不同。
人体根部位置即使只偏移几厘米,也可能改变整条腿的落点。换句话说,复杂地形运动不是一段孤立的关节轨迹,而是一段**"人体---接触---环境"**共同变化的时空过程。
现有数据集往往难以同时保留这些信息。有些数据来自室内光学动捕系统,精度高,但活动范围有限,场景也多为平地;有些数据覆盖室外环境,却没有稠密的三维场景;还有一些工作尝试直接从视频恢复人体和场景,但在遮挡、快速运动和复杂交互中,姿态错误与全局轨迹漂移仍然常见。
EgoHTR 的核心在于:与其只记录人怎么动,不如把动作重新放回它发生的地形中。

▲图1 | EgoHTR 把第一视角与外部相机、惯性动捕和稠密场景扫描统一到同一套数据中,并面向复杂地形运动学习和人体运动分析提供应用验证。
02 三类传感器分别记录身体、轨迹和场景
要在室外废墟、工业空间和大范围场地中采集数据,传统动捕室的固定摄像机并不实用。EgoHTR 没有尝试依靠单一设备解决全部问题,而是组合三类已经商品化的传感器,让它们分别处理身体、轨迹和场景。
- Rokoko Pro II 惯性动捕服负责记录身体运动。它不依赖外部摄像机视野,即使人体被墙壁、管道或自身肢体遮挡,也能持续输出骨架姿态。
- Project Aria 智能眼镜负责记录第一视角视频和头部的 SLAM 轨迹,为人体提供稳定的全局移动路径。
- Leica BLK2GO 便携式 3D 扫描仪则在动作采集前后重建高密度场景,保留台阶、石块、横梁等地形几何。
这样得到的仍然是三套彼此独立的数据。
接下来通过身体建模、时间同步和空间对齐,把它们拼成统一的 4D 人体---场景序列。

▲图2 | EgoHTR 用动捕服记录身体运动、用第一视角眼镜提供全局轨迹、用 3D 扫描仪重建地形,再通过身体建模、时间同步和空间对齐把人体动作放回真实场景。
- 身体建模解决的是"骨架怎样变成人体"。
系统先把动捕服提供的 22 个主要身体关节映射到 SMPL-X 参数化人体模型,再通过运动学重定向和逆运动学优化,得到连续的人体网格。这里的目标不是从图像猜测人体姿态,而是把已有的惯性动捕骨架转换为标准、可计算的身体表示。
- 时间同步解决的是"不同设备何时开始记录"。
为了保留野外采集的机动性,团队没有使用复杂的硬件同步线,而是在每段序列开头拍手。拍手声会同时进入不同设备的音频,再用于对齐时间轴。
研究中的跨传感器同步误差约为 60 毫秒,虽不如实验室硬连接系统的亚毫秒精度,但换来了更大的活动范围和更简单的野外部署。
- 空间对齐解决的是"人体究竟位于场景中的哪里"。
惯性动捕适合记录关节运动,却容易累积全局漂移。EgoHTR 因此用眼镜的 SLAM 轨迹约束人体头部位置,再把眼镜产生的半稠密点云与 3D 扫描仪生成的高精度场景进行粗对齐和精对齐。
最终,人体姿态、全局移动和地形几何被放进同一个场景坐标系。

03 数据集不算大,但把复杂地形和接触关系保留下来
EgoHTR 覆盖 7 个室内外非结构化场景。数据共包含 55 条序列,总时长 1.37 小时,约 15 万个同步帧,采样率为每秒 30 帧。
场景规模从约 25 平方米延伸到约 1000 平方米,既有室内跑酷和体操环境,也有工业空间与室外废墟。
**这组数据将每一帧都保留了更多上下文:**人体 SMPL-X 网格位于统一场景坐标中,脚部接触可以逐帧获得,第一视角和部分外部观察视角能够同步对应,场景还提供可用于碰撞检测和机器人训练的高分辨率三维几何。

▲图3 | EgoHTR 覆盖七个室内外场景,既包含便于获得光学动捕真值的室内跑酷环境,也包含工业空间和室外废墟等非结构化地形。
在定性结果中,人体网格能够连续出现在废墟行走、窄梁平衡和钻入管道等序列里。
这些场景包含明显遮挡、快速运动和身体与环境的近距离交互,正是普通外部相机容易丢失人体的情况。

▲图4 | EgoHTR 将人体网格持续放在统一的三维场景坐标中,覆盖废墟行走、窄梁平衡和钻入管道等容易出现遮挡与快速运动的复杂序列。
此外,研究也用多种人体重建方法评估了这套数据。
在研究的数据划分和基准设置下,EgoHTR 测试集上的平均关节位置误差为 73.2 毫米,对齐后误差为 54.3 毫米;
全局指标还包括 151.3 毫米的世界坐标关节误差和 0.09% 的根部轨迹误差。这里的数字不能理解为系统在所有场景中都达到完全相同的精度,它们更适合用来说明这套数据可以支持局部姿态与全局运动的统一评测。
**为了验证测试集是否接近光学动捕真值,**研究还把 EgoAllo 和 JOSH 分别在 EgoHTR 测试集与光学动捕数据上运行。多项局部和全局指标的差异较小,支持 EgoHTR 作为人体---场景重建基准使用,但不意味着两者完全一致。

▲图5 | 团队分别用 EgoAllo 和 JOSH 在 EgoHTR 测试集及光学动捕真值上评测,多项局部与全局指标的差异较小,支持该测试集作为人体---场景重建基准使用。
04 从人体示范到 G1,中间还要解决身体差异
人类动作不能直接复制给机器人。 人和 Unitree G1 的身体比例、关节结构与活动范围不同,一段人体参考动作必须先被重定向到机器人的 29 个自由度上。
研究为每条参考动作单独训练一个 PPO 专家策略,并在 Isaac Lab 中搭建与真实场景对应的碰撞环境。
策略在训练时既接收机器人的本体状态和参考关节指令,也接收按偏航方向对齐的局部地形高度扫描。
这样一来,控制器不只是追随动作姿态,还能读取脚下地形。训练完成后,策略输出 G1 全部关节的位置目标。

▲图6 | 团队先将场景中的 SMPL-X 人体动作迁移到 Unitree G1 的身体结构,并在对应的碰撞场景中检查动作与环境的几何关系;图中展示后空翻和倒立序列。
**EgoHTR 还提供逐帧足部接触标注,**把它加入奖励函数,让机器人不仅模仿身体姿态,还要在正确时间建立或释放脚部接触。
仿真实验显示,加入足部接触奖励后,平地、上箱、横梁和踏石等动作的训练收敛都得到改善;
在踏石任务上,最大成功率从 67% 提高到 72%,达到相近水平所需的训练步数也有所减少。

▲图7 | 在踏石仿真中,策略既要跟随参考动作,也要结合局部地形高度和逐帧足部接触标注,把脚落到有限的支撑面上。
**这组实验说明,场景对齐数据的作用不只是让可视化更完整。**人体根部位置、脚部接触时间和地形高度都能直接进入机器人控制策略的训练过程,成为约束落脚位置的信号。
05 五厘米为什么会成为一道坎?
研究进一步做了一项精度消融实验:在参考动作的根部位置中加入不同强度的高斯噪声,再观察踏石和横梁任务能否正常训练。
结果显示,误差增大到约 5 厘米时,两项任务的训练表现已经明显下降;
误差达到 10 厘米时,策略在研究设置下无法正常学会这些动作。
原因并不难理解:平地行走允许一定程度的位置偏差,但踏石和横梁提供的支撑面很小,根部轨迹一旦偏移,原本正确的脚步就可能落到支撑面之外。

▲图8 | 当参考动作的根部位置误差增大时,踏石和横梁任务的训练表现快速下降;误差达到 10 厘米后,策略在论文设置下无法正常学会这两项动作。
对于依赖精确落脚点的动作,"姿态看起来像"并不够,参考动作还必须在场景中放得足够准。
厘米级对齐不是为了追求更漂亮的重建结果,而是因为下游控制策略会直接受到几何误差影响。
在仿真训练完成后,研究把横梁和上箱策略部署到真实的 Unitree G1。为缩小仿真与现实的差异,训练中加入了观测噪声、执行器增益与摩擦随机化、机身质量扰动和足部外力扰动。
真机结果说明,从场景对齐的人类示范到机器人动作训练这条链路可以跑通。

▲图9 | 团队将 EgoHTR 中的窄梁横移和上箱动作迁移到 Unitree G1,并把在仿真中训练的感知型全身控制策略部署到真机。
06 一套更完整的数据方法
EgoHTR 的真机结果很直观,但需要明确这些实验覆盖了什么、还没有覆盖什么。但是研究验证的是若干场景对齐参考动作能够用于 G1 的专家策略训练,并展示了横梁和上箱动作的真机部署。它没有证明机器人已经具备开放环境中的通用地形理解、自主规划和即时适应能力。
研究也列出了当前流程的几项限制。
首先,1.37 小时的数据规模还不足以直接支撑大规模基础模型训练,更适合用于基准评测、方法验证和微调;
其次,当前流程假设场景是静态的,不能处理可移动或可变形物体。智能眼镜提供的手部追踪尚未整合进身体模型,采集后也没有进一步进行人体与场景的联合优化;
此外,在缺少视觉特征的环境或高加速度运动中,硬件定位仍可能失效。
现有纯视觉人体重建方法在 EgoHTR 数据上也暴露出相同难点:遮挡、运动模糊和全局轨迹漂移会让人体姿态与场景逐渐错位。

▲图10 | 在 EgoHTR 收录的遮挡、快速运动和复杂场景交互中,部分现有人体网格恢复方法会出现姿态错误或全局轨迹漂移;红色为 EgoHTR 提供的重建结果。
这说明高质量场景对齐数据不仅能服务机器人控制,也能成为检验第一视角人体重建方法的压力测试。
Ref:
EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal