导读
在具身智能与机器人操控领域,构建高精度的视觉-动作策略映射始终是核心挑战。同时,跨源异构数据的高效利用涵盖跨本体的动力学差异与人机示教所带来的异构鸿沟仍是实现通用泛化能力的关键瓶颈。
为突破上述瓶颈,北京人形机器人创新中心(以下称北京人形)联合北京航空航天大学、北京大学提出XR-1,一种新的VLA训练范式。其核心是Unified Vision-Motion Codes(UVMC):通过双分支VQ-VAE学习离散潜在表征,将视觉动态与机器人运动统一编码,作为观测与动作之间的中间表示,并对齐来自异构数据源的动态信息以实现知识互补。
基于UVMC,XR-1采用三阶段训练(自监督UVMC学习---跨本体大规模预训练---任务后训练),并在包含天工机器人等六类机器人实体、超14,000次真实物理世界rollout、120+操控任务上得到验证;相较π0.5、π0、RDT、UniVLA与GR00T-N1.5等基线取得持续优势,且具备强泛化能力,相关代码、模型文件等均已开源。

破解精度瓶颈与数据孤岛,让机器人"能看亦精练"
在具身智能领域,现有的VLA模型尽管取得了进展,但仍面临三大瓶颈:
-
精度与映射挑战(Precision Gap):现有模型难以从高维视觉观察中生成精确的底层控制动作,即使是厘米级的误差也会导致精密操作任务(如双手协作、精密装配)失败。
-
数据异质性与域间鸿沟(Data Heterogeneity):跨机器人本体的数据(硬件结构、自由度差异)以及缺乏动作标签的人类演示视频之间存在巨大的"域间鸿沟(Domain Gaps)",导致现有方法难以充分利用海量的异构数据资源。
-
模态利用不充分:传统方法往往孤立地编码视觉动力学或机器人动作,未能捕捉到观察与执行之间的因果对齐和多模态互补知识。
为了解决这些问题,研究团队提出统一视动表征(Unified Vision-Motion Codes,UVMC),以离散潜在码形式通过双支路VQ-VAE联合编码视觉动力学与机器人运动,作为观测与动作之间的中间表示,抽象本体差异并实现"看---做"对齐。
基于UVMC,XR-1构建三阶段训练范式:先在大规模异构机器人与人类视频数据上自监督学习UVMC,再进行跨本体VLA预训练,最后面向具体任务进行微调以提升下游成功率与泛化能力。
在六类机器人本体、120项真实任务、超14,000次实测中,XR-1在双手操作、柔性操控与精密装配等场景持续领先,整体性能显著优于π0.5、π0、RDT与GR00T-N1.5等强基线。

UVMC统一表征重塑视觉动力学与运动逻辑的深度对齐
XR-1 提出了一种创新的三阶段训练架构,其核心在于通过自监督学习构建统一视动表征(Unified Vision-Motion Codes, UVMC),从而弥合异构数据与多元本体之间的语义鸿沟。
核心架构:UVMC 其底层特征提取方法由一个双支路 VQ-VAE 构成,旨在将多模态信息映射至统一的离散潜在空间:
- 视觉支路(Vision Branch):采用非对称 VQ-VAE 结构,通过对当前帧与未来帧 {cₜ, cₜ₊ₕ} 的特征,利用视觉编码器压缩 Eᵥᵢₛ 提取反映 h 个步长内时间变化的潜在代码 zᵥᵢₛ,捕捉环境的动态演变规律:zᵥᵢₛ = Eᵥᵢₛ(cₜ, cₜ₊ₕ)。随后通过最近邻查找进行量化得到 zᵥᵢₛ^e 。视觉解码器 Dᵥᵢₛ 通过最小化 L₁ 重构损失来预测未来帧 ĉₜ₊ₕ:

- 动作支路(Motion Branch):该支路专注于提取纯粹的运动特征,输入为动作序列 aₜ:ₜ₊ₕ 与本体感知状态 mₜ:ₜ₊ₕ。运动编码器 Eₘₒ 输出潜在代码 zₘₒ:zₘₒ = Eₘₒ(aₜ:ₜ₊ₕ, mₜ:ₜ₊ₕ)。解码器 Dₘₒ 在给定状态条件 cond 下重构动作序列 。其训练目标函数 ℒₘₒ 同样遵循 VQ-VAE 的重构与正则化准则:

视动一致性对齐(Cross-Modality Alignment):引入 KL 散度对齐损失(Alignment Loss)L_align,其强制视觉编码向动作编码靠拢。这一机制不仅抑制了环境噪声,更使模型能够从无动作标签的人类视频中学习潜在的控制逻辑。

对于阶段一的整个 UVMC 模块,研究团队联合优化所有损失函数:

三阶段训练范式:为了充分挖掘海量异构数据的价值,研究团队采用了递进式的训练策略:
- 第一阶段:自监督表征学习(UVMC Learning):在互联网规模的人类视频(Ego4D)与机器人数据集上进行联合预训练,构建本体无关(Embodiment-agnostic)的通用视动潜空间。
-
第二阶段:UVMC 引导的 VLA 预训练:将 UVMC 作为辅助监督信号引入视觉语言动作(VLA)骨干模型。通过新增的表征预测任务,引导模型内化深层的视动关联知识,增强决策的物理一致性。
-
第三阶段:任务特定微调(Post-Training):针对目标本体进行特定任务的适配,利用预训练阶段积累的通用先验,实现复杂操控任务的高效学习与快速部署。

实验结果:基于14,000+次实机测试的大规模全场景性能实证
研究团队针对6类异构机器人本体(涵盖单/双臂 UR-5e、双臂 Franka、AgileX Cobot Magic 2.0 及天工 1.0/2.0 人形机器人),在超过120项复杂操控任务中进行了14,000余次真机测试。

性能基准:XR-1 与主流 SOTA模型在异构任务中的跨本体效能对比
共120个测试任务,任务类型包括:双臂协作任务测试机器人的协调能力;灵巧操作任务挑战精细控制能力;可变形物体处理考验对非刚体的理解;接触丰富交互要求精确的力控制;动态环境测试适应性;长期操作评估任务规划能力。实验结果显示,研究团队在所有不同机器人本体上均达到SOTA。相较于次优基线π0.5,综合成功率由49.8%提升至70.3%,绝对提升20.5个百分点(相对提升约41%),体现了XR-1在跨本体泛化与复杂操控任务上的显著优势。

新任务快速适配:极低样本驱动的能力迁移
XR-1 凭借强大的预训练先验,在面对从未见过的机器人本体与全新任务时,展现了卓越的"举一反三"能力。在面对预训练阶段完全未见过的天工 2.0人形机器人及 15 项全新任务时,每项任务仅需20次(20-shot)演示样本,其任务成功率便显著超越了独立训练的 ACT与Diffusion Policy等基准模型。这一结果有力证明了UVMC学习到了本体无关(Embodiment-agnostic)的通用动作语义,使其能在极低样本下迅速完成跨本体的能力迁移,极大地降低了机器人进入新场景的部署成本。

环境泛化能力验证:未知场景下的分布外鲁棒性
为验证 XR-1 模型在超分布(Out-of-distribution)环境下的泛化性能,研究团队设计了一系列严苛的未知场景实验。模型在完成基础训练后,被直接部署于包含多种干扰因素的任务中,具体包括:使用从未见过的新型物体(如未见过的垃圾或尘推)进行操作、引入动态与静态障碍物干扰、以及大幅改变环境光照和背景布局。实验通过将 XR-1 与强力基线模型 π0进行横向对比,旨在评估模型是否真正掌握了跨场景的通用视动规律,而非简单的轨迹记忆。

实验结果表明,XR-1 在所有未知场景下均表现出显著的性能优势与极强的泛化鲁棒性。相比于基线模型,XR-1 能精准识别并操控新型异形物体,并能有效过滤背景切换或光照剧烈变化带来的视觉噪声,保持动作执行的连续性与物理一致性。这有力证明了通过统一视动表征(UVMC)学习到的特征具备高度的语义抽象性,使机器人能够突破预训练数据的局限,在多变的现实物理世界中实现稳定可靠的任务部署。

基础能力零样本验证:开箱即用的泛化表现
为了评估 XR-1 在未经任何特定任务微调(Stage-3)时的基础能力,研究团队开展了"开箱即用"实验,直接将经过第二阶段预训练的模型应用于下游任务。研究团队在 Dual-Arm Franka 平台上选择了 7 个代表性任务,这些任务仅占预训练数据集 XR-D 总量的 0.45% 。为确保对比的严谨性,所有参与对比的基线模型(如 RDT 和 UniVLA)均已在这些特定任务的数据上进行了完整的微调训练,而 XR-1 保持零样本(Zero-shot)状态进行部署。
实验结果显示,XR-1在没有任何下游适配的情况下,其基础性能已达到甚至超越了经过充分微调的基线模型。数据表明,XR-1-oob的表现与π0等强模型相当,且显著优于 RDT 和 UniVLA,展现了极强的泛化一致性。这一表现归功于 UVMC 能够跨本体对齐多模态动力学,使模型在极低数据依赖下依然能准确提取任务语义并生成物理一致的动作,验证了其作为具身智能通用底座的巨大潜力。

结语:迈向通用的机器人智能新范式
北京人形推出的 XR-1 不仅仅是一个具身大模型,它代表了具身智能从"单一本体"向"通用范式"转化的关键突破。通过创新性地学习统一视动表征(UVMC),研究团队成功弥合了视觉感知与底层控制之间的语义鸿沟,使机器人能够像人类一样,从海量的异构数据与跨本体交互中汲取物理世界的普适规律。在未来的演进中,XR-1 将继续作为通用的底座框架,赋能各构型机器人实现在复杂动态场景下的快速部署与自主泛化。北京人形一直致力于打破数据与硬件的壁垒,让精准、灵活且具备高度智能的机器人操作走进千家万户与千行百业,共社会各界共同定义具身智能的无限可能。