10万小时UMI预训练验证Scaling Law:机器人策略模型的数据范式变革
2026年7月,国内头部科技企业发布了一款基于10万小时真实世界数据预训练的机器人策略基座模型。这是全球范围内,机器人策略模型首次被如此规模的无本体(Body-Free)数据采集方案训练出来,也是Scaling Law在具身智能领域的首次系统性验证。本文将从技术架构、数据采集范式、训练方法论三个维度,深入拆解这一里程碑事件的技术细节和工程意义。
一、Scaling Law的具身智能验证
大语言模型的成功已经证明,Scaling Law------数据量、参数量和模型性能之间的幂律关系------是通往更强AI能力的底层规律。但这条规律在机器人领域是否存在,一直缺乏充分的实验支撑。核心原因在于:机器人数据的采集成本极高、多样性极差、规模极其有限,导致无法像在NLP领域那样轻松地将数据量提升几个数量级。
这次发布的技术报告给出了明确的答案。实验数据显示了两条关键曲线:
曲线一:预训练数据量从2500小时增加到20000小时,模型在下游任务上的预测损失(Prediction Loss)持续单调下降。
曲线二:模型参数量从2B扩展到10B,动作生成的精度指标同步提升。
这两条曲线的存在,意味着具身智能领域终于有了自己的Scaling Law。数据规模的扩大和参数量的增加,同样能带来机器人策略模型能力的可预测增长。这个发现对整个行业的影响是深远的------它告诉所有从业者:大规模数据这条路是走得通的,投入数据采集是有确定回报的。
二、UMI无本体数据采集架构解析
传统的机器人数据采集方式有一个根本性限制:数据绑定本体。你在A机器人上采集的数据,不能直接用于训练B机器人。这种"一机一数据"的模式,严重制约了数据的可复用性和规模扩张速度。
UMI(Universal Manipulation Interface)方案的创新在于,它彻底解耦了数据采集和机器人本体之间的关系。具体而言,UMI使用自研的便携式穿戴设备------通常是一个带有相机和传感器的手持或腕部装置------在不绑定任何特定机器人硬件的前提下,记录人类操作者在真实场景中的操作轨迹。
从技术实现来看,这套方案包含几个关键组件:
(1)多模态传感融合:腕部设备集成了RGB相机、IMU(惯性测量单元)、力/力矩传感器,能够同时捕获视觉信息、末端位姿和接触力数据。这些多模态信息构成了后续模型训练的完整输入。
(2)场景大规模覆盖:数据采集覆盖了1700多个家庭、商超、工厂场景,涉及收纳、搬运、整理、装配等全品类操作任务。这种场景多样性是保证预训练模型泛化能力的基础。
(3)动作轨迹标注:穿戴设备记录的不仅是视频,还包括操作者的手腕轨迹、抓取策略、力度变化等结构化信息。这些信息经过坐标变换后,可以映射到不同机器人本体的动作空间中。
从工程角度看,UMI方案的核心优势在于数据复用率极高。同一段人类操作数据,理论上可以被多个不同构型的机器人系统利用,只需在跨本体迁移阶段完成坐标映射和动力学适配即可。
三、两阶段训练范式的技术细节
该策略基座模型的训练采用了明确的两阶段设计,每个阶段有独立的目标和数据配置。
第一阶段:通用预训练
使用10万小时的无本体UMI数据。这一阶段的核心目标是让模型学会理解物理世界中的操作逻辑------不是记住"某台机器人怎么动",而是理解"人类是怎么操作物体的"。具体包括:物体抓取的稳定策略、空间路径的规划逻辑、力度的自适应调节、多步骤任务的分解与执行。模型架构采用了基于Transformer的序列建模方案,将视觉观测、本体感知(此处为穿戴设备数据)和动作指令编码为统一的token序列。
第二阶段:跨本体后训练
使用约10000小时的跨本体数据,包括:7200小时以上的移动操作和双臂机器人数据、1000小时以上人工标注的UMI数据、以及Bridge V2、RT-1、DROID等公开数据集。这一阶段的核心目标是将预训练阶段积累的通用操作知识,适配到具体的机器人本体上。技术挑战在于不同机器人构型之间的动力学差异------同一"抓取杯子"的动作,在不同臂长、不同关节自由度的机器人上,对应完全不同的关节角度序列。跨本体迁移的本质是在不同动作空间之间建立映射关系。
这种两阶段范式的实际效果非常显著。在多个下游新任务上,每个任务平均仅需不到10小时的微调数据,就能达到远超此前标杆模型的成功率。这意味着新任务的开发成本被大幅压缩------过去需要数周甚至数月才能完成的任务适配,现在可能只需要几个小时的数据采集。
四、自动标注流水线的工程突破
10万小时数据的标注工作量是极其庞大的。传统的做法是人工逐条标注,一条5分钟的操控视频通常需要3-4小时才能完成高质量标注。按照这个效率,10万小时的人工标注需要数千人的标注团队工作数月。
该团队采用了一套基于视觉语言模型(VLM)的自动标注流水线,将整个标注周期压缩到两周。从技术角度看,这套流水线的核心能力包括:
(1)动作语义理解:VLM不仅能识别画面中的物体,还能理解操作动作的语义------区分"抓杯口"和"握杯身"、"竖直拿起"和"倾斜倒水"等细粒度动作差异。
(2)多模态标注生成:自动生成包括目标物体检测框、操作阶段分割、关键帧标注、动作标签在内的多维标注信息。
(3)质量控制闭环:通过抽样验证和置信度评估机制,确保自动标注的精度满足模型训练需求。
这种VLM驱动的自动标注方案,为VLA(Vision-Language-Action)模型的大规模数据标注提供了一条可落地的工程路径。它解决了数据规模化和标注成本之间的矛盾,使得十万小时级别的数据集处理成为可能。
五、性能评测与基准分析
在RoboDojo评测基准上,该模型取得了20.07分的成绩,成功率为13.93%。作为参考,此前的最高纪录为13.07分,成功率8.80%。这种断档式的领先幅度,在机器人评测历史上相当罕见。
在RoboCasa评测基准上,该模型以57.4%的平均成功率获得全球第一,超越谷歌此前46.6%的历史最优成绩。RoboCasa侧重评估机器人在复杂家居环境中的长序列操作能力,对模型的泛化性和鲁棒性要求极高。
性能上的碾压式领先,根源在于训练数据规模的数量级差异。此前全球范围内的机器人策略模型训练,数据量级通常在数百到数千小时之间。10万小时的预训练数据量,是此前最大规模的数十倍。这个结果从实验层面证明:在机器人策略模型上,数据规模是决定性能上限的关键变量。
六、对行业技术路线的启示
这一技术突破对整个具身智能行业的技术路线选择具有深远的指导意义。
在数据采集策略层面,UMI无本体方案的成功验证了"先通用、后专用"的数据积累路径的可行性。行业无需再为每台机器人单独建设数据采集体系,而是可以基于人类操作的通用数据预训练基座模型,再通过少量跨本体数据完成适配。这将大幅降低机器人策略模型的开发门槛和周期。
在模型架构层面,两阶段训练范式有望成为行业标准。预训练阶段追求数据的规模和多样性,后训练阶段追求本体适配的精度和效率。这种分工使得数据工程和模型工程可以独立迭代,有利于整个生态的专业化分工。
在数据工程层面,自动标注技术的突破释放了一个明确信号:数据标注不能继续依赖人工,必须走自动化、规模化的路线。VLM驱动的标注方案、基于仿真数据增强的方案、以及两者的混合方案,将成为下一阶段数据基础设施竞争的核心赛道。
从产业数据来看,IDC预测中国具身智能市场支出将从14亿美元增长至770亿美元,年复合增长率94%。2026年上半年国内具身智能融资总额达到935亿元,超过一半投向VLA模型和世界模型等底层智能方向。在这个大背景下,数据基础设施------特别是大规模数据采集、自动化标注、跨本体迁移等核心能力------将成为决定行业竞争格局的关键变量。
七、总结
10万小时UMI数据的发布,标志着具身智能正式进入"数据规模化"时代。Scaling Law在机器人策略模型上的首次验证,为整个行业指明了一条清晰的技术路径:大规模高质量数据 + 两阶段训练范式 + 自动化标注工程。这三大支柱的确立,意味着具身智能的发展不再依赖零散的小规模实验,而是可以像大语言模型一样,通过系统性的数据工程来实现可预测的能力增长。
接下来,行业需要解决的核心问题包括:如何进一步扩大数据采集的场景覆盖和多样性、如何提升跨本体迁移的精度和效率、如何建立统一的数据格式标准以降低生态协作成本。这些问题的解决,将直接决定具身智能从实验室走向规模化产业应用的速度。
此外,数据质量和数据安全的保障体系也需要同步建设。当训练数据的规模从千小时级跃升到十万小时级,数据来源的多样性、标注质量的一致性、以及数据在不同组织之间流转时的安全合规性,都成为不可回避的工程挑战。特别是当多个机构共同参与数据采集时,数据去重、冲突检测、版本管理等基础能力都需要在平台层面得到系统性解决。这些看似"枯燥"的工程问题,实际上是决定数据基础设施能否支撑行业规模化发展的关键因素。
八、数据基础设施的工程化挑战
从工程实践的角度来看,10万小时级别的数据处理暴露了一系列此前未被充分重视的基础设施挑战。数据采集端,1700多个场景的并行采集需要一套完整的设备管理、数据回传和质量监控系统。采集设备需要标准化------保证不同批次、不同场景采集的数据在格式和精度上具有一致性。数据回传需要高带宽、低延迟的网络基础设施,特别是在工厂等复杂环境中,网络条件的不确定性会直接影响采集效率。
标注端的挑战更为复杂。VLM自动标注虽然大幅提升了效率,但模型本身的泛化能力仍有局限------对于某些特殊场景(如暗光环境、高反射物体表面、柔性物体操作),VLM的标注精度会明显下降。这要求标注流水线具备自适应切换能力:在VLM高置信度场景下走自动标注,在低置信度场景下切换到人工复核。这种混合标注策略需要在工程层面实现无缝切换,同时保证最终交付数据的质量一致性。
从产业数据来看,IDC预测中国具身智能市场支出将从14亿美元增长至770亿美元,年复合增长率94%。2026年上半年国内具身智能融资总额达到935亿元,超过一半投向VLA模型和世界模型等底层智能方向。在这个大背景下,数据基础设施------特别是大规模数据采集、自动化标注、跨本体迁移等核心能力------将成为决定行业竞争格局的关键变量。谁能在工程层面率先解决十万小时级数据的采集、标注和交付问题,谁就能在这个高速增长的市场中占据先发优势。