具身智能真实数据之DROID详解:真实世界数据如何把机器人策略从实验室推向日常场景

写在前面

从零走向AGI 】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。

项目地址 🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间

猫先生

从零走向AGI

面试面经

AIGC算法岗/开发岗面试面经交流社群 (涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

DROID详解:真实世界数据如何把机器人策略从实验室推向日常场景

导读

DROID(Distributed Robot Interaction Dataset)关注的不是新的策略网络,而是机器人学习一直绕不开的基础设施问题:怎样在真实、分散、变化很大的场景中,持续采集足够多、足够丰富、还能复现的数据。论文把同一套便携式 Franka Panda 采集平台复制到 13 家机构,组织 50 位采集者在北美、亚洲和欧洲工作 12 个月,最终形成 7.6 万条成功示范轨迹、约 350 小时交互数据,覆盖 564 个场景、52 栋建筑和 86 类任务。

数据中不仅有 RGB、深度和三路立体相机,还包含相机内外参、机器人状态、动作和语言指令。采集流程要求机器人频繁移动到新场景,鼓励采集者选择有杂物、有多个可操作物体的真实环境,并通过随机任务提示、相机变化和物体扰动减少"只会在一张桌子上完成一个动作"的偏差。

论文用一个标准 Diffusion Policy 验证数据价值:把 DROID 与每个目标任务的少量示范按 50/50 混合,所得策略在六个任务和分布外扰动上优于只用目标域数据或与 Open X-Embodiment 混合的方案;同等样本量的消融还表明,场景多样性本身就是泛化收益的重要来源。

猫先生认为,DROID 的核心贡献可以概括为"把真实世界的变化纳入数据采集协议"。它没有把 in-the-wild 当成宣传词,而是用统一硬件、标定、随机化和跨机构流程,把场景变化变成可学习的训练信号。
论文标题 :DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset

论文地址https://arxiv.org/abs/2403.12945

项目主页https://droid-dataset.github.io/

GitHubhttps://github.com/droid-dataset/droid

策略训练代码https://github.com/droid-dataset/droid_policy_learning

原文脉络

论文沿着"为什么机器人数据缺真实多样性---如何设计可复制的采集平台---DROID 的多样性分析---数据是否改善策略---场景多样性是否是关键因素---讨论与开放问题"的路径展开。第三节解决数据怎么采,第四节说明数据到底覆盖了哪些变化,第五节用统一策略管线做因果更清晰的对比。

1-2. 背景与相关工作:机器人数据缺的不是总量,而是变化

ImageNet、Common Crawl 等互联网数据集可以自然获得规模和长尾分布;机器人数据却要同步记录视觉、动作和状态,通常还需要人工遥操作,采集成本高、存在安全风险。因此许多大型操控数据集虽然轨迹数不少,却集中在少数实验室、固定桌面和有限视角,模型遇到新房间、新光照或干扰物就容易失效。

DROID 将已有工作按三条线放在一起比较:脚本或自动策略采集、人类遥操作数据集,以及跨数据集聚合的 Open X-Embodiment。它的差异不在于提出另一种动作损失,而在于主动扩大场景、物体、任务、视角和交互位置五个维度,同时保留统一标定和语言标注,便于后续策略训练。

3. DROID 数据采集系统:统一平台承载真实变化

3.1 便携式硬件栈

DROID 的每个采集单元使用 7 自由度 Franka Emika Panda、Robotiq 2F-85 平行夹爪、两台可调位置的 ZED 2 外部双目相机和一台腕部 ZED Mini 双目相机。整套设备安装在带轮、可升降的桌面上,配合一个运行采集 GUI 的笔记本和承载 Polymetis 控制服务的 NUC,场景变化时可以整体搬动。

图 1:DROID 的统一便携式机器人平台,包括 Panda 机械臂、三路立体相机、Quest 2 遥操作设备和移动桌面。来源:论文 Figure 0。

Quest 2 控制器把操作者的手部动作映射为连续 6D 末端位姿和夹爪指令,系统以 15Hz 记录关节空间与末端空间动作。每个 episode 保存三路同步视频、深度、相机标定、机器人本体状态、语言指令和成功标签;这样的统一字段让不同机构采集的数据可以直接进入同一训练管线。

3.2 从换场景到随机任务的采集协议

采集者开始一个 session 后,先把机器人移动到新的房间、厨房、办公室或实验室角落,再选择能够容纳多个物体和多种交互的相机视角。GUI 会预先登记模板任务或自由文本任务,实际 episode 从任务池中随机抽取,减少采集者只挑容易动作的倾向。

协议还会提示改变底座位置、重新布置或移动相机、调整光照、增删物体。一个场景采集约 20 分钟或达到约 100 条轨迹后切换,因而同一任务会在不同桌面高度、背景、相机视角和物体排列下重复出现。后续语言标注还为每条轨迹提供最多三条独立指令,增强任务描述的表达多样性。

猫先生认为,DROID 的"真实数据"不是把机器人搬到户外拍几段视频,而是把场景更换、相机重布置、干扰物和任务随机抽样写进 SOP。采集协议本身就是数据质量控制的一部分。

4. 数据集分析:五个维度刻画真实世界覆盖

4.1 任务和物体的长尾

论文从语言指令中抽取动词和物体,再用语义去重合并同义词与拼写差异。DROID 的动词分布呈现明显长尾,既有抓取、放置、打开等高频技能,也有大量低频交互;物体类别覆盖家庭、办公和实验室中的日常物品。

图 2:DROID 的动词和物体分布。长尾说明数据不是把大量轨迹集中在少数固定动作上。来源:论文 Figure 1。

4.2 场景数量和类型

DROID 统计 564 个独立场景,覆盖 52 栋建筑和约 10 类场景类型。场景的判定要求机器人工作空间发生实质变化,例如进入另一间房或厨房的另一个角落,而不是只改变桌面上物体的排列。

图 3:不同数据集的场景类型数量对比。DROID 的场景规模比多数大型操控数据集高约一个数量级。来源:论文 Figure 2。

4.3 视角与交互位置

由于外部相机每次换场景都要重新布置,DROID 累积了约 1417 个第三人称视角,并保留立体相机内外参。论文还用"轨迹中第一次闭合夹爪的位置"作为交互点 proxy,发现机器人在工作空间中的交互位置覆盖更广。对策略而言,这比固定相机下的桌面中心操作更接近真实部署时的几何变化。

5. 实验设置与结果:DROID 是否真的改善策略

5.1 统一 Diffusion Policy 基线

DROID 不提出新策略算法。实验统一采用 Robomimic 中的 Diffusion Policy:两路外部 RGB 图像经过 ImageNet 预训练的 ResNet-50 编码,与冻结的 DistilBERT 语言特征和机器人本体状态拼接,再由 MLP 送入 U-Net 扩散头,预测 16 步末端位姿、旋转和夹爪动作。执行时开环运行 8 步,再重新推理。

每个目标任务都有 50--150 条本地示范。对照方法分别是只用本地数据、以 50/50 比例混入 DROID 成功轨迹,以及以同样比例混入 Open X-Embodiment。每个任务和设定进行 10 次 rollout,并同时测试初始位姿扰动的分布内场景和加入干扰物、替换物体、改变相机的分布外场景。

5.2 六个真实任务和 OOD 评测

评测包括 Close Waffle Maker、Place Chips on Plate、Put Apple in Pot、Toasting、Clean up Desk 和 Cook Lentils,覆盖短时抓放、中等时序开合以及需要连续三步完成的长时序厨房任务。

图 4:六个实机评测任务及其分布外扰动设置。任务从实验室延伸到办公室和真实家庭厨房。来源:论文 Figure 5。

与只用 in-domain 示范的策略相比,DROID 协训在所有任务上都明显提高成功率和鲁棒性;相较混入 OXE 的策略,DROID 在 OOD 设置下仍保持优势。论文汇总结果显示,DROID 相对次优方法的平均成功率在分布内提高约 22 个百分点,在分布外提高约 17 个百分点。厨房的 Cook Lentils 最能体现差异:基线常在第一、第二步后失败,DROID 协训策略能更稳定地完成取下锅盖、倒入扁豆和打开炉具三步。

图 5:Cook Lentils 任务的代表性 rollout。DROID 协训策略的动作更平滑,面对未见干扰物时仍能完成长时序操作。来源:论文 Figure 7。

5.3 场景多样性消融

为了区分"数据更多"和"场景更多",论文固定 DROID 子集大小为 7362 条轨迹:一组集中来自 20 个高产场景,另一组从大量场景中随机采样。两组都与本地数据按 50/50 混合,结果显示多场景子集的 OOD 性能更高;使用完整 DROID 在三个对比任务上也不低于子集。

这项控制实验把结论从"DROID 数据有效"推进了一步:场景多样性不是数量增长的副产品,而是泛化收益的直接来源之一

6. 讨论、局限与可复现性

DROID 开源 CC-BY 4.0 数据集、交互式可视化器、策略训练代码、预训练检查点和硬件/软件复现指南,降低了其他实验室复现真实数据采集的门槛。统一 Panda 平台也让跨机构数据更容易对齐。

边界同样明确。数据的机器人本体仍然单一,论文没有证明 DROID 本身可以直接迁移到其他机械臂;主实验是 DROID 与少量目标域示范协训,不等于新任务零样本执行。三路立体相机、标定和移动部署提升了数据质量,也带来了设备成本、同步和维护复杂度。失败轨迹虽被保留和发布,但主要策略实验使用的是成功轨迹。作者还把如何与其他大数据集组合、如何在没有 in-domain 数据时适应新场景,以及全量数据和子集何时更合适列为开放问题。

总结:真实数据的价值来自可控的多样性

DROID 的贡献可以收束为三件事:用统一、可移动和可复现的硬件栈把数据采集扩展到多机构;用协议把场景、任务、物体、视角和交互位置的变化系统化;用标准 Diffusion Policy 证明这些变化能够转化为更好的分布外鲁棒性。

它没有解决所有机器人本体和动作空间的差异,也没有让模型脱离目标域示范就自动完成任意新任务。但它说明了一个重要方向:机器人数据集的竞争力不只看轨迹数,还要看这些轨迹是否来自足够多的真实世界条件。这也是 DROID 对后续通用机器人策略最可复用的启发。

参考资料

  1. DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
  2. DROID 论文 HTML 全文
  3. DROID 官方项目主页
  4. RSS 2024 论文 PDF

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

相关推荐
赛逸会展s2 小时前
2027北京机器人展六大展区规划发布
机器人
JavaPub-rodert7 小时前
具身智能行业技术全景:从感知、规划、控制到 VLA 与机器人学习
学习·机器人
赛逸会展s8 小时前
2027赛逸展机器人展新闻发布会在京举行
人工智能·机器人
swsauto9 小时前
URDF创建机器人(ROS2)
机器人
YMWM_10 小时前
机器人领域中的期刊和会议
人工智能·机器人
m0_5474866610 小时前
《工业机器人系统集成设计》全套PPT课件2026
机器人
科技新知11 小时前
宇树敲钟,机器人卖艺:一场资本与产业的错位赛跑
机器人
FII工业富联科技服务12 小时前
从“单机自动化”到“技能复用”:从WRC 2026拆解机器人模型、仿真、部署与数据回流
人工智能·机器人·自动化
tech讯息12 小时前
国内能否找到可靠的工业机器人方案?核心要看复杂工况适配与系统联动能力
人工智能·机器人