Qwen团队提出Ego2Robot, 第一人称视频助力具身VLA训练新数据

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

核心信息

  • 论文ID:arXiv:2608.02580
  • 作者:Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin
  • 机构:--(多位作者来自多个机构,Qin Jin 为中国人民大学/字节跳动,Chenxi Xiao 等来自北大/字节,Tong Zhang 来自北大/北京智源,团队与字节跳动 Seed / 北大相关)
  • 发布时间:2026-08-03
  • 链接arXiv | PDF | Project

摘要翻译

英文摘要

Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present Ego2Robot, a scalable pipeline that converts egocentric human manipulation videos into robot training data through action retargeting, robot-arm visual synthesis, and multi-level quality curation. Ego2Robot supports both curated datasets and in-the-wild videos, producing 18,561 hours of robot training data spanning 15 robot morphologies, making it the largest ego-to-robot dataset to date. To evaluate generalization, we extend RoboTwin2.0 with disentangled perturbation axes covering visual appearance, scene layout, embodiment morphology, and task semantics. Experiments show that joint pretraining on Ego2Robot-synthesized and robot data consistently improves out-of-distribution generalization across multiple perturbation types, with benefits validated on real-robot deployment.

中文翻译

学习可泛化的机器人操作策略需要大规模、多样化的示教数据。第一视角(Egocentric)人类操作视频蕴含丰富的场景和任务多样性,先前工作已表明,将此类视频通过重定向和渲染转化为机器人格式数据,能在小规模下产生有效的单任务策略。然而,这种方法能否为视觉-语言-动作(VLA)模型提供规模化预训练收益,仍未被探索。本文提出 Ego2Robot,一个可扩展的流水线,通过动作重定向、机器人手臂视觉合成以及多层级质量筛选,将第一视角人类操作视频转化为机器人训练数据。Ego2Robot 既支持已标注数据集,也支持无标注的野外视频,产出了横跨 15 种机器人形态、共 18,561 小时的机器人训练数据,是目前规模最大的 ego-to-robot 数据集。为评估泛化能力,本文在 RoboTwin2.0 上扩展出解耦的扰动轴,覆盖视觉外观、场景布局、具身形态和任务语义。实验表明,在 Ego2Robot 合成数据与真实机器人数据上联合预训练,能在多种扰动类型下持续改善分布外(OOD)泛化,且收益已在真实机器人部署上得到验证。

核心要点提炼

  • 研究背景:VLA 模型通过大规模机器人示教预训练取得进展,但机器人示教数据采集昂贵、费力且受限于硬件和交互多样性。
  • 研究动机:第一视角人类视频可大规模、多样化采集,但能否规模化地作为 VLA 预训练数据、提升分布外泛化,此前尚未被系统验证。
  • 核心方法:端到端 Ego2Robot 流水线,含动作对齐(hand-to-gripper 重定向+时序平滑)、视觉对齐(手臂分割/去除/机器人底座位姿搜索/深度感知渲染合成)、三级质量筛选。
  • 主要结果:联合预训练 Ego2R+Robot (1:1) 在 RoboTwin Randomized 达到 53.5%(+2.6),视觉、具身、语义扰动维度提升最显著,真实机器人部署(ARX ACone)也获得一致提升。
  • 研究意义:首次系统验证了 "retarget-and-render" 数据合成范式能为 VLA 模型提供规模化预训练收益,解锁了海量人类操作视频这一数据源。

研究背景与动机

领域现状

  • VLA 模型(RT-2、OpenVLA、π0、GR00T 等)通过大规模机器人示教预训练在操作任务上表现亮眼,但泛化能力受限于机器人数据的规模与多样性
  • 大规模机器人数据集倡议(Open X-Embodiment、DROID、AgiBotWorld)及低成本采集硬件(ALOHA、GELLO、UMI、DOBB E)虽扩充了示教来源,但采集仍受硬件成本、实验室环境多样性不足制约。
  • 人类操作视频是更广阔的数据源,已有工作通过视觉预训练(R3M、VIP)、奖励学习、运动先验(MimicPlay)、点轨迹(Flow)等方式利用人类数据,但这些间接方法仍需机器人数据来弥合具身鸿沟。

现有方法的局限性

  • 机器人示教:昂贵、费力、多样性受限,无法覆盖海量场景与任务。
  • 间接利用人类视频(视觉预训练/奖励学习/运动先验):难以完全弥合人-机器人具身鸿沟,仍依赖机器人数据训练或细化动作。
  • retarget-and-render 直接合成 (Phantom、EgoMimic):此前仅在小规模单任务下验证,未能系统性评估其对 VLA 预训练与分布外泛化的规模化收益。
  • 现有泛化评测基准(RoboTwin、LIBERO、CALVIN 等):将多种分布偏移捆绑成一个聚合分数,无法区分合成数据究竟在哪些维度带来收益。

研究动机

  1. 验证核心假设:尽管具身不同,第一视角操作视频蕴含可迁移的交互规律,若正确对齐可互补机器人数据。
  2. 将 retarget-and-render 范式规模化到 18,561 小时 × 15 种形态,提供首个规模化系统评估。
  3. 引入解耦扰动评估,精确归因合成数据在视觉/场景/具身/语义各维度的泛化收益与局限。

研究问题

核心研究问题

大规模 ego-to-robot 合成数据能否作为 VLA 模型的有效预训练数据,特别是在提升分布外泛化方面,并与真实机器人数据形成互补?

子问题

  1. 如何将第一视角手部操作视频规模化转化为具身特定的机器人训练数据?
  2. 合成数据的泛化收益究竟体现在哪些维度(视觉、场景、具身、语义)?
  3. 合成数据在哪些维度受限于领域鸿沟、无法提供收益?
  4. 在真实机器人上,合成数据能否用小样本示教实现多任务部署?

方法概述

核心思想

给定第一视角人类手部操作视频,Ego2Robot 通过三个阶段的流水线将其转化为具身特定的机器人训练数据:动作对齐 (将手部姿态重定向为机器人末端执行器轨迹并进行时序平滑)、视觉对齐 (去除人手臂并渲染合成机器人手臂)、质量筛选(在轨迹/帧/片段三级过滤低质量样本)。流水线支持两条输入路径:Path A 接受带手部姿态标注的 ego 数据集,Path B 处理无标注视频(先用 WiLoR 逐帧重建、DynHaMR 时序优化估计手部姿态;长视频用 Qwen3.5 分割成子任务)。得到手部姿态后,两条路径共享统一流水线,可为 15 种机器人形态并行生成训练数据。

方法框架

整体架构
复制代码
第一视角操作视频(标注数据集 / 无标注野外视频)
        │
        ▼
① 动作对齐 Action Alignment
   手→平行夹爪重定向 + 时序平滑(Savitzky-Golay + SLERP) + 动作速度对齐(按源下采样)
        │
        ▼
② 视觉对齐 Visual Alignment
   手臂分割(SAM3) → 手移除(ProPainter补画) → 机器人底座位姿搜索(SE(3)优化+IK) → 深度感知合成渲染
        │
        ▼
③ 质量筛选 Quality Curation
   L1流水线内(IK失败/自碰撞/动作离群) → L2统计(极端动作/不连续) → L3 VLM语义一致性审查
        │
        ▼
15 种形态 × 4 源 ≈ 18,561 小时 合成机器人训练数据
模块1:动作对齐(Action Alignment)
  • 功能:将手部姿态转化为平行夹爪末端执行器轨迹。
  • 输入:21 个手部关键点(MANO 姿态)。
  • 输出:末端执行器位姿轨迹(TCP 位置 + 夹爪开合宽度 + 抓取朝向)。
  • 处理流程
    1. Hand-to-Gripper 重定向 :从手关键点提取夹爪表示。定义虚拟指尖为食指与中指指尖的加权混合:
      p vf = 0.7 ⋅ p index + 0.3 ⋅ p middle \mathbf{p}\text{vf} = 0.7 \cdot \mathbf{p}\text{index} + 0.3 \cdot \mathbf{p}\text{middle} pvf=0.7⋅pindex+0.3⋅pmiddle
      TCP 位置与夹爪开合宽度为:
      p tcp = p thumb + p vf 2 , w = ∥ p thumb − p vf ∥ \mathbf{p}
      \text{tcp} = \frac{\mathbf{p}\text{thumb} + \mathbf{p}\text{vf}}{2}, \quad w = \|\mathbf{p}\text{thumb} - \mathbf{p}\text{vf}\| ptcp=2pthumb+pvf,w=∥pthumb−pvf∥
    2. 抓取朝向 :右手/左手符号 s = ± 1 s=\pm1 s=±1 保证朝向一致,构成右手正交系( x \mathbf{x} x 逼近方向、 y \mathbf{y} y 夹爪法向、 z \mathbf{z} z 抓取轴):
      z = s   ( p thumb − p vf ) w , y = z × d ∥ z × d ∥ , x = y × z \mathbf{z} = \frac{s\,(\mathbf{p}\text{thumb} - \mathbf{p}\text{vf})}{w}, \quad \mathbf{y} = \frac{\mathbf{z} \times \mathbf{d}}{\|\mathbf{z} \times \mathbf{d}\|}, \quad \mathbf{x} = \mathbf{y} \times \mathbf{z} z=ws(pthumb−pvf),y=∥z×d∥z×d,x=y×z
    3. 时序平滑:位置和宽度用 Savitzky-Golay 滤波,朝向用高斯加权 SLERP,抑制逐帧检测高频噪声。
    4. 动作速度对齐:第一视角手部动作远快于遥操作数据,训练时按源下采样(ANT/EgoDex→60%帧率约慢1.7×,EgoVerse→45%约慢2.2×,ViTRA→25%约慢4×)。
  • 关键技术:MANO 手模型、WiLoR 手姿态重建、DynHaMR 时序优化、Savitzky-Golay 滤波、SLERP 球面插值。
模块2:视觉对齐(Visual Alignment)
  • 功能:将 ego 视频从"展现人手"转为"同一场景中机器人手臂操作"。
  • 输入:原始 ego 帧 + 重定向后的轨迹。
  • 输出:机器人合成视频帧 + 相机系 EEF 动作 + 相机参数 + 文本指令。
  • 处理流程
    1. 手臂分割:SAM 3 分割人手臂区域,提供时序一致掩码。
    2. 手移除:ProPainter 做时序一致视频补画,去除人手臂、重建背景。
    3. 机器人底座位姿搜索 :核心难点。ego 手部轨迹是"无具身"的,没有物理机器人底座可参考。需寻找底座位姿 T base = ( t , R ) ∈ S E ( 3 ) \mathbf{T}\text{base}=(\mathbf{t},\mathbf{R})\in SE(3) Tbase=(t,R)∈SE(3) 使重定向轨迹对目标形态运动学可行:
      T base ∗ = arg ⁡ max ⁡ T base 1 ∣ K ∣ ∑ k ∈ K 1 IK ( T base − 1 T k ee ) is feasible \mathbf{T}
      \text{base}^* = \arg\max_{\mathbf{T}\text{base}} \frac{1}{|\mathcal{K}|} \sum{k \in \mathcal{K}} \mathbb{1}\left\\text{IK}(\\mathbf{T}_\\text{base}\^{-1} \\mathbf{T}_k\^\\text{ee}) \\text{ is feasible}\\right Tbase∗=argTbasemax∣K∣1k∈K∑1IK(Tbase−1Tkee) is feasible
      在轨迹质心周围网格搜索候选底座位姿,受各形态最大到达距离 r max r_\text{max} rmax 约束,逐一用 MuJoCo IK 验证关键帧,选取可行率最高者。对 15 种形态独立执行。
    4. IK 与渲染:给定优化后的底座,逐帧在 MuJoCo 求解 IK,从原始相机视角渲染机器人。
    5. 深度感知合成 :按深度顺序将机器人合成到补画场景中:
      I final ( u , v ) = { I robot ( u , v ) if D robot ( u , v ) < D scene ( u , v ) ∧ M robot ( u , v ) = 1 I inpaint ( u , v ) otherwise I_\text{final}(u,v) = \begin{cases} I_\text{robot}(u,v) & \text{if } D_\text{robot}(u,v) < D_\text{scene}(u,v) \land M_\text{robot}(u,v) = 1 \\ I_\text{inpaint}(u,v) & \text{otherwise} \end{cases} Ifinal(u,v)={Irobot(u,v)Iinpaint(u,v)if Drobot(u,v)<Dscene(u,v)∧Mrobot(u,v)=1otherwise
  • 关键技术:SAM 3、ProPainter、MuJoCo IK、深度感知合成(深度传感器或单目深度估计)。
模块3:质量筛选(Quality Curation)
  • 功能:三级过滤低质量样本,去除重定向失败与视觉伪影。
  • L1(流水线内):IK 失败、自碰撞、动作离群、工作空间覆盖不足的帧在处理时被标记。
  • L2(统计):去除动作极值、突变不连续、无效帧占比过高的轨迹。
  • L3(VLM 一致性):用视觉语言模型(Qwen3.5)审查合成视频,核对渲染机器人动作与原始操作意图的语义一致性。
数据表示与规模
  • 动作表示 :采用相机系相对 EEF 动作(在观察者坐标系中表达末端位移)。因 ego 视频相机位姿多样未知,世界系动作需逐视频标定且各源动作空间不兼容;相机系相对动作天然统一不同相机设置与机器人形态。
  • 数据源:ANT(7h 自建拾取放置+手部姿态标注)、EgoDex(732h)、ViTRA(249h)、EgoVerse(954h),共约 1,940 小时 ego 数据。
  • 产物:15 种形态 × 质量筛选后共 18,561 小时合成机器人训练数据。

方法架构图

图1:Ego2Robot 流水线总览。通过动作对齐、视觉对齐与质量筛选,将 ego 视频转化为横跨 15 种形态的 18,561 小时机器人训练数据。

图2:数据规模分布(数据源构成饼图)。

关键创新

  1. 规模化 retarget-and-render 流水线 - 首次将该范式扩展到 18,561 小时 × 15 种形态,是迄今最大 ego-to-robot 数据集,突破以往小规模单任务局限。
  2. 无具身轨迹的机器人底座位姿搜索 - 提出 SE(3) 底座位姿优化,网格搜索 + IK 可行率最大化,解决 ego 手部轨迹"无物理底座可参考"的独特难题。
  3. 解耦泛化评测框架 - 在 RoboTwin2.0 上扩展出 11 个独立扰动设置(视觉/场景/具身/语义四轴),可精确归因合成数据的泛化收益来源。
  4. 相机系相对 EEF 动作表示 - 天然统一不同相机设置与 15 种形态,无需逐视频外部标定。

实验结果

实验目标

验证两个问题:(1) Ego2Robot 合成数据与真实机器人数据联合预训练能否提升分布外泛化?(2) 收益具体来自哪个泛化维度(视觉、场景、具身、语义)?

数据集

数据集 规模 用途 数据类型
RoboTwin2.0(扩展) 50 个 clean 任务×50 示教 微调+评测 双臂仿真
EBench 7 个精密桌面任务 独立评测 Isaac Sim 仿真
DROID+AgibotWorld+InternData ~6,565h 真实机器人预训练 机器人示教
Ego2Robot 合成数据 18,561h(15 形态) 合成预训练 ego→robot 合成
真实 ARX ACone 5 个长时程任务 真机验证 真实遥操作

实验设置

模型架构

Qwen3.5-4B 作为视觉-语言骨干 + Diffusion Transformer (DiT) 动作头。模型预测相机系相对 EEF 表示的 32 步动作块,8 步扩散。

基线方法 / 配置

比较 4 种预训练配置:

  • (i) Robot-only:仅真实机器人数据(DROID+AgibotWorld+InternData,~6,565h)
  • (ii)--(iv) Ego2R+Robot:合成数据与机器人数据按 1:3、3:1、1:1 混合
评估指标

成功率(%),在 RoboTwin Randomized 及四个解耦维度(Visual/Scene/Embodiment/Task)下评估,每任务 50 个 episode。

训练协议

所有预训练用相同超参:8 GPU、batch 12/GPU、LR 1e-5→1e-6 余弦衰减、bf16、200K 步。因步数与 batch 相同,各配置处理相同样本量(~19.2M 帧),保证公平。微调加载预训练权重 + ColorJitter,50K 步。

主要结果

主实验结果
预训练配置 Clean Rand Visual Scene Embody Task EBench Avg
Robot-only 62.2 50.9 61.4 52.9 23.8 46.2 39.6
Ego2R+Robot (1:3) 61.4 (-0.8) 51.0 (+0.1) 61.2 (-0.2) 52.5 (-0.4) 21.9 (-1.9) 49.5 (+3.3) 47.4 (+7.8)
Ego2R+Robot (3:1) 64.1 (+1.9) 49.2 (-1.7) 62.7 (+1.3) 54.3 (+1.4) 28.2 (+4.4) 51.6 (+5.4) 51.7 (+12.1)
Ego2R+Robot (1:1) 68.1 (+5.9) 53.5 (+2.6) 67.3 (+5.9) 56.9 (+4.0) 27.2 (+3.4) 54.1 (+7.9) 49.8 (+10.2)
逐扰动细分解
预训练配置 BG Light Color Height Clutter Camera ARX UR5 Franka Obj Lang
Robot-only 66.6 58.2 59.4 60.1 48.3 50.4 44.1 20.2 7.0 29.3 63.1
Ego2R+Robot (3:1) 65.5 60.9 61.8 62.0 49.2 51.6 47.6 31.4 5.6 40.0 63.1
Ego2R+Robot (1:1) 70.3 65.8 65.8 62.4 52.0 56.3 51.2 25.0 5.3 39.6 68.5
结果分析
  • 联合训练提升 OOD 泛化:1:1 在七列中占五列最优,RoboTwin Randomized 达 53.5%(+2.6),同时保持 Clean 68.1%。1:3 仅边际收益,3:1 和 1:1 提升显著。
  • 视觉外观收益最大:1:1 在三个视觉因素上均提升------背景(+4)、光照(+8,源于 ego 视频场景多样性)、机器人颜色(+6,源于 15 形态多形态渲染)。
  • 场景布局中等增益:相机偏移鲁棒性 +6,源于 ego 视频天然多样的头部姿态与视角。
  • 具身迁移受益于多形态数据:ARX 从 44→51(1:1),UR5 在 3:1 达峰 31,直接受益于预训练接触 15 种形态。Franka 仍低于 7%,反映其与训练具身的大运动学差距。
  • 任务语义持续提升:未见物体泛化 29%→40%(3:1 +11),源于 ego 视频的多样物体交互;改述指令鲁棒性 1:1 达 69%,受益于更广的指令多样性。
  • EBench 证实高视角收益:EBench 高架相机更接近 ego 视角,3:1 最优(51.7,+12.1),提示当视角偏置部分匹配时联合训练收益被放大。

消融实验

实验设计

用 ego-only 预训练(不含机器人数据)隔离流水线贡献,在 RoboTwin Randomized 上评估。

消融结果和分析
  • 流水线对齐不可或缺:原始 ego 联合训练仅 28.1%;经流水线处理(单形态 Ego2R)提升到 31.7%,+3.6 验证了视觉与动作对齐阶段的价值。
  • 更多形态有帮助:从 1 到 15 形态持续提升(31.7→33.5)。在 15 形态 Ego2R 数据旁追加原始 ego 数据进一步跃升到 37.3%------原始 ego 数据实际充当第 16 种"形态",其视觉外观与动作分布略异,进一步丰富了预训练多样性。

图3:消融实验------流水线价值与形态扩展,纵轴为 RoboTwin Randomized 成功率。

真实机器人实验

图4:真实机器人结果。ARX ACone 平台上五个任务的成功率。


图5:真实机器人 rollout 关键帧(五个评测任务)。

在 ARX ACone 平台上评估 5 个长时程任务:水果放入篮子、积木放入抽屉、叠毛巾、垃圾扫入垃圾桶、拧入螺丝。每任务采集 20 个遥操作示教,另录制约 7 分钟/场景的 ego 手部操作 play 视频,经流水线生成 ACone 特定合成示教。

对比三种配置:Robot-only (机器人数据预训练+遥操作微调)、Mix (Ego2R+Robot 1:1 预训练+相同示教)、Mix+Ego2R Play(微调时遥操作示教与流水线转换的 ego-play 数据 1:1 混合)。

Mix+Ego2R Play 在全部五任务最优,最大增益在 Put Blocks(+14)和 Insert Screw(+13)。Mix 预训练本身已优于 Robot-only,Ego2R Play 数据提供进一步一致增益------证明随意录制的 ego 视频可经流水线转化为有效训练信号。

深度分析

研究价值评估

理论贡献
  • 贡献1:规模化验证 retarget-and-render 数据合成范式
    • 创新点:首次将 ego-to-robot 合成规模化到 18,561 小时 × 15 种形态,突破先前小规模单任务局限,系统证明该范式可为 VLA 预训练带来收益。
    • 学术价值:回答了"人类视频能否规模化作为机器人预训练数据"这一开放问题。
    • 影响范围:VLA 预训练、具身数据工程、机器人学习。
  • 贡献2:解耦泛化评测框架
    • 创新点:将 RoboTwin2.0 扩展出 11 个独立扰动设置,沿视觉/场景/具身/语义四轴解耦,精确归因收益来源。
    • 学术价值:弥补现有基准"捆绑扰动"无法归因的缺陷,为后续评测建立更严谨的协议。
    • 影响范围:机器人泛化评测、基准构建。
  • 贡献3:无具身轨迹的底座位姿搜索
    • 创新点:提出 SE(3) 底座位姿优化(网格搜索+IK 可行率最大化),解决 ego 手部轨迹无物理底座可参考的独特难题。
    • 学术价值:为 ego→robot 合成提供关键运动学可行性保障。
    • 影响范围:跨具身数据合成、运动学规划。
实际应用价值
  • 应用场景1:机器人策略预训练数据扩充
    • 适用性:用海量人类操作视频补充稀缺的机器人示教。
    • 优势:成本低、场景任务多样性远超遥操作。
    • 潜在影响:显著降低机器人数据采集门槛。
  • 应用场景2:真实机器人快速部署
    • 适用性:用少量遥操作示教 + 随意录制的 ego play 视频实现多任务部署。
    • 优势:真机上 Mix+Ego2R Play 全任务最优,Put Blocks/Insert Screw 各 +14/+13。
    • 潜在影响:推动"录一段手部操作视频即可训练机器人"的平民化部署。
领域影响
  • 短期影响:为 VLA 预训练提供新的规模化数据源,带动 ego 数据合成方向。
  • 中期影响:解耦评测协议或成为机器人泛化评估的新标准。
  • 长期影响:可能促使"人类视频即机器人数据"范式,解锁互联网级人类操作视频。

方法优势详解

优势1:规模化与多样性
  • 描述:18,561 小时 × 15 形态,迄今最大 ego-to-robot 数据集。
  • 技术基础:统一流水线支持并行生成多形态数据。
  • 实验验证:3:1/1:1 配置在多项 OOD 指标显著提升。
  • 对比分析:远超 Phantom/EgoMimic 的小规模验证。
优势2:收益可归因、评估严谨
  • 描述:解耦扰动框架精确揭示收益维度(视觉/具身/语义为主)。
  • 技术基础:11 个独立扰动设置 + 相机系相对动作表示。
  • 实验验证:逐扰动细分解表清晰展示每维增减。
  • 对比分析:优于 RoboTwin 等捆绑扰动基准。
优势3:低门槛真机应用
  • 描述:ego play 视频可转化为有效训练信号,真机一致增益。
  • 技术基础:底座位姿搜索 + 深度感知渲染。
  • 实验验证:5 任务全部最优。
  • 对比分析:展示实际部署价值。

局限性分析

局限1:丢弃手指精细动作
  • 描述:重定向将手部姿态映射为平行夹爪,丢弃细粒度手指关节。
  • 表现:无法覆盖灵巧手类技能。
  • 原因:采用平行夹爪表示以简化。
  • 影响:技能范围受限。
  • 解决方案:扩展到多指灵巧手重定向。
局限2:视觉合成伪影
  • 描述:视觉对齐依赖补画与深度感知合成。
  • 表现:重度遮挡或复杂光照下可能引入伪影。
  • 原因:补画/合成保真度限制。
  • 影响:增大视觉域鸿沟。
  • 解决方案:用生成式模型提升渲染保真度。
局限3:评测范围受限
  • 描述:评测局限于 RoboTwin2.0 任务范围。
  • 表现:任务与形态覆盖面有限。
  • 原因:基准任务集约束。
  • 影响:泛化结论普遍性受限。
  • 解决方案:扩展到更广任务与形态配置。

适用性与场景分析

适用场景
  • 场景1:VLA 大规模预训练:需要补充数据多样性的场景,适用------提供海量低成本多样化数据。
  • 场景2:真机快速部署:示教稀少但可录制 ego 视频的场景,适用------ego play 数据补充示教。
  • 场景3:跨形态迁移:需要让策略泛化到多种机器人的场景,适用------15 形态预训练覆盖。
不适用场景
  • 场景1:灵巧手精细操作:需手指级控制,不适用(平行夹爪局限),替代方案:专用灵巧手数据/触觉方法。
  • 场景2:强物理接触任务:合成数据缺真实接触动力学,替代方案:真实机器人示教或物理仿真。
相关推荐
szxinmai主板定制专家8 小时前
基于 RK3588 + Xilinx Kintex-7 FPGA 异构工业主控板设计方案
arm开发·人工智能·嵌入式硬件·fpga开发·zynq
青山科技分享8 小时前
跨境电商如何做GEO,让商品被AI搜索推荐?
大数据·人工智能·跨境电商
Cloud云卷云舒8 小时前
HaishanDB(海山)|磐维数据库|YashanDB(崖山)深度对比分析
数据库·人工智能·海山数据库·haishandb·移动云海山数据库
泰迪智能科技8 小时前
滇西科技师范学院AI人工智能实验室案例分享
人工智能·科技
xywww1688 小时前
真实后台页实测:Opus 5 看图写前端的可用边界在哪
linux·服务器·前端·数据库·人工智能·gpt
文心快码BaiduComate8 小时前
文心快码能力扩展、记忆、代码可视化上线
人工智能·ai编程·vibecoding
安逸sgr8 小时前
RAG 检索到了正确内容,但模型回答仍然错误,可能是什么原因?
人工智能·ai·大模型·agent·智能体
zhangfeng11338 小时前
Open-AutoGLM 手机端 AI Agent 框架 用自然语言操控手机
人工智能·智能手机
安逸sgr8 小时前
神经网络是怎么工作的?从神经元到多层感知机
人工智能·ai·大模型·agent·智能体