A Survey on Vision--Language--Action Models for Embodied AI
- 原文摘要
- VLA的定位 :VLA 是从 LLM / VLM 发展而来的多模态模型,最大的特点是在 Vision + Language 的基础上进一步具备 Action Generation 能力,用于语言指令驱动的机器人任务。
- 作者给出的VLA的三条研究路线 :
- VLA Components------研究 VLA 本身的组成模块。
- VLA-based Control Policies------研究如何让模型更好地预测 low-level action。
- High-level Task Planner------研究模型如何将Long Horizon的指令拆成sub-tasks,做任务完成规划
- 此外,本文还全面总结了相关研究资源,包括数据集、模拟器以及评测基准。
1. Introduction
1.1 VLA定义
- 机器人任务需要同时处理:视觉观察 + 语言指令 + 动作输出
- VLA定义:根据当前观察和任务要求,决定机器人下一步采取什么动作的决策模型。
- VLA的特点 :
- versatility:能完成更多种类的任务;
- dexterity:能够完成更加灵巧、复杂的动作;
- generalizability:面对新环境、新物体、新任务时仍有一定能力。
- 所以 VLA 的目标不只是做工业环境里固定、重复的任务,而是逐渐走向更加开放的家庭环境。
1.2 VLA的发展

-
Unimodel to Multimodal:
- CV:AlexNet 等视觉模型;
- NLP:RNN → Transformer;
- RL:DQN 等强化学习模型。
- 随着这些领域成熟,开始出现处理多个模态的模型。
-
机器人领域的变化:
-
传统机器人 RL policy 通常是:
针对某个固定任务训练一个模型。
-
例如专门训练一个:
"抓取物体"的 policy。
-
但现在希望得到的是类似 LLM/VLM 的 multitask policy:
同一个模型可以根据不同语言指令完成很多不同机器人任务。
-
-
VLA架构
-
Vision
→ Vision Encoder
→ Visual Embedding
-
Language Instruction
→ LLM Token Embedding
→ Language Embedding
-
Visual Embedding + Language Embedding
→ 多模态对齐/融合
→ LLM / Action Decoder
→ Robot Action
将 VLM 的视觉-语言理解能力迁移到机器人领域,再通过 robot data finetuning,让模型学会输出机器人动作。
-
1.3 VLA的三条研究路线
VLA 与三条主要研究路线密切相关,如图 2(b) 中的时间线和图 3 中的分类体系所示

-
VLA Components:例如 PVR、动力学学习(dynamics learning)、世界模型(world models)以及推理
-
Low-level Control Policy:最典型的VLA,在这一类方法中,语言指令和视觉观察被输入控制策略,控制策略随后生成底层动作,例如平移和旋转,因此 VLA 非常适合作为机器人控制策略。
机器人具体应该怎么动?
-
High-level Task Planner:负责进行任务分解:这些模型将长时程任务分解成一系列子任务,然后利用这些子任务逐步引导 VLA 达成整体目标。如图 4
机器人接下来应该做什么?

-
Hierarchical Framework
txtHigh-level Planner ↓ Subtask ↓ Low-level VLA Policy ↓ Robot Action- High-level Planner:更看重复杂推理、规划能力,可以用容量大的模型;
- Low-level Policy:更看重实时性、速度和控制精度。
1.4 VLA扩展定义
-
原始 VLA:
大型 VLM → 适配机器人数据 → 输出 Robot Action
- 典型代表就是 RT-2 这一类模型。
-
这篇工作把VLA 广义定义为:
只要模型使用 Vision + Language,并输出 Robot Action,就可以被归入 VLA。
-
原本那种:
基于 LLM / Large VLM 构建的大型 VLA,在这里被称为LVLA(Large VLA)
- 也就是 LVLA 是 VLA 的一个子类。
-
2. Background
-
机器人学习通常也可以被建模为一个强化学习问题,并表示成一个马尔可夫决策过程(Markov Decision Process,MDP) ,其中包含状态 (sss)、动作 (aaa) 和奖励 (rrr)。
- 部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP)
- 此时机器人只能观察到环境状态中的一部分。这也是为什么具身智能中 history / memory 很重要:当前这一帧看不到的东西,可能需要依赖之前的观察来推断。
- MDP基本交互过程
- 机器人在第 (t) 个时间步:st→at→rt→st+1s_t \rightarrow a_t \rightarrow r_t \rightarrow s_{t+1}st→at→rt→st+1
- (s_t):当前状态 state
- (a_t):当前执行的动作 action
- (r_t):执行动作后获得的奖励 reward
- (s_{t+1}):执行动作之后的新状态
- MDP完整轨迹:(\tau = (s_1,a_1,r_1,\ldots,s_T,a_T,r_T))
- 机器人在第 (t) 个时间步:st→at→rt→st+1s_t \rightarrow a_t \rightarrow r_t \rightarrow s_{t+1}st→at→rt→st+1
- 机器人的学习方式:RL or Imitation Learning(SFT)
- 部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP)
-
Language-conditioned Robot Policy
π(at∣p,s≤t,a<t) \pi(a_t\mid p,s_{\leq t},a_{<t}) π(at∣p,s≤t,a<t)
-
其中
- (p):语言指令;
- (s_{\leq t}):截至时刻 (t) 的状态历史;
- (a_{<t}):时刻 (t) 之前执行过的动作;
- (a_t):现在需要预测的动作。
-
其中:s≤t=(s1,s2,...,st)s_{\leq t}=(s_1,s_2,\ldots,s_t)s≤t=(s1,s2,...,st),而:a<t=(a1,a2,...,at−1)a_{<t}=(a_1,a_2,\ldots,a_{t-1})a<t=(a1,a2,...,at−1)
- 所以整个公式可以理解为:
Language Instruction⏟p+State History⏟s≤t+Action History⏟a<t→Current Action⏟at\underbrace{\text{Language Instruction}}{p} + \underbrace{\text{State History}}{s_{\leq t}} + \underbrace{\text{Action History}}{a{<t}} \rightarrow \underbrace{\text{Current Action}}_{a_t}p Language Instruction+s≤t State History+a<t Action History→at Current Action
- 这是后面 VLA 最基础的数学形式之一。
-
3. Vision--Language--Action Models
3.1 Components of VLA
3.1.1 Reinforcement Learning
A. RL 和 早期VLA
-
整个机器人任务是一条 sequence:s1,a1,r1,s2,a2,r2,...,sT,aT,rTs_1,a_1,r_1,s_2,a_2,r_2,\ldots,s_T,a_T,r_Ts1,a1,r1,s2,a2,r2,...,sT,aT,rT
既然 RL trajectory 本身就是一个序列,那为什么不能像 NLP 建模 token sequence 一样,用 Transformer 建模 trajectory?
-
这就是 Decision Transformer、Trajectory Transformer 等工作的核心启发。
Robot Decision Making ≈ Sequence Modeling
-
这里的想法就是把state,action,reward都当作token作为transformer的输入
B. RL 和 LLM
-
RL → LLM / Robot
-
RLHF:
-
传统 LLM 中,RLHF 的目标是:让模型输出更加符合人类偏好。
-
机器人里面也可以采用类似思路:人类告诉机器人哪些行为更好、更安全,然后使用这种反馈优化机器人 policy。
-
-
Skill-based RL: 解决任务中reward稀疏的问题
-
-
LLM → RL
-
Reflexion:语言反馈
-
传统 RL:失败 → reward → gradient update → 修改模型参数
-
Reflexion 的思想不同:失败 → 产生语言形式的反思 → 下一次根据反思调整行为
也就是说,feedback 本身变成自然语言。
-
-
Eureka:LLM 生成 reward。
-
3.1.2 Pretrained Visual Representations
-
视觉编码器的效果会直接影响 VLA 的性能,因为视觉编码器需要提供当前状态 (s_t) 的关键信息,例如物体类别、位置以及可供性(affordance)。

-
CLIP:经典ITR不作介绍
-
R3M:时间对比学习和视频-语言对齐
- 时间对比学习的目标是减小时间上相邻视频帧之间的表示距离,同时增大时间上相隔较远的视频帧之间的表示距离------让Encoder捕获视频序列中的时间关系。
- 视频-语言对齐------VTR
-
MVP:
- MVP将计算机视觉中的掩码自编码器(Masked Autoencoder,MAE)应用到了机器人数据集上。
- MAE 会对输入 ViT 的一部分图像 patch 进行遮挡,然后训练模型重建这些被遮挡的 patch。
- Encoder(可见 patch)→ 把预测用的 mask token 拼回去 → Decoder(轻量)→ 输出被遮住 patch 的像素值。
- 这种方法与 BERT 中使用的掩码语言建模非常相似,并属于自监督学习方法(因为不需要人工去做label)
-
RPT:
-
预训练目标不仅包括重建视觉输入,还包括机器人动作 以及本体感知状态(proprioceptive states)
-
RPT 认为机器人数据里不只有视觉,还有:
- Action
- Proprioception
-
这里的 proprioceptive state 可以理解成:
机器人对自己身体状态的感知,如
-
joint angle;joint velocity;gripper state;end-effector pose。
-
所以 RPT 希望 representation 不仅理解:
"外部世界长什么样",同时理解:"机器人自己当前是什么状态,以及执行了什么动作。"
-
-
-
Voltron:
- 在 MAE 目标中进一步加入语言条件 和语言生成,提出了新的预训练目标。
- Voltron 使用 encoder-decoder Transformer 结构,在预训练过程中交替执行两种任务:基于语言条件的掩码图像重建,以及根据被掩码的图像生成语言。
- **任务一:**Language + Masked Image→ Reconstruct Image
- **任务二:**Masked Image→ Generate Language
-
VC-1:
-
VC-1对此前的 PVR 进行了深入研究,并通过在多个数据集上系统探索最优的 ViT 配置,提出了一个性能更强的 PVR 模型。
-
此外,他们还在多种 manipulation 和 navigation 数据集上,将自己的模型与此前方法进行了全面比较,从而分析哪些关键因素能够提升 PVR 的性能。
VC-1的意义:系统分析哪些因素真正决定 robot PVR 的质量。
-
-
DINOv2:
-
使用自蒸馏框架,其中 teacher 网络和 student 网络接收同一张图像的不同视图,并使二者编码得到的视觉表示相匹配。
-
student 网络通过梯度下降进行更新,而 teacher 网络则通过 student 网络参数的指数移动平均(EMA)进行维护。
-
具体做法:
-
同一张图片生成两个不同 view:
-
View A→ Teacher→ Representation A
-
View B→ Student→ Representation B
-
让两个 representation 尽可能一致。
-
-
teacher 的参数逐渐跟随 student(EMA方式):θteacher←mθteacher+(1−m)θstudent\theta_{\text{teacher}} \leftarrow m\theta_{\text{teacher}} + (1-m)\theta_{\text{student}}θteacher←mθteacher+(1−m)θstudent
-
-
-
I-JPEA:
-
受JPEA启发,它通过比较不同图像 patch 的 embedding,构建了一种primitive的内部世界模型。
-
具体做法:Masked Image→预测被遮挡区域的 embedding
-
注:MAE是预测被遮挡区域的pixels
-
I-JEPA 有三个部件:
- Context Encoder(可训练):只看可见区域(context block),输出可见 patch 的特征。
- Target Encoder (EMA 更新,不回传梯度):看整张原图,输出每个 patch 的"目标特征"。它的参数用 Context Encoder 的指数滑动平均拷贝过来,防止模型作弊/坍缩。
- Predictor(小 ViT):拿 context 特征 + 目标位置上的 mask token,预测"被遮住的那几个 target block 在 Target Encoder 里的特征向量"。
- 损失:Predictor 输出的特征 和 Target Encoder 输出的特征算 L2 距离(在表征空间,不在像素空间)。
-
-
-
Theia:
- 提出将多个不同的视觉基础模型蒸馏到一个统一模型中。
- 通过融合多种视觉信息,例如分割、深度和语义,Theia 在使用更少数据和更小模型规模的情况下,性能超过了此前的 PVR。
3.1.3 Video Representations
本节主要讲解的是给 VLA 提供不同模态输入表征的方法
-
视频本质上是图像序列,因此最简单的视频表示方式,就是将每一帧对应的普通 PVR 拼接起来。
-
然而,由于视频天然包含多个视角,因此除了前面提到的表示方式之外,还可以采用一些视频特有的表示学习技术。
→ 每帧 PVR:最简单的方法
→ Temporal representation:例如时间对比学习
→ 3D representation:NeRF / 3D-GS
→ Physics-aware representation:PhysGaussian
→ Multimodal information:Audio
-
-
NeRF 和3D高斯:这里不再介绍,理解为可通过视频构建3D场景表征即可。这里讲一下文中提到的3D-GS的应用:
-
PhysGaussian ------ 用于 Dynamics
-
3D Gaussians 可以通过 physics-based simulation 被 deformation。
不只是建立一个静态的 3D 场景,还可以模拟其中物体如何发生物理变化。
也就是利用 3D representation 来生成/预测物体未来如何变化。
-
-
UniGS ------ 给 VLM 提供 3D Representation
- 也就是说把3D 表征作为VLM的输入,让VLM获取空间信息
-
-
作者还提到视频中的Audio同样可以作为机器人的信息来源
3.1.4 Dynamics Learning
本节主要讲解的是对于整个VLA框架的一个学习方式
-
动力学学习定义:让模型 (f(\cdot)) 理解正向动力学(forward dynamics)或者逆向动力学(inverse dynamics)
-
正向动力学的目标是:给定当前状态和一个动作,预测执行该动作之后产生的下一个状态
s^t+1=ffwd(st,at) \hat{s}{t+1} = f{\mathrm{fwd}}(s_t,a_t) s^t+1=ffwd(st,at)
-
逆向动力学的目标则是:给定前一个状态和已知的后一个状态,推断从前一个状态转移到后一个状态所需要执行的动作。
a^t=finv(st,st+1) \hat{a}t = f{\mathrm{inv}}(s_t,s_{t+1}) a^t=finv(st,st+1)
-
一些方法还会将这些动力学学习目标转化成对被打乱的状态序列进行重新排序的问题。
- 例如真实顺序是:s1→s2→s3→s4s_1 \rightarrow s_2 \rightarrow s_3 \rightarrow s_4s1→s2→s3→s4,训练时故意打乱:s3,s1,s4,s2s_3,s_1,s_4,s_2s3,s1,s4,s2,然后让模型恢复
-
-
正向动力学方法与 PVR 中使用的图像预测或视频预测预训练方法非常相似:

-
这个关系很好理解。sts_tst是当前图像,那么 forward dynamics:st+at→st+1s_t+a_t \rightarrow s_{t+1}st+at→st+1本质上就很像:
根据当前画面预测未来画面。
- 所以:Video Prediction和Forward Dynamics Learning在机器人领域存在很大的联系。区别主要在于 forward dynamics 往往还显式考虑action。
-
-
**Vi-PRoM **:
- 第一个训练目标是对比式自监督学习,用来区分不同的视频。
- 第二个训练目标是时间动力学学习,其目标是恢复被打乱的视频帧顺序。
- 第三个训练目标是使用伪标签进行图像分类。
-
MIDAS:
- 在预训练阶段加入了一个逆向动力学预测任务:(s_t,s_{t+1} \rightarrow a_t)
-
SMART:
- 提出了一套包含三个训练目标的预训练方案:正向动力学预测、逆向动力学预测,以及随机掩码的 hindsight control
- 正向动力学预测任务负责预测下一个 latent state,而逆向动力学预测任务则负责预测此前执行的动作。
- 在 hindsight control 任务中,完整的控制序列会被提供给模型,但其中一些动作会被随机遮挡,模型需要恢复这些被遮挡的动作。
- hindsight control:
- 原始任务:机械臂把物体推到指定位置 X,但实际推到了位置 Y。
- 动作序列:a1,a2,a3,a4,a5a_1, a_2, a_3, a_4, a_5a1,a2,a3,a4,a5(推到了 Y)。
- 传统 RL:这组动作对应目标 X,奖励为 0。
- Hindsight 操作:将目标从 X 改为 Y,并重新定义这组动作为成功达成目标 Y。
- hindsight control 看的是整个 control sequence,因此模型可以利用较长范围的上下文恢复中间 action,提高模型的global / long-term temporal dependency
- hindsight control:
-
Mask DP:
- MaskDP 提出了 masked decision prediction 任务,其中 state token 和 action token 都会被随机遮挡,然后要求模型对它们进行重建。
- 这样可以同时学FD和ID,值得注意的是,与 BERT 或 MAE 等此前的 masked modeling 方法不同,MaskDP 可以以 zero-shot 的方式直接应用到下游任务中。
-
PACT:
- 它以状态和动作序列作为输入,并以自回归方式逐个预测 state token 和 action token。
- 其实就是GPT-Style
-
VPT:
- 利用无标签的互联网视频数据,为 Minecraft 游戏预训练一个基础模型。
- 网上大量 Minecraft 视频只有视频帧,却没有动作序列。VPT 先用少量具有真实 action label 的数据训练(st,st+1→ats_t,s_{t+1} \rightarrow a_tst,st+1→at)inverse dynamics model。
- 然后把它用于大量互联网视频打标,最后把这个打标好的新数据集重新用来训练。
- 这是一种semi-supervise的方式,因为有一部分数据集是有标注的。
3.1.5 World Models
-
世界模型定义 :世界模型 (P(\cdot)) 编码了关于世界的常识知识,并能够根据给定动作预测未来状态:
s^t+1∼P(st+1∣st,at) \hat{s}{t+1}\sim P(s{t+1}\mid s_t,a_t) s^t+1∼P(st+1∣st,at)
-
世界模型的作用:
- 让模型可以"先想,后做"
- Action Sequence→Imagine Future→Evaluate→Execute Best Plan\text{Action Sequence} \rightarrow \text{Imagine Future} \rightarrow \text{Evaluate} \rightarrow \text{Execute Best Plan}Action Sequence→Imagine Future→Evaluate→Execute Best Plan
- 生成训练数据:现实机器人数据很贵,可以让 world model 自己模拟:st→at→s^t+1→at+1→s^t+2s_t \rightarrow a_t \rightarrow \hat{s}{t+1} \rightarrow a{t+1} \rightarrow \hat{s}_{t+2}st→at→s^t+1→at+1→s^t+2
- 让模型可以"先想,后做"
-
世界模型 vs 正向动力学习
- 虽然前向动力学学习同样尝试预测下一个状态,但++它通常被作为一种预训练任务或者辅助损失++,用来增强主要机器人任务中的动作解码器,而不是作为一个独立模块使用。
- 正向动力学习通常是一种训练目标,例如训练 VLA 时额外加一个任务:"除了预测 action,顺便预测一下 next state"。目的是帮助模型更好地理解 dynamics,从而:最终提高 action prediction。
- world model 则通常是:一个真正会在 inference / planning 阶段被调用的独立模块。
-
Dreamer:
-
Dreamer使用三个主要模块构建 latent dynamics model:
- Representation Model:负责将图像编码为 latent state;
- Transition Model:负责建模 latent state 之间的状态转移;
- Reward Model:负责预测某个状态对应的 reward。
-
核心架构
-
首先,真实 observation 是图像 oto_tot
- Representation Model:ot→zto_t \rightarrow z_tot→zt,得到 latent state:ztz_tzt
- 然后 Transition Model 学习:zt+at→zt+1z_t+a_t \rightarrow z_{t+1}zt+at→zt+1
- Reward Model 学习:zt→rtz_t \rightarrow r_tzt→rt
-
所以 Dreamer 实际上是在 latent space 里建立:zt→atzt+1z_t \xrightarrow{a_t} z_{t+1}ztat zt+1,以及:zt→rtz_t\rightarrow r_tzt→rt
-
他是一个world model,所以不用学习采取什么action,只需要会imagine
-
-
Dreamer用于Actor-Critic下的强化学习
-
从真实数据里取一个初始 latent state ztz_tzt。
-
Policy(Actor) 根据 ztz_tzt 输出动作 ata_tat。
-
Transition Model 根据 zt+atz_t + a_tzt+at 预测 zt+1z_{t+1}zt+1。
-
重复步骤 2-3,在 latent space 里展开一条想象的轨迹:zt→at→zt+1→at+1→zt+2→...→zt+Hz_t → a_t → z_{t+1} → a_{t+1} → z_{t+2} → ... → z_{t+H}zt→at→zt+1→at+1→zt+2→...→zt+H
-
Reward Model 给每一步想象的状态打分:rt,rt+1,...,rt+Hr_t, r_{t+1}, ..., r_{t+H}rt,rt+1,...,rt+H。
-
Critic 学习评估每个 latent state 的价值 V(zt)V(z_t)V(zt)(用 TD 或 GAE)。
-
Actor 用 Critic 提供的价值信号做策略梯度更新(最大化想象轨迹的累计奖励)。
-
-
-
IRIS:
- IRIS 使用类似 GPT 的自回归 Transformer 作为世界模型的核心架构,并使用 VQ-VAE 作为视觉编码器。
3.1.6 LLM-Induced World Models
LLM 中包含了大量关于现实世界的常识知识,因此许多工作开始尝试利用这些知识来提升 VLA。
-
DECKARD:
-
通过 prompt LLM 来生成抽象世界模型(Abstract World Model,AWM),该模型使用有向无环图表示,并专门用于 Minecraft 中的物品合成任务。
-
AWM:比如"制作 iron pickaxe",LLM 可以生成类似依赖图:WoodPlank→...→Iron Pickaxe
不生成未来 RGB 图片,而是在高层语义空间中描述未来发生的事件
-
DECKARD 在两个阶段之间不断迭代:
- Dream 阶段:在 AWM 的指导下选择一个 subgoal;
- Wake 阶段:实际执行这个 subgoal,并通过与游戏环境的交互来更新 AWM。
-
-
LLM-DM:
- 使用 LLM 自动构建以规划领域定义语言(Planning Domain Definition Language,PDDL)表示的世界模型【PDDL:一种用于形式化描述 planning problem 的符号语言。】
- 相比之下,此前的 LLM+P 所使用的 PDDL 世界模型仍然需要人工构建。
-
RAP:
-
将 LLM 同时用作:
- 一个预测动作的 policy;
- 一个提供状态转移分布的 world model。
-
与传统的 CoT prompting 方法不同,RAP 引入蒙特卡洛树搜索(MCTS)进行结构化规划,使 LLM 能够逐步构建 reasoning tree。这样就能同时考虑多种可能的 action / reasoning path。
-
这种推理策略帮助 RAP 找到高 reward 的路径,同时平衡 exploration 和 exploitation。
- Exploration:尝试还不确定、但可能更好的新路径;
- Exploitation:继续利用目前已经知道表现不错的路径。
个人认为这两个词是VLA中非常关键的词
-
-
Tree-Planner:
- 通过仅调用一次 LLM,就在 action tree 中生成多条不同路径,从而提高了效率。
-
LLM-MCTS:
-
将问题进一步扩展到了 POMDP 场景
-
当作为 world model 时,LLM 用于生成当前状态的初始 belief;当作为 policy 时,LLM 作为启发式模型来指导 action selection。
-
因为 POMDP 下机器人不知道真实完整状态是什么。所以不能说直接到某个确定的状态,而是维护一个对当前状态的概率性估计 ,也就是:b(st)b(s_t)b(st)【belief state】。LLM 可以根据常识和 observation 推断:当前世界最可能是什么状态。
-
通过利用 LLM 中的常识知识,可以缩小 MCTS 的搜索空间,从而提升搜索效率。
-
3.1.7 Visual World Models
与采用文本形式的 LLM-induced world model 不同,视觉世界模型会直接生成未来状态对应的图像、视频或者 3D 场景,因此其表示形式与真实物理世界更加接近。
-
Genie:
- Genie 包含三个主要组件:
- 时空视频 tokenizer;
- 自回归 dynamics model;
- latent action model。
- 不再过多介绍,可见Genie对应的论文讲解文章
- Genie 包含三个主要组件:
-
3D-VLA:
- 它接收图像、深度图和点云等视觉输入,并根据用户的 query,使用 diffusion model 生成目标状态;这个目标状态可以表示为图像,也可以表示为点云。
-
UniSim:
- 它能够模拟高层动作和底层动作产生的视觉结果,而这些模拟得到的结果可以进一步作为新的 experience,用于训练具身智能体。
-
E2WM:
-
甚至直接将已有 simulator 视为 world model,并通过 MCTS 在 simulator 中收集 embodied experiences。
-
MuJoCo / Habitat / Game Engine:Current State+Action→Next State\text{Current State} + \text{Action} \rightarrow \text{Next State}Current State+Action→Next State
Simulator 本身就可以看作一个精确的 world model。
- 然后通过 MCTS:
在模拟器里搜索 / rollout 很多未来轨迹。
- 最终采集大量 embodied experience。
-
3.1.8 Reasoning
推理天然适合高层任务规划,因为二者通常都发生在语言空间中。
-
High-Level Task Planning:(\text{Instruction} \rightarrow \text{Reasoning} \rightarrow \text{Subtasks / Plan})
-
ThinkBot:
- 使用 CoT 来补全稀疏的人类指令中缺失的动作描述,从而增强指令的连贯性,并提高困难任务中的成功率。
-
ReAct:
- 将推理轨迹和动作交替进行,其中 CoT 可以帮助生成动作计划、引入常识知识并处理异常情况,从而最终提升具身决策能力。
-
RAT :
- 将 CoT 与检索增强生成(RAG)相结合,以缓解 hallucination,从而提升具身任务规划能力。
-
Tree-Planner:
- 使用 Tree-of-Thoughts(ToT)方法进行任务规划。
-
-
Low-Level Control:(\text{Vision} + \text{Instruction} \rightarrow \text{Reasoning} \rightarrow \text{Low-level Action})
- ECoT :
- 该方法训练 OpenVLA 在预测底层动作之前,先针对计划(plans)、子任务(subtasks)、运动(motions)以及视觉特征(visual features)进行 embodied CoT reasoning。
- CoT-VLA :
- 为 VLA 引入了视觉形式的 Chain-of-Thought reasoning。
- Reasoning 也开始从纯语言推理向 multimodal / visual reasoning 扩展。
- ECoT :
3.2 Low-Level Control Policies

- 通过将动作解码器与视觉编码器、语言编码器等感知模块进行整合,可以构建一个参数为 (\theta) 的 VLA 模型 (\pi_\theta),作为控制策略来执行语言指令 (p)。
a^t∼πθ(at∣p,s≤t,a≤t) \hat a_t \sim \pi_\theta \left( a_t \mid p, s_{\le t}, a_{\le t}\right) a^t∼πθ(at∣p,s≤t,a≤t)
3.2.1 Non-Transformer Control Policies
Transformer 成为主流之前,language-conditioned robot policy 是怎么设计的。
- CLIPort :
- 将 CLIP 和 Transporter Network 结合起来,构成双流架构。
- CLIP 的视觉编码器负责从 RGB 图像中提取"语义"信息,而 Transporter Network 负责从 RGB-D 图像中提取"空间"信息。
- CLIP 的文本编码器用于编码语言指令,并指导模型输出 SE(2) 动作,即一对 pick pose 和 place pose。
- BC- Z :
- 接受两种形式的任务指令:语言指令,或者人类 demonstration video。环境则以 RGB 图像的形式输入模型。
- 随后,instruction embedding 和 image embedding 通过 FiLM 层进行融合,最终生成机器人动作。
- FiLM 可以简单理解成让 instruction 去调制视觉 feature。
- 其他工作就不列举了
3.2.2 Transformer-Based Control Policies
随着 Transformer 的引入,机器人 control policy 逐渐趋向于采用 Transformer-based architecture。
-
Gato:
-
使用同一套模型参数,可以完成 Atari 游戏、图像描述和机器人堆叠方块等多种任务。提出了一种:
Generalist Agent
-
这一能力依赖统一的 tokenization scheme,将不同任务和不同 domain 的输入输出统一表示。
-
-
RoboCat:
- 提出了一种 self-improvement 过程,使 agent 只需要大约 100 条 demonstration 就能够快速适应新任务。
- 少量新任务数据}--Finetune--模型自己执行新任务--生成更多新数据--继续训练--更强模型
- RoboCat 基于 Gato,并加入 VQ-GAN image encoder。
- 训练过程中,RoboCat 不仅预测 next action,还预测 future observation。
- 提出了一种 self-improvement 过程,使 agent 只需要大约 100 条 demonstration 就能够快速适应新任务。
-
RT-1:
-
和 BC-Z 来自同一个团队,整体思路类似,但做了若干重要改进。
-
EfficientNet Vision Encoder
-
BC-Z:ResNet
-
RT-1:EfficientNet(主要是更高效)
-
-
用language作为instuction
-
MLP Action Decoder → Transformer Decoder
- BC-Z:Features→MLP→at\text{Features} \rightarrow \text{MLP} \rightarrow a_tFeatures→MLP→at
- RT-1:Visual + Language + History→Transformer→Discrete Action Tokens\text{Visual + Language + History} \rightarrow \text{Transformer} \rightarrow \text{Discrete Action Tokens}Visual + Language + History→Transformer→Discrete Action Tokens
-
-
Q-Transformer
-
把 RT-1 类架构从 imitation learning 推向 Q-learning。
-
最大的优势:可以利用 failed trajectories。
-
-
ACT:
- ACT 使用 conditional VAE 构建 policy,并引入 action chunking,使模型一次预测一段动作序列,而不是只预测一个动作。
- 如果每一帧都重新预测一次 action:at, at+1, at+2a_t,\ a_{t+1},\ a_{t+2}at, at+1, at+2,预测可能会:抖动、不连贯。而一次输出一段动作:(at,...,at+H)(a_t,\ldots,a_{t+H})(at,...,at+H),可以让动作:**temporal consistency 更好。**同时减少高频 inference 的压力。
-
RoboFlamingo
- 通过在 OpenFlamingo VLM 后连接一个基于 LSTM 的 policy head,将预训练 VLM 适配成机器人策略。
- Pretrained VLM→Attach Robot Policy Head→Robot Control\text{Pretrained VLM} \rightarrow \text{Attach Robot Policy Head} \rightarrow \text{Robot Control}Pretrained VLM→Attach Robot Policy Head→Robot Control
- 通过在 OpenFlamingo VLM 后连接一个基于 LSTM 的 policy head,将预训练 VLM 适配成机器人策略。
3.2.3 Control Policies for Multimodal Instructions
Text+Image+Video+Pointing→Task Specification\text{Text} + \text{Image} + \text{Video} + \text{Pointing} \rightarrow \text{Task Specification}Text+Image+Video+Pointing→Task Specification
-
优势:
-
更精确地指定目标;
-
更容易表达新 object;
-
支持 demonstration;
-
支持 visual constraints;
-
提高人与机器人的交互自然度。
-
-
代表工作:
- VIMA:multimodal prompt + generalization benchmark
- MOO:RT-1 + visual grounding,支持图片 / pointing / click 指定物体
3.2.4 Control Policies With 3-D Vision
-
Motivation:2D image 缺乏完整几何信息,而 manipulation 需要:
-
depth;
-
precise position;
-
3D geometry。
-
因此引入 3D representation。
-
-
主要路线
-
Point Cloud
- DP3 / 3-D Diffuser Actor
- RGB-D → 3D points
-
Voxel
- PerAct / VER
- 三维 grid
- 空间表达直接,但 computational cost 高
-
Continuous 3D Feature
- Act3D
- adaptive resolution,降低 voxelization 成本
-
Multi-view Rendering
- RVT / RVT-2
- Point Cloud → Virtual 2D Views → 2D model
-
3D-aware Image Features
- RoboUniView
- 从 multi-view image 中学习带 3D 信息的 feature
-
3.2.5 Diffusion-Based Control Policies
-
核心思想 :把机器人 action generation 建模成一个 Diffusion Generation Problem。
- 普通 policy:Observation→Action\text{Observation} \rightarrow \text{Action}Observation→Action
- Diffusion Policy:Noise→condition: observation / languageiterative denoisingAction Sequence\text{Noise} \xrightarrow\\text{condition: observation / language}{\text{iterative denoising}} \text{Action Sequence}Noiseiterative denoising condition: observation / languageAction Sequence
- 即不是一次性回归一个确定动作,而是从噪声开始逐步 denoise,最终生成一段合理的机器人动作。
-
为什么 Diffusion 适合 Robot Action?
- Multimodal Action Distribution
- 同一个任务可能存在多种正确动作。
- 例如抓杯子,可以从左侧抓,也可以从右侧抓。
- 普通 MSE regression 容易把多个 mode "平均掉",而 diffusion 更适合建模这种多峰分布。
- High-dimensional Action Space
- 适合生成高维、连续的动作序列。
- Training Stability
- 相比一些传统 generative policy,训练更加稳定。
- 通常还会一次生成一段 action,因此和前面的 Action Chunking 思想有一定联系。
- Multimodal Action Distribution
-
Diffusion Policy
- 将 robot policy 建模成 DDPM。
- 结合:
- visual conditioning;
- receding horizon control;
- time-series diffusion。
- 核心就是:Observation→Diffusion Model→(at,...,at+H)\text{Observation} \rightarrow \text{Diffusion Model} \rightarrow (a_t,\ldots,a_{t+H})Observation→Diffusion Model→(at,...,at+H)
- Receding Horizon Control :
- 模型虽然一次预测未来一段 action;
- 但实际只执行前面一部分;
- 获得新的 observation 后重新规划。
- 类似:Predict→Execute Part→Observe Again→Replan\text{Predict} \rightarrow \text{Execute Part} \rightarrow \text{Observe Again} \rightarrow \text{Replan}Predict→Execute Part→Observe Again→Replan
Diffusion Policy 是这一类方法最基础、最重要的代表工作。
-
SUDD
-
核心是:
LLM 辅助生成 Robot Data → 过滤 → 蒸馏到 Diffusion Policy
-
LLM 调用一些 robot primitive utilities,例如:
- grasp sampler;
- motion planner;
-
自动生成 language-guided robot data。
-
然后将 Diffusion Policy 扩展成:Vision + Language→Diffusion Action\text{Vision + Language} \rightarrow \text{Diffusion Action}Vision + Language→Diffusion Action
-
主要解决:
multitask robot data generation 和 language conditioning。
-
-
Octo
-
提出一个 Transformer-based diffusion policy foundation model。
-
重点是 Modular Open Framework:
- task encoder 可以换;
- observation encoder 可以换;
- action decoder 可以换;
- 中间统一连接到 Octo Transformer。
-
是较早使用 OXE(Open X-Embodiment)dataset 的工作之一。
-
通过大量不同:
- robots;
- tasks;
- embodiments;
进行联合训练,实现 cross-robot positive transfer 和 generalization。
Octo = 大规模跨机器人数据 + Modular Transformer Diffusion Policy。
-
-
MDT
-
将 CV 中的 DiT(Diffusion Transformer) 引入 robot action prediction。
-
DiT 的核心变化:
用 Transformer 替代传统 diffusion model 中的 U-Net。
-
除了 action diffusion,还加入两个 auxiliary objectives:
- Masked Generative Foresight
- Contrastive Latent Alignment
-
相比传统 U-Net-based Diffusion Policy 获得更好的性能。
MDT = DiT-style Action Diffusion。
-
-
RDT-1B
-
基于 DiT 的 1B-scale diffusion foundation model。
-
主要针对:
Bimanual Manipulation(双臂操作)
-
一个非常重要的问题是:
不同机器人 action space 不一样,数据很难直接混在一起训练。
-
RDT 提出 physically interpretable unified action format:
- 将不同机器人的 action 统一成一种具有物理意义的表示。
-
从而可以在:
多种 robot + heterogeneous datasets
上统一 pretraining。
-
使用超过 1M trajectories ,模型可以扩展到约 1.2B parameters。
-
并表现出 zero-shot generalization。
RDT-1B 的重点不是单纯"用了 diffusion",而是通过统一 action representation 实现大规模 multi-robot pretraining。
-
3.2.6 Diffusion-Based Control Policies With 3-D Vision
-
核心思想非常直接:把 Diffusion Policy 和前面的 3-D Vision 结合。
-
DP3
- 将 3-D point cloud 直接作为 Diffusion Policy 的输入。
- 基本形式:Point Cloud→Diffusion Policy→Action\text{Point Cloud} \rightarrow \text{Diffusion Policy} \rightarrow \text{Action}Point Cloud→Diffusion Policy→Action
DP3 = 3D Point Cloud + Diffusion Policy。
-
3-D Diffuser Actor
-
思路和 DP3 类似。
-
区别主要在 architecture:
- 将 Act3D
- 和 Diffusion Policy
结合起来。
3-D Diffuser Actor = Act3D-style 3D representation + diffusion action generation。
-
-
3D-MoE
-
使用:
- Mixture-of-Experts(MoE);
- DiT-based action diffusion;
- Rectified Flow。
-
重点是提高模型的:
Efficiency + Capacity
-
3.2.7 Control Policies for Motion Planning
-
Motion Planning 定义:
- 将机器人运动任务表示为一系列离散 waypoint:q1→q2→⋯→qTq_1 \rightarrow q_2 \rightarrow \cdots \rightarrow q_Tq1→q2→⋯→qT
- 同时满足各种约束:
- obstacle avoidance;
- collision avoidance;
- kinematic limits;
- task constraints。
-
它解决的问题更偏向:
已经知道机器人要去哪里以后,怎样找到一条可执行、安全的运动轨迹?
-
Motion Planning 和前面的 VLA Policy 有一点区别
-
典型 VLA:Observation + Language→Action\text{Observation + Language} \rightarrow \text{Action}Observation + Language→Action
-
Motion Planning 更像:Goal+Environment Constraints\text{Goal} + \text{Environment Constraints}Goal+Environment Constraints------Planner\text{Planner}Planner------Waypoints / Trajectory\text{Waypoints / Trajectory}Waypoints / Trajectory------Robot Controller\text{Robot Controller}Robot Controller,也就是说它显式考虑:路径和约束。
-
-
Language Costs
-
核心思想:
Language → Cost Map → Motion Planning
-
人类用自然语言告诉机器人:
- 修改目标;
- 表达 preference;
- 纠正错误。
-
系统根据语言生成 cost map:Language Instruction→Cost Map\text{Language Instruction} \rightarrow \text{Cost Map}Language Instruction→Cost Map
-
Motion Planner 再在 cost map 上寻找最优 trajectory。
-
-
VoxPoser
-
这一部分最值得记的工作。
-
使用:
- LLM:负责理解语言、写 executable code;
- VLM:负责视觉感知、获取 object coordinate;
- 3D Voxel Map:表示 affordance 和 constraint;
- MPC:生成最终机器人 trajectory。
-
VoxPoser Pipeline
-
用户说:"把红色杯子放到盘子旁边。"
-
Step 1:LLM 理解任务 :生成程序 / 调用 VLM:Language→Executable Code\text{Language} \rightarrow \text{Executable Code}Language→Executable Code
-
Step 2:VLM 找物体 :Image→Cup Position / Plate Position\text{Image} \rightarrow \text{Cup Position / Plate Position}Image→Cup Position / Plate Position
-
Step 3:构建 3D Maps包括:
-
Affordance Map:哪些区域应该靠近 / 操作。
-
Constraint Map:哪些区域应该避开。
-
-
Step 4:MPC :根据这些 map:Affordance + Constraint→MPC→End-effector Trajectory\text{Affordance + Constraint} \rightarrow \text{MPC} \rightarrow \text{End-effector Trajectory}Affordance + Constraint→MPC→End-effector Trajectory
-
-
VoxPoser 最大的特点:Training-Free。它不需要额外训练一个 VLA policy。
-
-
RoboTAP
-
主要用于:Few-shot Visual Imitation
-
首先根据 gripper:open;close;把 demonstration 分成若干 stage。
-
每一个 stage 使用 TAPIR 跟踪 relevant object 上的 active points:Source Pose→Tracked Points→Target Pose\text{Source Pose} \rightarrow \text{Tracked Points} \rightarrow \text{Target Pose}Source Pose→Tracked Points→Target Pose
-
然后使用 Visual Servoing Controller:
根据 tracked visual points 不断调整 robot motion。
-
最后把多个 stage 串起来形成完整 motion plan。
RoboTAP = 把 demonstration 分段 + point tracking + visual servoing,实现 few-shot imitation。
-
3.2.8 Control Policies With Point-Based Actions
-
核心思想 :不一定非要训练一个完整的 VLA 去直接输出连续机器人动作,也可以让 VLM 先预测一个点 / 关键点 / 约束,再交给后续几何或优化模块转换成真正的 robot action。
-
这种方法的主要优势是:
- 可以直接利用现成 VLM 的视觉理解和空间推理能力;
- 不一定需要训练一个完整的 low-level VLA;
-
可以把整体范式理解为:Image + Language→VLM→Point / Keypoint / Constraint→Robot Action\text{Image + Language} \rightarrow \text{VLM} \rightarrow \text{Point / Keypoint / Constraint} \rightarrow \text{Robot Action}Image + Language→VLM→Point / Keypoint / Constraint→Robot Action
- 而不是传统 VLA:Image + Language→VLA→Low-level Action\text{Image + Language} \rightarrow \text{VLA} \rightarrow \text{Low-level Action}Image + Language→VLA→Low-level Action
-
PIVOT
-
核心思想:把机器人动作选择问题转化成 VQA 问题。
-
系统首先在图像上生成一组候选动作,并用 keypoint 的形式标注出来。
-
然后把图片交给 VLM,让它回答:为了完成当前任务,应该选择哪个点?
-
它不是一次就选完,而是通过 iterative prompting 不断缩小 / refine 候选范围,直到找到最好的 action。
-
-
RoboPoint
- RoboPoint 比 PIVOT 更直接:直接 finetune VLM,让模型预测应该操作图像中的哪个 2D point。
3.2.9 Large VLA
-
LVLA(Large VLA)见前文
-
但不同 LVLA 最大的区别就在:
Action Decoder 到底怎么设计?
- 后面的工作实际上逐渐发展出了几条不同路线:
- Autoregressive Action Tokens
- Hierarchical Action Representation
- VLM + Continuous Action Expert
- VLM + Diffusion / DiT Action Expert
- Latent Action Pretraining
- Unified Autoregressive Multimodal World Model
- 后面的工作实际上逐渐发展出了几条不同路线:
A. RT 系列:从 VLM 直接扩展到 Robot Action
-
RT-2
-
RT-2 是 Large VLA 这一概念最经典的起点。
-
建立在 PaLI-X / PaLM-E 这类 large multimodal model 上。
-
核心思想:
txtInternet Vision-Language Knowledge + Robot Data ↓ Co-Finetuning ↓ Large VLA ↓ Robot Action -
Co-finetuning
- 同时训练:
- Internet-scale VQA data;
- Robot trajectory data。
- 目的不是只让模型学机器人动作,而是:
在学习 Action 的同时尽量保留原有 VLM 的 Internet-scale semantic knowledge。
- 同时训练:
RT-2 = Large VLM 通过 Robot Co-finetuning 直接扩展成 VLA。
-
-
RT-H
-
RT-H 的关键不是扩大模型,而是:
在 Language Instruction 和 Low-level Action 中间加入一个 Language Motion Layer。
-
架构变成:
txtLanguage Instruction ↓ Large VLA ↓ Language Motion ↓ Low-level Action (translation / rotation)-
例如:
txtInstruction: "Pick up the cup" ↓ Language Motion: "Move the arm up" ↓ Low-level Action: Δx, Δy, Δz, Δrotation
-
-
intermediate representation的意义:虽然 task semantic 不一样,但是都可能包含相同的语义动作
跨任务共享运动知识。
-
此外用户还可以直接纠正 intermediate motion。
-
-
RT-X
-
RT-X 本身最大的贡献不是新 architecture,而是:Data Scaling。
-
构建了 Open X-Embodiment(OXE) 数据集:多个机器人;多种 embodiment;多种 task;数据规模远大于早期 robot datasets。
- RT-1 + OXE → RT-1-X
- RT-2 + OXE → RT-2-X
-
B. OpenVLA 系列:Open-source Large VLA
-
OpenVLA
-
可以理解成:
RT-2-X 路线的 Open-source counterpart。
-
总体仍然是:
txtVision + Language ↓ Large VLM ↓ Action Prediction ↓ Robot Action -
额外研究了高效 adaptation:
-
LoRA;
-
Quantization。
-
不需要每次都 full finetune 一个巨大 VLA,也能适配新的 robot/task。
-
-
OpenVLA-OFT
-
不改变 大 VLM → Robot Action 这个基本范式;
-
主要提出 Optimized Fine-Tuning(OFT)recipe:
- 提升 finetuning efficiency;
- 同时提升 downstream performance。
-
所以这一类工作更多是在回答:
Large VLA 已经有了以后,怎么更高效地把它适配到新任务?
-
-
TraceVLA
-
在 OpenVLA 上继续 finetune,引入Visual Trace Prompting,增强模型的 spatial-temporal awareness。
-
可以把整体思想理解成:
txtImage + Language + Visual Trace ↓ OpenVLA ↓ Robot Action -
Visual trace 给模型额外提供:运动应该沿什么空间 / 时间方向发生,这一类显式提示。
-
C. π0:VLM + Action Expert
-
π0

-
VLM每一次的token都参与Action Expert的attention,用于提供视觉信息
-
Action Expert用flow matching生成action chunk
-
Survey 这里说 Action Expert 基于 Mixture-of-Experts framework。
-
最重要的理解不是普通 MoE 的多个专家随机选一个,而是:
语言视觉建模和机器人动作建模可以拥有专门化参数路径,同时仍处于统一模型框架中。
π0 = Large VLM + specialized Flow-Matching Action Expert。
-
-
这和 RT-2 的直接把 action 纳入 VLM generation相比,是一个非常重要的 architecture 分化。
-
D. 更高效 / 更 Spatial-aware 的 LVLA
-
RoboMamba
-
主要解决 Transformer inference cost。
-
将 Transformer 换成:
Mamba State Space Model
-
由于 Mamba inference complexity 更接近 linear:O(T)O(T)O(T)
-
整体仍然是:
txtVision + Language ↓ Mamba-based Multimodal Model ↓ Robot Action -
核心:提高 VLA reasoning / action inference efficiency。
-
-
SpatialVLA
-
重点解决:VLA 的 3D spatial understanding 和 action generalization。
-
引入两个关键设计:
-
Ego3D Position Encoding,将:以机器人自身为参考系的 3D spatial information注入 visual representation。
-
Adaptive Action Grid:用 adaptive action grid 表示动作,从而提高:generalizability;robustness。
-
-
E. LAPA:Latent Action Pretraining
Internet Video 巨多,但是没有 Robot Action Label,怎么利用?
-
Stage 1:学习 Latent Action
-
输入大量 unlabeled Internet video:It, It+1I_t,\ I_{t+1}It, It+1,但是不知道:ata_tat
-
LAPA 用 VQ-VAE 学习:(It,It+1)→zta(I_t,I_{t+1}) \rightarrow z_t^a(It,It+1)→zta。这里:ztaz_t^azta就是 Latent Action
-
-
Stage 2:Pretrain VLA Predict Latent Action
-
然后:
txtImage + Language ↓ VLA ↓ Latent Action Token- 此时不需要真实 robot action label。因此可以用:Internet-scale unlabeled video 训练 VLA 的 action understanding。
- 监督目标由stage 1 的latent action 提供
-
-
Stage 3:映射到真实 Robot Action
-
最后只需要少量 robot data:zta→atrobotz_t^a \rightarrow a_t^{robot}zta→atrobot
-
也就是把 latent action 对齐到真实机器人动作。
-
整个 pipeline:
txtInternet Unlabeled Videos ↓ VQ-VAE ↓ Latent Actions ↓ Pretrain VLA to Predict Latent Actions ↓ Small Robot Dataset ↓ Latent Action → Real Action
-
F. LVLA + Diffusion / DiT Action Expert
这一类的共同结构可以记成:
Vision + Language
↓
VLM
↓
Multimodal Representation
↓
Diffusion / DiT Action Decoder
↓
Continuous Action Chunk
-
TinyVLA:
- 使用 Diffusion Policy 作为 action generation module。
-
CogACT
- 使用:DiT-based Action Diffusion Module
-
DexVLA
-
使用:Diffusion Action Expert
-
并加入:
-
Embodied Curriculum Learning;
-
Substep Reasoning。
-
-
G. Unified Autoregressive VLA + World Model
接下来又出现了另一个非常有意思的方向:
为什么 Action 一定需要 Diffusion?能不能把 Vision / Language / Action 全部 tokenization,然后全部用一个 Autoregressive Transformer?
-
Motivation:Visual Autoregressive Modeling(VAR)已经表明:
图像也可以 quantize 成 discrete visual tokens,然后 autoregressive generation。
-
于是:
Vision + Language + Action=One Token Sequence\boxed{ \text{Vision + Language + Action} = \text{One Token Sequence} }Vision + Language + Action=One Token Sequence
-
WorldVLA / UniVLA
-
核心做法:将 multimodal data 全部 quantize 成 discrete tokens,并建立一个 shared multimodal vocabulary。
-
例如:
txt[IMAGE_125] [IMAGE_337] [TEXT_pick] [TEXT_cup] [ACTION_042] [ACTION_107] ... -
使用一个 Autoregressive Model 进行建模。因此同一个模型不仅可以:Generate Action,Generate Language,Generate Future Image
WorldVLA / UniVLA 同时是 VLA 和 World Model。
-
补:VLA Action Abstraction 与 Motion Planning 的关系
VLA 并不一定直接输出最终 joint command,不同方法的 action abstraction 不同。
-
End-to-End Learned Control
-
Vision + Language
→ VLA Policy
→ End-effector Delta Pose / Action Chunk
→ IK / Low-level Controller
→ Joint Command
→ Robot
-
代表:RT-1、ACT、Diffusion Policy
-
不需要显式 classical motion planner;
-
VLA 自己从 demonstration 中隐式学习 motion generation;
-
但底层通常仍有 IK / servo controller。
-
-
-
Planner-Based Control
-
Vision + Language
→ VLM / VLA
→ Target Point / Waypoint / Constraint / Cost Map
→ Motion Planner
→ End-effector Trajectory
→ IK / Controller
→ Robot
-
代表:RoboPoint、VoxPoser、ReKep
-
VLM 负责 semantic/spatial reasoning;
-
Motion Planner 负责 collision-free / kinematically feasible trajectory;
-
Controller 再转成 joint-level control。
-
-
-
三层概念区分
-
Task Planning:决定"做什么"
-
Motion Planning:决定"从 A 到 B 怎么走"
-
Low-level Control:决定"关节/电机怎么执行"
-
4. Task Planners
-
High-level Task Planner 定义
-
高层 planner (\pi_\phi) 的目标是把复杂任务 (\ell) 分解成一系列 subtasks:p^=p1,p2,...,pN\hat{p}=p_1,p_2,\\ldots,p_Np^=p1,p2,...,pN
-
每一个 (p_i) 都作为 low-level control policy (\pi_\theta) 的 instruction。
-
形式上:p^∼πϕ(p∣ℓ,st)\hat{p}\sim \pi_\phi(p\mid \ell,s_t)p^∼πϕ(p∣ℓ,st)
-
输入:high-level task (\ell),当前状态 (s_t)
-
输出:task plan / subgoal sequence (\hat p)
-
-
这一过程也叫:
- Task Decomposition
- Subgoal Decomposition和 TAMP(Task and Motion Planning)
- Embodied Decision Making
-
有了 high-level planner,VLA 才更容易完成:
Long-horizon / complex tasks
4.1 Monolithic Task Planners
- Monolithic Planner
- 使用一个单独的 LLM / MLLM 来完成 task planning。
- 常见两种方式:
- 设计专门 prompting / planning framework;
- 在 embodied dataset 上 finetune。
4.1.1 End-to-End Task Planners
-
核心思想:类似 Large VLA 直接利用 large MLLM 的 Internet-scale knowledge 做 high-level planning。但输出不是 low-level robot action,而通常是:Textual Subtasks / Task Plan
-
PaLM-E
-
将:ViT,PaLM 结合成一个 embodied MLLM。
-
基本架构:
txtImage Observation + High-level Language Instruction ↓ PaLM-E ↓ Text Plan ↓ Low-level Robot Policies
-
-
PaLM-E 负责:
高层 embodied reasoning + task decomposition
-
Low-level policy 负责:
真正执行具体动作
-
-
EmbodiedGPT
-
提出 Embodied-Former。
-
目标是输出:
与当前任务相关的 instance-level features
-
这些 feature 综合:
- Vision encoder embedding;
- LLM 提供的 embodied planning information。
-
然后这些 instance feature 给 low-level policy 提供:
下一步应该关注什么 / 做什么的信息。
-
EmbodiedGPT = 不只是输出纯文本 plan,而是生成 task-relevant embodied features 去指导 low-level policy。
-
4.1.2 End-to-End Task Planners With 3-D Vision
-
核心动机:修改 MLLM 架构,使其能接受:
-
Point Cloud,3D Map,Voxel,其他 3D representation。
-
所以这一类基本都是:3D Encoder + LLM / MLLM
-
-
LEO
-
使用 two-stage training:
-
Stage 1:3D Vision-Language Alignment:Point Cloud Feature↔Language\text{Point Cloud Feature} \leftrightarrow \text{Language}Point Cloud Feature↔Language
-
Stage 2:3D Vision-Language-Action Instruction Tuning,进一步训练:
- 3D Vision + Language→Embodied Action / Planning\text{3D Vision + Language} \rightarrow \text{Embodied Action / Planning}3D Vision + Language→Embodied Action / Planning
-
-
LEO 可以做:3D QA;Manipulation;Navigation;Task Planning。
LEO = Point Cloud Encoder + LLM,并通过 3D VL alignment → 3D VLA instruction tuning 两阶段训练。
-
-
3D-LLM
-
目标:向 LLM 中注入 3D spatial information。
-
3D feature 来源包括:Point Cloud;gradSLAM;Neural Voxel Field。
-
支持:
- 3D-assisted dialogue;
- Navigation;
- 其他 3D reasoning tasks。
-
-
MultiPLY
-
一个 object-centric embodied LLM。
-
输入 modality 更丰富:Vision,Audio,Tactile,Thermal
-
核心:Multimodal Object Understanding→Embodied Reasoning\text{Multimodal Object Understanding} \rightarrow \text{Embodied Reasoning}Multimodal Object Understanding→Embodied Reasoning
-
-
ShapeLLM
-
核心在于新的 3D encoder:ReCon++
-
ReCon++ 通过 distillation 融合:
- Multi-view image teacher;
- Text teacher;
- Point-cloud MAE。
-
然后:
txt3D Input ↓ ReCon++ ↓ 3D Features ↓ LLaMA ↓ Embodied Reasoning / Interaction -
并提出:3D MM-Vet benchmark,用于评测 3D multimodal embodied ability。
-
4.1.3 Grounded Task Planners
-
核心思想:普通 LLM planner 可能生成"下一步应该打开抽屉。",但问题是:机器人当前真的有能力打开吗?所以 Grounded Task Planning 不只考虑:What should I do?\text{What should I do?}What should I do?,还考虑:Can the robot actually do it?\text{Can the robot actually do it?}Can the robot actually do it?,即:
Task Planning+Low-level Executability\boxed{ \text{Task Planning} + \text{Low-level Executability} }Task Planning+Low-level Executability
-
SayCan
-
核心名字就来自:
-
Say:LLM 说下一步应该做什么;
-
Can:low-level policy 判断自己能不能做到。
-
-
Task Grounding ------ "Say"
-
LLM 根据:High-level instruction,Current context
-
判断:P(skill∣instruction)P(\text{skill}\mid \text{instruction})P(skill∣instruction)
哪个 low-level skill 在语义上最合理?
-
-
World Grounding ------ "Can"
-
Low-level policy 提供:Value / Affordance Function
-
判断:P(success∣s,skill)P(\text{success}\mid s,\text{skill})P(success∣s,skill)
当前环境下,这个 skill 实际能不能完成?
-
-
最终 Skill Selection
- 综合:LLM Probability×Affordance / Value\text{LLM Probability} \times \text{Affordance / Value}LLM Probability×Affordance / Value, 选最优 skill。
-
4.2 Modular Task Planners
-
Motivation
- End-to-end embodied planner 需要在 embodied data 上 finetune,成本较高。
- Modular Task Planner 不重新训练一个完整模型,而是组合现成的:LLM,VLM,Object Detector,Low-level Policy,Control API
- 这类方法也可以看作一种 Tool-Use Architecture。
-
核心思想:
让 Foundation Model 负责 reasoning / planning,让专业模块负责 perception 和 control。
4.2.1 Language-Based Task Planners
-
核心思想:各个模块之间不直接交换 hidden feature,而是统一转换成自然语言
-
Inner Monologue
-
位于:High-level Command→LLM Planner→Low-level Policy\text{High-level Command} \rightarrow \text{LLM Planner} \rightarrow \text{Low-level Policy}High-level Command→LLM Planner→Low-level Policy之间。
-
LLM 给 low-level policy 生成新的 language instruction。
-
执行后,环境反馈再转成 text 返回给 LLM。
-
Feedback 包括:
- success feedback;
- object feedback;
- scene feedback;
- human feedback。
-
因为所有 feedback 都转换成文字:
LLM 本身不需要额外 finetuning。
-
-
ReAct
-
思路类似:Reasoning→Action→Observation→Reasoning→⋯\text{Reasoning} \rightarrow \text{Action} \rightarrow \text{Observation} \rightarrow \text{Reasoning} \rightarrow \cdotsReasoning→Action→Observation→Reasoning→⋯
-
重点是:
reasoning 和环境 interaction 交替进行。
-
-
LID
-
核心贡献是 Active Data Gathering(ADG)。
-
其中重要机制:Hindsight Relabeling
-
对失败 trajectory 不直接丢弃,而是重新赋予一个它实际完成的 goal。
-
例如:原目标:把杯子放到 A;实际:放到了 B。可以重新标成:"把杯子放到 B" 的成功 trajectory。
-
-
Socratic Models
-
不 finetune 多个模型,而是直接组合 pretrained models。
-
核心机制:Multimodal-Informed Prompting
-
做法就是:Non-language Modality→Specialized Model→Language Description\text{Non-language Modality} \rightarrow \text{Specialized Model} \rightarrow \text{Language Description}Non-language Modality→Specialized Model→Language Description,然后统一送给 LLM。
-
4.2. Code-Based Task Planners
-
核心思想 :Language-Based Planner 输出:Natural-language plan;Code-Based Planner 则输出:Executable Program / API Calls
-
ProgPrompt
-
Prompt 中明确告诉 LLM:有哪些 objects;有哪些 available actions;program specification 是什么。
-
然后 LLM few-shot 生成:high-level executable program。
-
还可以在程序中加入:Assertions,用于检查 environment condition。如果 assertion 不满足,就说明需要先处理前置条件。
-
-
ChatGPT for Robotics
-
这个工作很典型地体现了 Tool Use。
-
Step 1:定义 APIs
-
Step 2:告诉 ChatGPT,Prompt 包含:Environment;API functionality;Task goal。
-
Step 3:ChatGPT 生成代码
-
Step 4:通过 simulation / user feedback 检查,如果代码:不安全;不正确;无法执行;继续 prompt ChatGPT 修改。
-
Step 5:执行最终代码
-
-
Code as Policies (CaP)
-
使用 GPT-3 / Codex:Language→Policy Code\text{Language} \rightarrow \text{Policy Code}Language→Policy Code
-
生成的代码继续调用:
- Perception modules;
- Control APIs。
-
5. Datasets and Benchmarks
整体可以分成:
- Real-world robot data
- Simulation
- Automated data collection
- Human data
- Task planning benchmarks
- EQA benchmarks
5.1 Real-World Robot Datasets and Benchmarks
-
核心问题:Robot Data Scarcity,相比 Internet 上海量的 text / image / video,真实机器人数据非常稀缺。
-
主要有三个原因:
-
数据采集成本高
-
不同机器人之间的数据不统一
-
真实环境难以精确复现
-
5.2 Simulators, Simulated Robot Datasets, and Benchmarks
-
Motivation:Simulation 的主要目的就是解决:Real-world Data Collection 太贵。
-
最大问题:Sim-to-Real Gap
-
Rendering 不真实
-
Physics Simulation 不准确
-
Object Property Domain Shift
-
Robot Motion / Planner 与现实不同
-
-
Simulator 的主要优势:Benchmark
- Simulator 可以精确复现实验环境,因此非常适合:Fair + Reproducible Evaluation
- 而且 success rate 等指标可以:自动计算
-
Real-to-Sim:即把真实环境重建进 simulator。
- 用途包括:提升 simulation fidelity;重现 robot failure case;构建 Digital Twin。
5.3 Automated Dataset Collection
-
RoboGen :使用 Generative Simulation 自动:
- 提出有意义的 robot skills;
- 生成对应 simulation environment;
- 为任务选择合适的 learning method;
- 训练 policy 学会这些 skills。
-
AutoRT:使用 LLM 作为Robot Orchestrator。也就是让 LLM 自动提出:当前环境里机器人可以收集什么任务数据。
-
DIAL :不重新收集大量 robot trajectory,而是使用 VLM 对已有数据中的 language instruction 进行 augmentation。
-
RoboPoint:通过 procedural generation:随机 3D layout;随机 objects;随机 camera viewpoint;自动生成大量 scene。
5.4 Human Datasets
-
Motivation:Human data 相比 robot data:数量更多;动作更灵巧;task diversity 更高。
-
主要问题:Human → Robot Transfer:人的身体和机器人 embodiment 不一样,因此很难把 human motion 直接转换成 robot action。
-
其他问题:Human data viewpoint 不统一:egocentric;third-person。大量 human video 并不是 robot learning 所需要的内容;需要额外筛选有效信息。
-
-
UMI
-
使用 hand-held gripper 收集 human demonstration。
-
核心目的:尽可能让 human demonstration 的操作形式接近真实 robot gripper,从而降低 human-to-robot embodiment gap。
-
核心:Human data 是解决 robot data scarcity 的重要来源,但 embodiment mismatch 是最大问题。
-
5.5 Task Planning Benchmarks
-
EgoPlan-Bench
-
真实世界 task planning benchmark;
-
使用 human annotation。
-
-
PlanBench
-
比较全面地评测 task planning,包括:
-
Cost Optimality:计划是不是足够高效;
-
Plan Verification:计划是否正确 / 可执行;
-
Replanning:环境变化或失败后能否重新规划。
-
-
LoTa-Bench :LLM Generated Plan→Execute in Simulator→Success Rate\text{LLM Generated Plan} \rightarrow \text{Execute in Simulator} \rightarrow \text{Success Rate}LLM Generated Plan→Execute in Simulator→Success Rate
-
EAI(Embodied Agent Interface): 对 LLM decision-making module 的:Input,Output进行形式化,并提供更细粒度 metrics。
5.6 Embodied Question Answering(EQA)Benchmarks
-
EQA 通常不直接测试:
-
manipulation;
-
navigation success;
-
-
而是评估 embodied AI 所需要的一些基础能力:
-
Spatial Reasoning;
-
Physics Understanding;
-
World Knowledge;
-
Temporal Reasoning;
-
Causal Reasoning。
-
-
EmbodiedQA / IQUAD
-
早期 EQA benchmark。
-
奠定:agent 主动探索环境后回答问题这一基本范式。
-
-
MT-EQA
- 重点测试:涉及多个目标(multiple targets)的复杂问题。
-
MP3D-EQA
-
将原来的 RGB input 换成:Point Cloud
-
更强调:3D Perception / Spatial Understanding
-
-
EQA 使用 Simulator 的限制
-
因为 agent 需要:Active Exploration
-
所以通常必须能够不断:Action→New Observation\text{Action} \rightarrow \text{New Observation}Action→New Observation
-
这导致很多 EQA benchmark 依赖 simulator,不容易直接使用静态 real-world dataset。
-
-
EgoVQA
- 把 VQA 扩展到:Egocentric Video
-
EgoTaskQA
- 重点评估:Spatial relationships;Temporal relationships;Causal relationships。