具身智能感知简述(Manipulation) —— 经典VLA

具身智能感知简述(Manipulation) ------ 经典VLA

本文围绕 RT-1、RT-2、OpenVLA、CogACT 和 π₀ 五项代表性工作,结合论文架构图与机器人演示,简要梳理 VLA(Vision-Language-Action)模型 的发展脉络,介绍各模型的基本架构、主要思路及其区别,包括从离散动作预测到 Diffusion / Flow Matching 连续动作生成的演进。最后引入 MDP / POMDP,讨论真实环境中的部分可观测问题,并概览空间智能、多模态感知、世界模型等相关研究方向。

------------全文约 3,000 字|预计阅读 8--10 分钟。

1. 从"看见"到"行动":VLA 的技术脉络

具身智能(Embodied Intelligence)研究智能体如何通过感知和动作与物理世界交互。在机器人操作中,一个直观的链路是:相机观测 → 视觉/语言表征 → 动作决策 → 执行 → 再次观测 。Vision-Language-Action(VLA)模型尝试用统一模型连接视觉、自然语言指令和机器人动作。沿着经典工作的演进,可以看到两个关键变化:视觉语义能力逐渐借助预训练 VLM 增强,动作生成则从离散 token 扩展到专门的连续动作模型。

图 1 | VLA 从机器人数据驱动策略,到预训练 VLM,再到连续动作专家的简化演进。来源:自绘概念图。

RT-1:大规模机器人数据与 Transformer 控制(RSS 2023)

最初的开创性工作是谷歌在2023年(RSS)提出的RT-1:

图 2|RT-1 的结构与操作演示。来源:RT-1。

RT-1 是早期大规模真实机器人操作模型的代表。它将图像送入 EfficientNet-B3 ,将语言指令编码为语义特征,再通过 FiLM 融合视觉与语言;随后由 TokenLearner 压缩视觉信息,并用 Transformer 预测动作。RT-1 并未直接采用完整的大型 VLM,它的重要贡献是展示了:扩大真实机器人数据的规模与多样性,能够使统一策略执行多种指令与任务。

RT-1 在每个控制时刻预测包含机械臂、夹爪、底盘及模式在内的 11 个离散动作维度 ,连续控制量被量化到 256 个区间。这里容易混淆的一点是:11 维动作由模型并行预测,而不是按维度自回归生成 ;每次预测的是当前一个时间步的动作,并以约 3 Hz 获取新观测、闭环控制,还不是后续常说的 Action Chunking(一次预测多步动作)。

RT-2:让互联网视觉语义进入机器人控制(CoRL 2023)

RT-2 正式定义了经典VLA的基本框架:

图 3|RT-2 将互联网视觉语言数据与机器人动作数据连接到同一 VLA 训练框架。来源:RT-2。

RT-2 进一步确立了典型的 VLA 路径:预训练视觉语言模型(VLM)+ 机器人动作学习 。它基于 PaLI-X、PaLM-E 等预训练模型,将互联网视觉语言数据与机器人轨迹数据进行 co-fine-tuning(联合微调),使模型能够把物体概念、语义关联等能力迁移到机器人任务中。

RT-2 将机器人动作表示为语言模型可以生成的离散 token。同一个控制时刻内,动作的多个 token 自回归生成 ,再解码为机器人的控制命令;执行后再次观察并预测下一步。与 RT-1 相比,它真正突出了从语义理解到动作输出的统一生成接口。

不过这些开创性的工作是闭源的。

2. OpenVLA:开源 VLA

2024年,斯坦福和伯克利大学的合作项目OpenVLA发布了,其可以视为RT-2的开源复现:

图 4|OpenVLA:DINOv2 + SigLIP → MLP Projector → Llama 2 → Action Tokens。来源:OpenVLA。

OpenVLA(CoRL 2024)以 Prismatic-7B 视觉语言模型为基础,核心模块包括:融合视觉编码器、MLP 投影器和 Llama 2 7B 语言模型。视觉编码器同时使用 DINOv2 与 SigLIP:前者提供较强的空间结构和局部视觉特征,后者提供与语言对齐的语义特征;两种特征经融合与投影后,由 Llama 2 结合任务指令预测动作。

与 RT-2 类似,OpenVLA 将连续动作量化后自回归预测。典型输出是 7 维末端执行器动作 (位置变化、旋转变化和夹爪控制),随后由底层控制器转换为实际机器人运动。从感知角度看,OpenVLA 的双视觉骨干体现了一个重要思路:物体的结构/几何表征与语言语义对齐是互补信息。

不过,大规模预训练并不意味着在每项具体任务中都占优。文章中也提到了一些真实世界局限:比如

  1. 面对复杂理解的任务,OpenVLA表现没有RT-2强(后者经过大量互联网图文任务学习,有更丰富的语义理解)
  2. 窄范围、单一指令桌面操作实验中,直接从该任务数据训练的 Diffusion Policy 强于Openvla这类经过先经过OpenX pretraining以及Fine-tuning的通用策略(generalist model)模型。

这说明语义泛化与精细控制是相关但不同的能力,应结合具体场景评估。于是引出了后续一个重要的发展方向:将"语义理解"和"动作生成"进一步解耦。

图 5|OpenVLA"真实世界限制",来源:OpenVLA。

3. "大小脑"VLA:从离散动作到连续动作

RT-2、OpenVLA 的离散动作 token 便于复用语言模型的生成方式,但量化连续控制量会引入一定误差,而且机器人操作中,同一个观测也可能对应多种合理轨迹。一个有代表性的演进方向,是让 VLM 负责认知表征,专门的 Diffusion / Flow Matching 模块负责生成连续动作 。 CogACT 和 π₀ 都可以看作这一思路的代表。

这里的"大小脑"是对功能分工的形象概括,不代表所有模型都采用完全分离的网络结构。

CogACT:认知特征驱动扩散动作模型

图 6|CogACT:Vision / Language → Cognition Feature → Diffusion Action Model。来源:CogACT。

CogACT(arXiv 2024)基于含 DINOv2、SigLIP 和 Llama 2 的 Prismatic-7B VLM,在输入中加入可学习的 cognition token 。融合视觉与语言后,对应的 cognition feature(认知特征) 成为连接认知模块与控制模块的条件信息。

其动作模块采用 Diffusion Transformer(DiT) 扩散式动作生成模块,从噪声出发逐步去噪,生成连续的 action chunk(多步动作序列);相比 OpenVLA 直接预测离散 action token,这类方法能够更自然地建模连续、多模态的机器人动作分布,比如默认设置是一次预测16 步。因此,CogACT 的关键是让 VLM 提供任务理解,再由专门模型学习连续、多模态的动作分布,而非让 LLM 直接逐个生成动作 token。

π₀:VLM 与 Flow Matching Action Expert

图 7|仅保留多路视觉、语言、机器人状态和 Flow Matching Action Expert 的关系。来源:自绘概念图。

π₀(pi0)(RSS 2025)采用 PaliGemma 作为 VLM 主体,其中 SigLIP 编码图像,Gemma 融合视觉和语言信息;机器人自身状态(proprioception,如关节位置)与带噪声的动作序列则被送入 Action Expert 。两部分通过 Transformer 注意力交互,动作专家利用 Flow Matching 迭代生成连续动作,而不是输出离散动作 token。

π₀ 的训练样本将当前观测与未来 50 步动作 配对,因此推理目标是一段 50-step action chunk。其输入不止"图像 + 文字",还包含机器人状态;这对具身感知尤其重要,因为图像说明外部环境,本体感知则提供机器人自身所处的运动状态。

4. 从 MDP 到 POMDP:真实环境中的部分可观测问题

在理想的 Markov Decision Process(MDP,马尔可夫决策过程) 中,如果机器人能够获得足够完整的当前真实状态,那么基于该状态就可以进行决策。但在真实物理世界中,机器人通常只能通过摄像头及其他传感器获得部分观测。例如,物体可能被遮挡、相机视角有限,或者单一视觉信息无法反映物体的真实状态。

因此,从机器人的观测角度来看,这类问题通常更适合用 Partially Observable Markov Decision Process(POMDP,部分可观测马尔可夫决策过程) 描述。POMDP 在 MDP 的基础上引入观测空间和观测模型,机器人无法直接获得完整真实状态,需要结合历史观测与动作,对当前环境进行状态估计。

VLA 架构解决了"视觉和指令如何连接动作"的关键问题,但真实环境中的感知并不局限于单张 RGB 图像。面对部分可观测、动态变化的物理世界,具身智能也在多个相互关联的方向上尝试突破:

  1. 3D / Spatial Intelligence(空间智能):从二维外观走向三维几何、位置和物体关系,帮助机器人理解"物体在哪里、怎样接近它"。
  2. Multimodal Perception(多模态感知):结合 RGB、深度、触觉、力觉及机器人本体状态,补充单一视觉无法提供的信息。
  3. World Model(世界模型):学习环境如何随动作而变化,使系统能够预测部分动作后果,辅助状态估计和决策。
  4. Sim2Real(仿真到现实):利用仿真数据和训练降低真实机器人数据采集成本,同时处理仿真与真实环境间的分布差异。
  5. Continual / Lifelong Learning(持续或终身学习):在长期交互中继续积累经验,适应环境和任务变化,而不只依赖固定训练阶段获得的知识。

这些方向从空间理解、多模态信息融合、环境预测和持续学习等不同角度,提升机器人在复杂物理环境中的感知与决策能力。

从这个视角回看 VLA 的发展,强视觉编码器和强动作模型解决了感知与控制的重要组成部分;若希望机器人在未知环境中长期自主工作,如何应对部分可观测性、持续更新环境认知,并基于有限信息做出可靠决策,同样是重要的研究方向。

小结

从 RT-1 的数据驱动 Transformer,到 RT-2 / OpenVLA 引入预训练 VLM,再到 CogACT / π₀ 利用 Diffusion / Flow Matching 生成连续动作,VLA 逐步形成了从视觉语言理解到机器人动作生成的技术体系。其演进不仅体现了模型能力的提升,也反映出视觉语义表征、动作空间建模以及认知与控制分工等关键技术的发展。

然而,真实机器人面对的是部分可观测、动态变化的物理世界。即使具备强大的视觉编码器和动作生成模型,仍需要解决环境状态估计、多模态信息融合及长期自主决策等问题。这些也是具身智能从单一任务操作走向复杂开放环境中持续自主工作的重要研究方向。

引用

  1. Brohan et al., RT-1: Robotics Transformer for Real-World Control at Scale, RSS 2023.
  2. Zitkovich et al., RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control, CoRL 2023.
  3. Kim et al., OpenVLA: An Open-Source Vision-Language-Action Model, CoRL 2024.
  4. Li et al., CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action, arXiv 2024.
  5. Black et al., π₀: A Vision-Language-Action Flow Model for General Robot Control, RSS 2025.
  6. Oquab et al., DINOv2: Learning Robust Visual Features without Supervision, 2023.

声明:创作借助了AI润色。内容主要依据个人调研及论文精读内容整理;引用的模型图与演示素材归原论文/项目作者所有,部分概念图为本文整理绘制,调研涉及到的综述文章未一一列出。