六大具身路线详解:模块化、技能编排、IL、RL、VLA、世界模型,到底在“吵”什么。。。

目录

[01 模块化规划:先弄明白,机器人为什么总喜欢"拆开做"](#01 模块化规划:先弄明白,机器人为什么总喜欢“拆开做”)

[🚩2021年 MIT 团队发表的 Integrated Task and Motion Planning(TAMP),就是理解这类问题非常好的入口。](#🚩2021年 MIT 团队发表的 Integrated Task and Motion Planning(TAMP),就是理解这类问题非常好的入口。)

[🚩2024 年东京大学、Meta、谷歌DeepMind 发布 Real-world Robot Applications of Foundation Models: A Review](#🚩2024 年东京大学、Meta、谷歌DeepMind 发布 Real-world Robot Applications of Foundation Models: A Review)

[02 技能编排:机器人一直都有 Skill,变化的是"谁来安排它们"](#02 技能编排:机器人一直都有 Skill,变化的是“谁来安排它们”)

[🚩2022 年 KTH 等团队发表的 A Survey of Behavior Trees in Robotics and AI 系统回顾了这条路线。](#🚩2022 年 KTH 等团队发表的 A Survey of Behavior Trees in Robotics and AI 系统回顾了这条路线。)

[🚩2024 年西北工业大学等发表 Large Language Models for Robotics: Opportunities, Challenges, and Perspectives](#🚩2024 年西北工业大学等发表 Large Language Models for Robotics: Opportunities, Challenges, and Perspectives)

[03 模仿学习:从"老师教一次",到把 Demonstration 变成机器人时代的数据燃料](#03 模仿学习:从“老师教一次”,到把 Demonstration 变成机器人时代的数据燃料)

[🚩2009 年卡内基梅隆大学发表的 A Survey of Robot Learning from Demonstration,至今仍是这一方向非常经典的综述,累计引用已经达到五千余次。](#🚩2009 年卡内基梅隆大学发表的 A Survey of Robot Learning from Demonstration,至今仍是这一方向非常经典的综述,累计引用已经达到五千余次。)

[🚩2026年三星、北京邮电大学等发表于 IJRR 的 What Foundation Models Can Bring for Robot Learning in Manipulation: A Survey,讨论的是一套更大的机器人学习框架](#🚩2026年三星、北京邮电大学等发表于 IJRR 的 What Foundation Models Can Bring for Robot Learning in Manipulation: A Survey,讨论的是一套更大的机器人学习框架)

[04 强化学习:从"机器自己试出来",到追问它在真机上到底有多可靠](#04 强化学习:从“机器自己试出来”,到追问它在真机上到底有多可靠)

[🚩2019 年伯克利发表 A Tour of Reinforcement Learning: The View from Continuous Control](#🚩2019 年伯克利发表 A Tour of Reinforcement Learning: The View from Continuous Control)

[🚩2025 年德克萨斯大学奥斯汀分发表 Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes](#🚩2025 年德克萨斯大学奥斯汀分发表 Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes)

[05 VLA:想真正理解 VLA,第一篇甚至不应该先读 VLA](#05 VLA:想真正理解 VLA,第一篇甚至不应该先读 VLA)

[🚩2016 年日本多机构联合发布的 Symbol Emergence in Robotics: A Survey 就系统讨论了这样一类问题。](#🚩2016 年日本多机构联合发布的 Symbol Emergence in Robotics: A Survey 就系统讨论了这样一类问题。)

[🚩2026 年香港中文大学发表于 TNNLS 的 A Survey on Vision-Language-Action Models for Embodied AI,已经把 VLA 作为一个明确的新模型家族进行整理。](#🚩2026 年香港中文大学发表于 TNNLS 的 A Survey on Vision-Language-Action Models for Embodied AI,已经把 VLA 作为一个明确的新模型家族进行整理。)

[06 世界模型:今天最热的新名字,背后也是一道老题](#06 世界模型:今天最热的新名字,背后也是一道老题)

[🚩2020年莱顿大学的 Model-Based Reinforcement Learning 就在解决一个问题:能不能先学习一个环境模型,再利用它进行规划?](#🚩2020年莱顿大学的 Model-Based Reinforcement Learning 就在解决一个问题:能不能先学习一个环境模型,再利用它进行规划?)

[🚩2026年南洋理工大学等发布了 World Model for Robot Learning: A Comprehensive Survey](#🚩2026年南洋理工大学等发布了 World Model for Robot Learning: A Comprehensive Survey)

[07 今天,具身智能的那些热门问题,都能在更早的机器人研究中找到自己的"前身"](#07 今天,具身智能的那些热门问题,都能在更早的机器人研究中找到自己的“前身”)


本文出自**++《具身智能基础》专栏++**-第13篇。

9 月的北京,有群背着相机和支架的年轻人,在老旧小区挨家敲门,说想进屋拍点东西。据说后来有老人报了警。

这不是诈骗,是数据采集。

几乎同一时间,一条在朋友圈传开的消息里,有人质疑圈内部分企业的「数采中心」,本质上是在把钱从左手倒到右手。

这两件事我不打算评对错。一场尚未被证实的指控,和一个刚起步就长出 70 多个训练场的产业,我们尚下不了定论。

但有几组数字,摆在一起看很有意思。

行业估算,要让一个通用机器人在常见任务上达到 70%--80% 的基础成功率,需要 1 亿小时。如果目标是真正开箱即用的通用具身智能,这个数字可能要爬到千亿小时。

与此同时,过去 18 个月全球冒出了 100 多款开源具身基础模型。到 8 月底,明确宣布做世界模型的国内公司至少 30 家。

现在,可谓是:全民抢数据,人人造模型。

所有人都在默认「只要数据够多,Scaling Law 就能在物理世界重现」。

但,机器人到底该从这些数据里学什么?

行业把「数据」当成了答案,而数据其实只是症状。

过去十年,这个行业对「机器人该从什么里学」给出过六次不同的回答:模块化规划、技能编排、模仿学习、强化学习、VLA、世界模型...

放下各种焦躁,可以发现今天具身智能试图解决的很多问题,其实都很'老':

机器人怎么把一句任务拆成一连串动作?
怎么组合已经学会的技能?
怎样从人的示范中学习?
怎样通过试错掌握控制?
语言里的"杯子"、"拿起"、"放进去",怎样和真实世界对应?
机器人能不能在行动之前,先预测一下接下来会发生什么?

这些核心诉求,从未因某个新"技术名词"的出现而消失。

因此,这篇文章打算沿着模块化规划、技能编排、模仿学习、强化学习、VLA、世界模型六条经典技术主线,结合近10年来12篇被高频引用的代表综述研究展开。

综述有个好处:路线争论会过时,benchmark 会被刷爆,但综述的分类法,和它当年点出来的未解难题,通常能活很久,很久。

01 模块化规划:先弄明白,机器人为什么总喜欢"拆开做"

没有经历过这个阶段的朋友,可能会问:

机器人为什么总要分模块?

本质原因是,让机器人完成"把桌上的杯子放进柜子"这样一个简单任务,背后其实同时存在两个不同尺度的问题。

  • 一个是离散的任务问题:
    应该先开柜门还是先拿杯子?如果杯子被另一个物体挡住,要不要先把障碍移走?
  • 另一个则发生在连续物理空间里:
    机械臂够不够得到?哪条轨迹不会碰到桌沿?抓起杯子之后,又该以什么姿态进入柜子?

前者属于 Task Planning,后者属于 Motion Planning。

它们各自并不新,难点在于两者不能真的各管各的

一个符号层面看起来完全合理的计划,可能在几何空间里根本执行不了;一条局部无碰撞的机械臂轨迹,也不意味着它符合整个任务的目标。

🚩2021年 MIT 团队发表的 Integrated Task and Motion Planning(TAMP),就是理解这类问题非常好的入口。

这篇研究第一次正式把 TAMP 问题形式化:离散动作 + 连续的位姿与构型变量。

明确真实机器人任务之所以天然容易形成模块,是因为"决定做什么"和"身体具体怎么做到"本来就是两类不同的问题。

有了这一层认识,再回来看今天所谓的"端到端",很多讨论会清楚不少。

只是,遗憾的是,虽然把问题定义清楚了,但研究却发现它没有通用解。

业务模块化真正的病根不在任何一层做得不好。病根在层与层之间要翻译。

任务规划器吐出来的是符号,运动规划器要的是位姿,控制器要的是力矩。每一次翻译都在丢信息,而且丢掉的那部分没有任何一层负责。误差不是被消灭,是被推给了下一层。

🚩2024 年东京大学、Meta、谷歌DeepMind 发布 Real-world Robot Applications of Foundation Models: A Review

这篇研究恰恰不是按照 GPT-4、CLIP、PaLM 之类的模型名字来组织全文,而是重新回到一个真实机器人系统里面,看 Foundation Model 可以进入哪些位置

研究关注的包括 perception、motion planning 和 control,并特别强调 Foundation Model 对现有机器人系统中具体组件的替换和增强。

▲图 | Foundation Model 并不是一种单一模态的模型。综述按照语言、视觉、视觉-语言、音频和 3D 表示等输入输出形式进行整理,不同模型能够提供语义理解、开放词汇感知、特征表示或三维信息,也因此会进入机器人系统的不同位置。

这就形成了一个非常有意思的前后对照。

  • 经典 TAMP 时代,工程师最关心的是:

怎样把任务规划和运动规划这两个不同模块接起来?

▲图 | 经典 TAMP 强调"任务顺序合理"和"物理空间可执行"必须同时成立;进入 Foundation Model 时代以后,Perception、Planning 和 Control 这些层级仍然存在,只是其中越来越多过去依赖规则、手工表示和专门模型的能力,开始由预训练模型增强或替代。

  • 到了 Foundation Model 时代,问题逐渐变成:

哪些模块还需要显式建模,哪些原本依赖人工设计的表示、规则和接口,可以交给学习模型?

也就是说,大模型真正改变的未必首先是"有没有模块",而是模块里面装了什么。

开放词汇 VLM 可以改变感知模块的能力边界,LLM 可以参与高层任务分解,学习式 Policy 可以进一步渗透到运动生成。

经典 Stack 并没有一夜消失,只是里面越来越多原本由工程师写死的东西,开始变成模型学出来的东西。

▲图 | Foundation Model 的影响已经跨过单一操作任务,进入导航、移动操作、运动控制和人机交互等多类机器人场景。不同任务之间大量重叠,也说明真实机器人往往需要同时组合感知、规划、语言理解和动作执行,而不是依赖一个孤立模型完成全部工作。

而一旦机器人已经有了一套能够感知、规划和控制的模块,马上又会遇到下一个问题:

这些能力,到底应该怎样组织起来完成一个长任务?

这就进入了第二条路线。

02 技能编排:机器人一直都有 Skill,变化的是"谁来安排它们"

技能编排的故事在纸面上极其动人:先学会 100 个基础技能,然后组合出 10000 种任务。这几乎是具身智能版本的「软件工程」------写函数,调函数。

现实是:学会了三十个,组合的时候接口对不上。

这条线的技术源头也是层次化强化学习的数学地基,今天所有「快慢系统」的说法,往前追溯都能追到这里。

具体来说,如果假设一个机器人已经会导航、抓取、开门、放置,甚至还会按按钮。

单独看,每一个 Skill 都已经能用了。

但用户真正提出的任务通常不会是"执行 Grasp",而是: "去厨房把桌上的饮料收掉。" 这时候机器人需要先导航到厨房,识别目标,判断饮料是不是喝完了,再抓起来,找到垃圾桶或者回收区,最后放进去。

于是一个新的问题出现了:

多个技能到底按照什么顺序执行?失败之后该退回哪里?一个条件不满足时,又应该切换到什么行为?

在大模型之前,Behavior Tree是解决这类问题非常典型的一种工具。

🚩2022 年 KTH 等团队发表的 A Survey of Behavior Trees in Robotics and AI 系统回顾了这条路线。

2022年的这篇研究则指出,Behavior Tree 最初在游戏 AI 中被大量采用,一个重要原因就是传统 Finite State Machine 随复杂度增加容易变得难扩展、难复用。

而 Behavior Tree 将状态转换逻辑组织在层级树中,可以获得更好的模块性。

Sequence、Fallback、Condition、Action 等节点共同构成一棵执行树。

其中很多叶节点,本质上就是机器人的 Skill。

也就是说,其实大模型出现之前,机器人系统已经在认真解决:技能如何封装、组合、复用和调度的问题了。

这会帮助我们避开一个很常见的误解:

LLM 出现以后,机器人仿佛第一次拥有了"技能调用",但其实 Skill 早就在那里。

行为树也不等于只能手写。经典综述已经讨论了通过规划、模仿学习和强化学习合成行为树的方法;今天增加的,是利用大模型的语言与视觉先验来帮助理解任务、组织技能。

大模型真正改变的,是 Skill 上面的那个"调度员"。

🚩2024 年西北工业大学等发表 Large Language Models for Robotics: Opportunities, Challenges, and Perspectives

2024年的这篇研究,则重点整理了 LLM 在机器人 planning、manipulation 和 reasoning 中的应用,同时讨论了纯文本 LLM 在 embodied task 中缺少视觉感知的问题,以及 GPT-4V 等多模态模型如何参与任务规划。

如果把这篇和 Behavior Tree 综述放在一起读,会发现前后关系非常直观。

过去,一个机器人会哪些 Skill、这些 Skill 怎么衔接,往往要由开发者提前组织。

而今天,人们希望模型直接理解:

"把桌上喝完的饮料收掉,但别动我的电脑。" 然后根据视觉环境判断什么东西是饮料、哪些已经喝完、电脑在哪里,再动态生成一个 Skill Sequence。

这时,底层的 Navigate、Grasp、Place 甚至都可以继续存在。

可以看出真正变化的是:

以前人写 Skill 的调用逻辑,现在模型开始尝试生成 Skill 的调用逻辑。

当然,这种结合也不一定绕开经典规划器。

有些做法让语言模型生成 PDDL 等规划描述,再由传统规划器求解;另一些做法则把语言模型的任务判断与技能的可执行性评分结合起来。

▲图 | 大模型参与技能编排并不只有一种形式:它既可以结合价值函数给 Skill Library 中的候选技能打分,决定下一步执行什么;也可以先生成 PDDL 等结构化任务描述,再交给经典规划器求解。两种做法都保留了专门的执行或规划组件,体现的是"大模型负责理解与组织、传统模块负责可靠执行"的混合路线。

这也解释了为什么大模型 + Skill 这条路线到今天仍然很有生命力。

它没有要求一个模型从像素一路控制到电机,而是让大模型负责自己最擅长的开放语言理解、知识调用和任务组合,再把执行交给更稳定的机器人技能。

▲图 | Behavior Tree 和 LLM Planner 解决的其实是同一类高层问题:已经拥有 Navigate、Grasp、Place 等技能之后,怎样把它们组织成一个完整任务。过去通常由开发者预先写好层级结构和切换条件,现在则越来越多地尝试让模型根据语言指令和当前环境动态生成技能序列。

▲图 | 在真正调用技能之前,机器人还需要处理指令是否明确、执行过程中是否出现偏差等问题。综述列出了基于多模态感知发现歧义、通过候选步骤评分判断不确定性,以及利用纠错指令修改原有轨迹等机制,说明大模型带来的变化不仅是"会规划",还包括更自然的交互与在线修正。

不过,无论这些 Skill 最后由谁调用,还有一个更底层的问题绕不过去:

机器人最开始是怎么学会这些动作的?

于是我们来到 Robot Learning 最经典的一条路线。

03 模仿学习:从"老师教一次",到把 Demonstration 变成机器人时代的数据燃料

"不会就看别人做一遍",可能是机器人学习里最符合人类直觉的方法。

模型学习这条线的文献基础也可以说是六条里最扎实的,而它的起点比很多人以为的早得多。

🚩2009 年卡内基梅隆大学发表的 A Survey of Robot Learning from Demonstration,至今仍是这一方向非常经典的综述,累计引用已经达到五千余次。

**值得注意的是,那时是2009 年。**深度学习还没有进入这个领域,AlexNet 还要等三年,而「机器人从示范中学习」已经被整理成了一门有分类法的学问。

当时这篇研究对 Learning from Demonstration 的描述非常干净:通过一组示例 state-action mapping,让机器人学习自己的 Policy。

围绕这件事,该研究系统整理了几个最基础的问题:

示范由谁提供,怎样采集,Problem Space 如何定义,以及机器人最后怎样从这些示范里得到 Policy。

Policy derivation 也并不是只有今天常见的 Behavior Cloning,一些方法可以直接学习 matching function,也可以学习 dynamics model,甚至进一步恢复 plan。

这篇最重要的是理解早期模仿学习的"基本单位":

通常是一名 Demonstrator,一组任务示范,一个相对明确的状态和动作空间,最后学习出完成某项任务的 Policy。

也就是说,那个时代的核心问题非常像:老师演示了几遍,机器人怎样把这项技能学下来?

而且这篇经典综述很早就指出了这条路线的一大根本问题:

机器人最后能够做什么,很大程度上受 Demonstration Dataset 覆盖范围影响。

这个问题十多年后不仅没有消失,反而被放大到了整个具身智能行业。

如今的机器人依然大量依赖 Demonstration,区别在于,"示范"已经不再只是教一个机器人做一项技能的几条轨迹。

🚩2026年三星、北京邮电大学等发表于 IJRR 的 What Foundation Models Can Bring for Robot Learning in Manipulation: A Survey,讨论的是一套更大的机器人学习框架

2026年的最新研究则认为,要实现 general manipulation,不能只依赖单一 Foundation Model,而需要不同 Foundation Model 在感知、技能层、Policy Learning 和其他功能模块中承担不同角色。

这份综述研究还提醒我们,示范不一定只提供低层动作标签。

人类操作视频可以先被拆成观察和动作线索,再配合任务指令预测下一个技能步骤;高层技能组织与低层动作学习,开始在同一套框架里被一起讨论。

▲图 | Demonstration 不只可以提供低层动作监督,也可以从视频中抽取任务进行到哪一步、下一步应该执行什么 Skill。图中把视频分解得到的观察和动作线索与任务指令共同输入语言模型,用于预测后续技能序列,体现了示范数据从"动作标签"向"多层级任务知识"扩展的一种路径。

严格来说,这篇研究并不是"纯粹"的 Imitation Learning Survey。但它却非常适合放在这里。

因为两篇论文的差异,本身就在说明模仿学习的位置发生了变化。

  • 2009 年,人们把 Demonstration 看作一种完整的学习范式:人演示 → 机器人学习 → 得到 Policy;
  • 今天,Demonstration 越来越成为更庞大训练体系中的一种基础资源。

不同任务、不同环境、甚至不同机器人身体产生的动作数据开始被聚合起来,和视觉、语言数据一起训练更加通用的 Robot Policy。

于是问题也从:"十条示范够不够教会机器人这个动作?"

变成了:"如果能够收集百万甚至更多规模、跨任务和跨机器人的示范数据,能不能从里面训练出具有迁移能力的通用机器人模型?"

模仿学习没有消失,示范数据却从单次技能教学的材料,逐渐成为具身基础模型的重要训练资源。

▲图 | 经典 Learning from Demonstration 更关注如何把有限示范直接转化为某一任务的 Policy;基础模型时代,机器人示范则越来越与视觉、语言、多任务和跨机器人数据共同使用,希望训练能够迁移到更多任务和身体上的通用策略。数据规模扩大了,但数据分布差异和跨 embodiment 对齐也因此成为新的难题。

但只看别人做,始终有一个限制: 机器人学到的能力,很难轻易超出已有示范。

如果机器人要在环境中自己探索"什么动作更好",另一条路线就自然接了上来。

04 强化学习:从"机器自己试出来",到追问它在真机上到底有多可靠

强化学习和模仿学习之间最直观的差别之一,是机器人不再只被要求复制老师。

它可以根据 Reward,与环境不断交互,再慢慢找到自己的 Policy。

但对机器人来说,这件事情还有一个额外难点:物理世界里的 Action 往往不是几个离散按钮,而是位置、速度、力矩和连续轨迹。

🚩2019 年伯克利发表 A Tour of Reinforcement Learning: The View from Continuous Control

这篇研究不是从 Atari 或围棋出发讲 RL,而是从 Optimization 和 Control 的视角,专门讨论强化学习与连续控制之间的关系。

这也正是机器人读者最值得先建立的理解:RL 的吸引力在于,研究者不需要明确告诉机器人每一个状态应该输出什么动作,而可以通过 Reward 描述"什么结果更好",让机器人自己在 interaction 中寻找策略。

但它的麻烦也几乎从第一天就写在方法里:Interaction 本身是有成本的。

当时还提出了一个判断:无模型方法不只吃样本,而且不安全------而安全比样本复杂度更关键。

七年之后回头看,这句话基本预言了真机 RL 今天的全部处境。

在模拟器里摔倒一万次只是多耗一点 GPU 时间,在真实人形机器人上摔一万次就是另一回事了。

于是,问题已经发生了一个很明显的变化。

🚩2025 年德克萨斯大学奥斯汀分发表 Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes

但看标题,其实最值得注意的其实不是"Deep RL",而是后面的 Real-World Successes

文章最后讨论的重点也已经非常现实:稳定且样本高效的 Real-World RL、不同能力的组合、Long-Horizon Open-World Task,以及更加规范的开发与评测流程。

仔细阅读过这篇综述则会发现,其实它和前面几组不太一样,这里没有一个"大模型突然重新发明强化学习"的故事。而是:

这些学出来的能力,到底有多少已经可靠到可以长期运行在真实机器人上?

这也是为什么今天人形机器人运动控制已经大量采用 RL,但"真机学习"仍然是一个完全没有结束的问题

算法能学会,不等于现实世界愿意让它无限试错。

▲图 | 机器人强化学习的评价问题已经从"仿真里能不能学会"进一步走向"在什么真实条件下验证过"。Tang 等人的综述将真实世界成熟度从纯仿真、有限实验室环境,一直划分到多样真实环境和商业化产品;这类分级描述的是论文所覆盖的验证范围,而不是对系统可靠性的额外认证。

如果把这组内容再和下文世界模型部分对照的话,还能看到大模型时代新增的一种训练路径:

让世界模型充当可学习的模拟器,为策略评估、强化学习和后训练提供预测得到的交互。

它扩展了试错可以发生的地方,但不能单靠生成环境中的成绩证明真机可靠性。

▲图 | 世界模型也正在成为强化学习的一种新训练基础设施:它可以先充当 Learned Simulator,让 Policy 在预测出的环境转移中进行验证、后训练甚至强化学习,再把得到的策略带回真实机器人。这条路线试图减少昂贵的真机交互,但最终效果仍取决于模拟出来的动力学和动作后果是否足够可信。

走到这里,机器人已经能够通过规则组合技能,也能够从 Demonstration 或 Reward 中学动作。

但还有一个问题一直悬在上面:

人说的任务,究竟怎样变成机器人真正能够执行的动作?

这条线最后把我们带到了今天依然还处于热门位的 VLA。

05 VLA:想真正理解 VLA,第一篇甚至不应该先读 VLA

VLA 的胜利通常被讲成一个架构故事:端到端打败了分层。这个讲法我认为不完全准确。

VLA 真正赢的,或许是数据形态。

现在,VLA 看起来似乎是这六条路线中最年轻的一条。

RT-2、OpenVLA、π 系列等工作出现以后,Vision-Language-Action 很快成为具身智能里的核心关键词。但如果只从 RT-2 开始读,很容易以为"语言连接机器人动作"也是最近两三年才出现的问题。

实际上,它背后对应的是机器人和人工智能里一个非常经典的问题:Symbol Grounding。

比如"杯子"这个词,对于人类来说从来不是一个悬空的 Token。它和形状、视觉、触觉、抓握方式、喝水动作,以及无数次和真实世界交互的经验联系在一起。

🚩2016 年日本多机构联合发布的 Symbol Emergence in Robotics: A Survey 就系统讨论了这样一类问题。

研究关注机器人如何通过 embodied multimodal interaction,从视觉、触觉、听觉、语音以及运动等原始 sensory-motor information 中获得词语及其 embodied meanings,并讨论 multimodal categorization、word discovery 等方向。

核心指出,语言和物理动作连接起来,本质上首先是一个 Grounding 问题。

机器人需要知道"红色杯子"对应世界里的哪个对象,"拿起"又对应怎样的身体行为。

这个问题远比 VLA 这个名字更早。

十年之后,同一个问题遇到了一套完全不同规模的解决方案。

🚩2026 年香港中文大学发表于 TNNLS 的 A Survey on Vision-Language-Action Models for Embodied AI,已经把 VLA 作为一个明确的新模型家族进行整理。

该研究将相关工作划分为三条主要路线:

VLA 的模型组件 、能够直接预测低层动作的 VLA Control Policy ,以及处理长时任务分解的高层Task Planner,同时系统整理了数据集、模拟器和 Benchmark。

▲图 | 这份 VLA 综述把具身系统中的高层 Task Planner、低层 Control Policy 和 VLA 放在同一张概念图里。它提醒读者,今天所谓 VLA 并不天然等于"一个模型从语言一路控制电机",现实系统仍可能保留任务分解、低层控制等不同层级。

这里最值得和 2016 年那篇放在一起看的,并不是网络结构变复杂了多少。

真正的变化在于知识从哪里来。

  • 过去,研究者希望机器人通过自己的身体和环境交互,一点点建立语言与 Sensorimotor Experience 的联系;
  • 今天的 VLM 已经从互联网规模的图文数据里获得了大量视觉语言知识。

于是 VLA 面对的问题进一步变成:

怎样把互联网里学到的视觉语言知识,再 Ground 到机器人自己的 Action Space?

这就是为什么今天很多 VLA 会从已有 VLM 出发,再增加动作表示、Action Decoder 或 Action Expert,并使用机器人轨迹继续训练。

▲图 | VLA 并不是从一条孤立技术线上长出来的。综述的时间线同时追踪了计算机视觉、自然语言处理、强化学习、世界模型以及机器人控制的发展,最终这些原本分散的能力在视觉、语言和动作的统一建模中逐渐汇合。图中的时间线更适合用来观察技术来源,而不是理解成所有模型都必须经历的固定路线。

所以两篇综述连起来读,会发现一个非常漂亮的十年跨度:

2016 年的问题是"一个词怎样通过身体获得意义";

2026 年的问题则是"已经从互联网学会大量概念的模型,怎样真正获得身体"。

Grounding 从来没有消失,变化的是 Grounding 的起点、数据规模,以及模型能利用的先验知识。

▲图 | 从 Symbol Emergence 到 VLA,核心问题始终是"抽象符号怎样和真实身体经验建立联系"。早期研究更强调机器人通过视觉、触觉、动作以及与人的交互形成词语和概念;今天的 VLA 则先继承互联网规模的视觉语言知识,再利用机器人数据把这些先验进一步 Ground 到 Action Space。

到了这里,机器人已经能够从当前观察和语言直接决定下一步做什么。

对于主要依靠当前观察生成动作、没有显式预测未来的策略,很自然地又会引出最后一个问题:

如果机器人不只看现在,而是能先"想一下未来"呢?

于是,我们又绕回了一个其实非常古老(比GPU的出现还早了9年)的概念:

------世界模型。

06 世界模型:今天最热的新名字,背后也是一道老题

在不少的分享中,都是从"视频生成"出发介绍世界模型, 但 World Model 背后的基本思路,并不是视频生成时代才出现的。

现在也不敢轻易给世界模型下定义,因为业内吵得很凶很混乱。

但是能聊几个脉络。

🚩2020年莱顿大学的 Model-Based Reinforcement Learning 就在解决一个问题:能不能先学习一个环境模型,再利用它进行规划?

文章将问题大体拆成两部分:

一边是 Dynamics Model Learning,包括 stochasticity、uncertainty、partial observability 和 temporal abstraction 等问题;

另一边则是 Planning 与 Learning 如何结合,包括什么时候开始规划、给 Planning 和真实数据采集多少预算,以及最终如何把规划放回 acting loop。

借助这篇重点是先理解 World Model 最朴素的价值:

如果机器人能够预测"做了 A 之后世界会变成 B",就不一定所有尝试都必须先在真实世界里发生。

这个思想,本身到是一点都不"新"。

真正变化的,是今天"模型世界"的能力边界。

🚩2026年南洋理工大学等发布了 World Model for Robot Learning: A Comprehensive Survey

这篇综述将 World Model 的作用拓展至策略学习(Policy Learning)、规划(Planning)、学习式仿真器(Learned Simulator)、性能评估(Evaluation)与数据生成(Data Generation)五大方向;

同时专门梳理机器人视频世界模型的演进脉络:从基于想象的生成范式,进一步朝着可控制、结构化、基础大模型尺度的体系方向发展。

▲图 | 机器人世界模型与 Policy 的结合正在从相对解耦走向更紧密的联合建模。早期方法往往先生成未来视觉,再通过逆动力学模型恢复动作;后续则出现 Single-backbone、MoE/MoT、Unified VLA 和 Latent World Modeling 等路线,让未来预测和动作生成在同一个模型或表示空间中发生更深的交互。

这恰好体现了 World Model 过去几年最明显的变化。

  • 过去,一个 Dynamics Model 可能只需要预测紧凑状态空间里的:
    当前状态 + Action → 下一状态。
  • 今天,视频生成模型的发展让研究者开始尝试直接建模更加高维的视觉未来:
    机械臂向左推动杯子之后,桌面会变成什么样?执行这段轨迹后,物体会落在哪里?甚至进一步把生成出来的未来用于 Policy Learning、训练数据生成、模拟和评测。

于是同一个问题,从"学习状态转移"逐渐走向了"生成机器人可能经历的未来"。

▲图 | 新一代 Robotic Video World Model 不再只追求"未来画面看起来像真的"。综述把 imagination-based supervision、动作条件、语言条件和结构先验放在一个统一框架中,核心目标是让生成的未来不仅视觉合理,还能随着机器人 Action 正确变化,并保留接触、物体关系等对决策真正有用的信息。

这也是为什么世界模型看起来像是具身智能的新热点,却和几十年前的 Model-Based Control、Planning 和 RL 有着非常直接的"血缘关系"。

▲图 | Video World Model 可以把"状态转移预测"变成更直观的视觉未来:模型读取历史观察和候选 Action,生成机器人执行之后可能出现的一段未来画面。与传统低维 Dynamics Model 相比,它能够表达更丰富的环境变化,但生成质量最终仍要用 Planning、Policy Evaluation 或数据生成等下游任务来检验。

新的是生成能力和规模,不是"预测未来再行动"这件事本身。

▲图 | 世界模型今天可以扮演不止一种角色:既能和 Policy 耦合以辅助动作生成,也能作为 Learned Simulator 服务于强化学习和评测,还可以直接预测高维视觉未来。不同路线形式差异很大,但共同点都是在机器人真正行动之前,先显式或隐式地建模"这个动作会把世界变成什么样"。

07 今天,具身智能的那些热门问题,都能在更早的机器人研究中找到自己的"前身"

如果只看模型名字,很容易觉得技术经历了一次彻底换代。

但如果沿着这 12 篇综述从基础一路读到今天,会看到另一条更连续的演进:

经典问题没有消失,变化的是解决这些问题的技术单位越来越大。

  • 过去,一个问题往往对应一个相对独立的模块:

感知有自己的模型,规划有自己的算法,控制有自己的系统,语言理解、Skill Learning 和 Dynamics Modeling 也各自在不同的研究社区推进。

  • 而 Foundation Model 带来的变化,是这些原本分开的能力开始通过共享的数据、统一的表示和更大的模型彼此连接:

VLM 可以同时参与感知和规划; LLM 可以成为 Skill 的编排器; Demonstration 可以从一次教学,变成 Foundation Policy 的训练数据; VLA 尝试把视觉、语言和动作直接放进同一套模型;

World Model 又开始把 Policy、Planning、Simulator 和数据生成联系起来。

但另一面也同样重要。

模块可以融合,物理世界却不会因此变简单。 摩擦、碰撞、动力学、传感器噪声、实时性、数据成本和机器人身体差异,都不会因为模型参数变多而自动消失。

这也是为什么读经典综述依然有意义,因为老论文告诉我们的,往往不是一个今天已经过时的网络结构,而是:

这个问题为什么从一开始就难。

而新的综述则告诉我们,大模型解决了其中哪一部分,又把哪些原来的问题带进了一个更大的系统里。

由于我们读者大多都是热衷关注技术发展的,如果计划把这 12 篇综述当成一套"补课路线",推荐大家可以先用经典论文建立 Planning、Skill、Imitation、RL、Grounding 和 Model-Based Learning 的基本问题意识,再去读 Foundation Model、VLA 和新一代 World Model。

这样追最新模型时,看到的不只是新的缩写,而是同一个老问题究竟被换成了什么新解法。

行业现在的共识大致是:

短期 VLA 仍是机器人控制的主体,世界模型更多承担辅助规划、数据生成、仿真预演,长期走向双向融合。

我对这个共识没有异议。但,这些判断全是工程判断,不是科学判断。

至少当前它们成立的前提不是「我们证明了这条路」,而是「我们暂时没找到更好的」。

也或许,有人正走在赌对了的那条路上。

共勉。

Ref

1. Integrated Task and Motion Planning.

2. Real-World Robot Applications of Foundation Models: A Review.

3. A Survey of Behavior Trees in Robotics and AI.

4. Large Language Models for Robotics: Opportunities, Challenges, and Perspectives.

5. A Survey of Robot Learning from Demonstration.

6. What Foundation Models Can Bring for Robot Learning in Manipulation: A Survey.

7. A Tour of Reinforcement Learning: The View from Continuous Control.

8. Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes.

9. Symbol Emergence in Robotics: A Survey.

10. A Survey on Vision-Language-Action Models for Embodied AI.

11. Model-Based Reinforcement Learning: A Survey.

12. World Model for Robot Learning: A Comprehensive Survey.

相关推荐
明志数科1 小时前
机器人数据采集过程中五类异常片段的判定与处理
机器学习·机器人
AIGCmagic社区10 小时前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案
人工智能·aigc·具身智能
PascalXie15 小时前
服务机器人避障用的深度相机,主流选型有哪些?
计算机视觉·机器人
鲁邦通物联网17 小时前
机器人梯控防夹避让设计:高峰期人机混行状态机解析
机器人·机器人梯控·agv梯控·机器人乘梯·机器人自主乘梯
倍利福猎头公司官方账号18 小时前
2026具身智能赛道还火热吗?机器人人选该如何思考下半年的工作机会?
人工智能·面试·职场和发展·机器人·求职招聘
星云API技术支持19 小时前
企业微信二次开发项目实战:从实例接入到消息收发与 Webhook 回调的完整链路
机器人·yapi·企业微信
星云API技术支持21 小时前
企业微信二次开发如何实现外部群自动化?从消息监听到接口调用完整流程
机器人·yapi·企业微信
骑着蜗牛撵大象3271 天前
微信远程指挥电脑:用Hermes Agent构建本地AI执行引擎实战指南
机器人·自动化·es
硅谷秋水1 天前
RoboChallenge:具身策略的大规模真实机器人评估
计算机视觉·语言模型·机器人