具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”

写在前面

从零走向AGI 】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。

项目地址 🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间

猫先生

从零走向AGI

面试面经

AIGC算法岗/开发岗面试面经交流社群 (涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

具身智能语言规划之SayCan详解:让大模型"会说",也让机器人"能做"

导读

大语言模型知道"饮料洒了应该拿东西清理",却不知道眼前有没有海绵、机器人能不能拿起它。只依赖语言模型生成计划,语义上合理的回答很可能无法执行;只依赖低层机器人策略,又难以理解抽象、长时程的自然语言目标。SayCan 将两种能力拆开组合:LLM 负责判断某个技能对完成指令是否有用 (Say),技能价值函数负责判断它在当前状态下是否可做(Can)。两项分数相乘后,机器人执行得分最高的技能,再根据新状态继续规划。

这套方法没有把语言模型直接训练成动作控制器,也没有要求它输出连续关节动作。LLM 只在预定义技能集合上充当高层规划器,低层控制仍由行为克隆和强化学习策略承担。论文在 101 条真实机器人指令上验证了这一接口:PaLM-SayCan 在训练用模拟厨房中达到 84% 的规划成功率和 74% 的执行成功率;进入真实办公室厨房后分别为 81% 和 60%。

图 1:普通 LLM 可能给出语言上合理、机器人却无法执行的建议;SayCan 用技能价值函数约束候选动作。来源:论文 Figure 1。

猫先生认为 ,SayCan 的历史价值不在于把 LLM 接上机器人这么简单,而在于提出了一个清晰的中间接口:语言模型负责"应该做什么",机器人价值函数负责"现在能不能做"。后来许多具身智能系统追求更紧密的端到端融合,但这个分工仍是理解语言规划如何落地到物理世界的起点。

原文脉络

Introduction 先定义 LLM 缺少物理 grounding 的问题;Preliminaries 分别回顾语言模型概率和强化学习价值函数。Section 3 推导 SayCan 的核心评分与迭代规划,Section 4 说明低层技能、价值函数和移动机械臂如何实现。Section 5 用 101 条指令、消融和 PaLM 扩展实验验证系统,Section 6 提供仿真开源版本,Related Work 与 Conclusion 最后讨论边界和后续闭环方向。

1--2. Introduction 与 Preliminaries:语言知识为何不能直接变成机器人计划

LLM 从文本中吸收了大量常识,可以把"帮我收拾洒掉的饮料"拆成寻找清洁工具、拿起工具、带到用户身边等步骤。问题在于,它既没有观察当前场景,也没有经历动作的物理后果。模型可能建议使用吸尘器,却不知道房间里没有吸尘器,机器人也没有操作吸尘器的技能。

SayCan 假设机器人已有一组短时程技能 Π \Pi Π。每个技能 π \pi π 包含低层控制策略、自然语言描述 ℓ π \ell_\pi ℓπ,以及从状态 s s s 出发成功完成该技能的概率 p ( c π ∣ s , ℓ π ) p(c_\pi\mid s,\ell_\pi) p(cπ∣s,ℓπ)。当稀疏奖励只在技能成功时取 1、否则取 0,强化学习价值函数可以解释为一种 affordance function(可供性函数):它回答"当前状态是否允许机器人完成这项技能"。

语言模型则给出 p ( ℓ π ∣ i ) p(\ell_\pi\mid i) p(ℓπ∣i),表示技能描述 ℓ π \ell_\pi ℓπ 作为高层指令 i i i 的下一步有多合理。前者来自物理经验,后者来自语言知识。SayCan 的方法核心就是让两种概率在同一个有限技能空间里会合。

3. SayCan:用"相关性 × 可执行性"选择下一项技能

3.1 Say:把生成式语言模型变成候选技能评分器

SayCan 不让 LLM 自由写出一整段计划,再把文本硬映射到机器人动作。系统通过 few-shot prompt 把交互组织成"用户提出指令---机器人逐步回答"的对话,并对每个已知技能描述计算条件概率。第 n n n 步选择时,LLM 的输入包含原始指令以及此前已经执行的技能:

p π L L M = p ( ℓ π ∣ i , ℓ π n − 1 , ... , ℓ π 0 ) p_{\pi}^{\mathrm{LLM}}= p(\ell_\pi\mid i,\ell_{\pi_{n-1}},\ldots,\ell_{\pi_0}) pπLLM=p(ℓπ∣i,ℓπn−1,...,ℓπ0)

候选输出被限制在技能库与终止项 done 中,因此模型不会凭空创造机器人没有的动作。它仍然可能给"拿起海绵"很高的语言分数,即使机器人尚未靠近海绵;物理可行性要由另一半解决。

3.2 Can:价值函数把当前场景压成技能可供性

每项技能对应的价值函数根据当前视觉观测和语言条件,估计执行成功概率:

p π a f f o r d a n c e = p ( c π ∣ s n , ℓ π ) p_{\pi}^{\mathrm{affordance}}=p(c_\pi\mid s_n,\ell_\pi) pπaffordance=p(cπ∣sn,ℓπ)

场景中能看到苹果时,"拿起苹果"的分数会升高;机器人还在空旷区域时,各种抓取技能的值都会偏低。价值函数因此同时传入了两类约束:环境里有什么,以及机器人此刻具备什么控制能力。它不是完整的符号世界状态,却提供了与实际技能成功率直接相关的物理反馈。

3.3 乘法融合与逐步重规划

SayCan 将两个分数相乘,选择联合得分最大的技能:

π n = arg ⁡ max ⁡ π ∈ Π p ( c π ∣ s n , ℓ π )   p ( ℓ π ∣ i , ℓ π n − 1 , ... , ℓ π 0 ) \pi_n=\arg\max_{\pi\in\Pi} p(c_\pi\mid s_n,\ell_\pi)\, p(\ell_\pi\mid i,\ell_{\pi_{n-1}},\ldots,\ell_{\pi_0}) πn=argπ∈Πmaxp(cπ∣sn,ℓπ)p(ℓπ∣i,ℓπn−1,...,ℓπ0)

乘法意味着任何一侧接近零都能否决候选:一个动作即便语义相关但做不到,或者容易执行却无助于目标,都不应成为下一步。机器人执行 π n \pi_n πn 后得到新状态 s n + 1 s_{n+1} sn+1,系统把这项技能追加到对话上下文,再为下一步重新计算全部分数,直到 done 获胜。

图 2:LLM 对候选技能给出指令相关性,价值函数给出当前状态下的成功概率;联合分数选择下一项技能并循环执行。来源:论文 Figure 3。

这是一种高层闭环,但反馈通道很窄:环境只通过当前技能价值进入决策。若某次技能执行失败,却没有让价值函数或状态表征发生足够变化,LLM 不一定知道失败原因;论文也把更丰富的成功检测、场景描述和人类反馈列为后续方向。

猫先生认为,乘法公式看起来朴素,关键是它把不可比较的两类知识变成了同一组技能上的概率排名。**SayCan 的创新更多在系统接口与决策分解,而不在新的语言模型或低层控制网络。**这也解释了它为什么容易扩展,却受技能库覆盖率和价值函数校准上限约束。

4. Implementing SayCan:低层技能如何支撑语言规划

每项技能都需要控制策略、价值函数和文本标签。作者使用 BC-Z 风格的图像行为克隆策略与 MT-Opt 风格的强化学习策略,并以 TD 学习的价值函数作为可供性模型。多任务策略通过冻结的 Universal Sentence Encoder 表征技能文本,从而共享网络而不必为每个技能单独训练一套模型。

机器人是带 7 自由度机械臂和双指夹爪的移动操作平台。策略动作覆盖末端执行器 6 自由度、夹爪开合、移动底盘的平移与偏航以及终止动作。研究团队提出了横跨 7 类、17 个对象的 551 项技能,再从中使用成功率较高、适合组合的技能完成寻找、抓取、放置、移动和抽屉操作。

这种模块化带来两面性。增加新技能时,只需给 LLM 增加候选文本、为技能提供策略与价值函数,并在 prompt 中加入示例;但 LLM 的开放语言能力最终仍被离散技能表截断。语言理解可以零样本泛化,机器人能力却不会仅靠改写提示词自动增长。

5. Experimental Evaluation:规划正确不等于机器人完成

5.1 101 条指令与两个成功指标

评测覆盖模拟办公室厨房和真实办公室厨房,包含 15 个物体、5 个语义位置及 7 类共 101 条指令。任务从单一原子动作扩展到抽象名词、抽象动词、结构化表达、体现当前机器人状态的 embodiment 指令、众包口语指令和长时程组合。

论文分开报告 plan successexecution success。前者由三名评审判断技能序列是否能实现目标,后者判断真实执行是否完成任务,均以至少两人同意为成功。这个区分很重要:高层计划可能完全正确,但抓取、导航或放置中的任一低层失败都会让整条任务失败。

PaLM-SayCan 在训练环境中取得 84% 规划成功率与 74% 执行成功率;真实厨房中降到 81% 和 60%。自然语言动词类规划成功率达到 100%,embodiment 类只有 64%;长时程任务为 73% 规划、47% 执行,连续步骤放大了提前终止和低层技能失败。

图 3:机器人依次处理可乐、苹果和水,再寻找海绵并返回桌边,完整计划包含 17 个步骤。来源:论文 Figure 5(b)。

5.2 两侧消融证明缺一不可

移除价值函数后,No VF 只按 LLM 最大分数选技能,规划成功率为 67%;让 LLM 自由生成步骤后再用句向量映射到技能库,Generative 为 74%,都低于完整系统的 84%。移除高层 LLM 时,直接把完整指令输入行为克隆策略的 BC NL 在这些组合任务上为 0%;用 USE 将指令投影到已知技能的 BC USE 总执行成功率只有 9%。

图 4:蓝色表示语言相关性、红色表示技能可供性、绿色为联合得分;系统逐步选择寻找海绵、拿起海绵、带给用户和结束。来源:论文 Figure 6。

更强语言模型也确实改善了机器人系统:PaLM-SayCan 达到 84%/74%,FLAN-SayCan 为 70%/61%。这组对照说明上游 LLM 的规划提升可以传递到机器人,但传递并非无条件成立------真实厨房的执行下降仍由低层策略、感知分布和价值函数决定。

错误分析进一步给出边界:65% 的规划错误来自 LLM,35% 来自 affordance。模型容易在长任务中过早输出 done,也会受否定表达和歧义指代影响。新增抽屉技能的 21 条指令达到 100% 规划成功率,却只有 33% 执行成功率,清楚展示了"会规划"与"做得到"之间仍有距离。

5.3 PaLM 带来的新能力

v2 还展示了三类扩展。加入开、关和前往抽屉等新技能后,SayCan 可通过候选列表和少量 prompt 示例使用它们;加入 Chain-of-Thought 时,模型先生成 Explanation,再据此评分候选技能,缓解部分否定和常识推理问题;依靠 PaLM 的多语言训练,中文、法语和西班牙语指令的规划成功率几乎没有下降。

这些实验更接近能力案例而非大规模独立基准。它们说明模块接口具有可扩展性,但不能证明系统已获得开放世界泛化:新动作仍需训练策略和可供性,新环境仍可能让价值函数失准。

6--8. 开源、相关工作与局限:SayCan 留下了什么

作者开放的是一个桌面仿真版本:UR5 机械臂使用 CLIPort 完成彩色积木与碗之间的拾放,ViLD 检测器近似提供可供性,GPT-3 负责语言规划。它复现了 SayCan 的接口思想,但并不是论文中 Everyday Robots 移动机械臂、PaLM 和真实厨房策略的完整开源复刻。

SayCan 的局限与优点来自同一处。有限技能库让计划可解释、可约束,也限制了开放动作空间;价值函数把现实状态传给 LLM,却只提供当前候选技能的压缩反馈;逐步选择能随状态更新,但没有显式维护完整任务记忆、失败原因和长期世界模型。它更像"LLM 调度已训练技能的执行器",而不是今天所说的端到端 VLA。

总结:Say 与 Can 的接口比模型规模更值得记住

SayCan 将自然语言长任务拆成一系列可验证的技能选择:LLM 提供任务相关性,价值函数提供物理可执行性,乘法融合负责在两者之间做决策。101 条真实机器人指令、语言与价值函数消融以及 PaLM/FLAN 对比共同支持了这一设计,但真实环境与长时程任务的执行率也说明低层能力仍是系统瓶颈。

猫先生认为 ,今天回看 SayCan,最值得保留的不是具体的 PaLM、BC-Z 或 MT-Opt 配方,而是"语义规划必须接受物理能力否决"的原则。端到端 VLA 可以把接口藏进同一个网络,世界模型也可以提供更丰富的未来反馈,但机器人最终仍要同时回答两个问题:这一步对目标有用吗,以及我现在真的做得到吗?

参考资料

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

相关推荐
恒锐丰小瑞3 小时前
率能SS6811H 38V/1.6A/双通道H桥驱动芯片,PWM控制接口与低功耗睡眠模式,用于舞台灯光/安防相机/机器人
单片机·嵌入式硬件·数码相机·机器人
恒锐丰小瑞4 小时前
率能SS8833T 15V/1A/双通道H桥驱动芯片,低静态电流与过温报警输出(FAULT),用于POS打印机/机器人/电池玩具
stm32·单片机·机器人
机器人猎头David4 小时前
机器视觉在机器人行业中有哪些实际应用?
人工智能·机器人·招聘·机器人猎头·猎头公司
企鹅的企4 小时前
2027北京具身智能机器人展:78%复订率锚定行业标杆地位
机器人
就是一顿骚操作6 小时前
GRU:用重置门与更新门简化序列记忆的经典解读
人工智能·深度学习·gru·论文解读
咕泡科技6 小时前
世界机器人大会WRC2026观察:机器人告别表演时代,具身智能工程人才缺口显现
机器人·具身智能·世界机器人大会·wrc2026·ai人才培养
dorky-org6 小时前
03-Python基础
python·具身智能
陈天伟教授6 小时前
【30天学会机械制图】项目一 从平面图形开始 任务1 按标准来画图,都懂你!
大数据·人工智能·平面·机器人·具身智能机器人技术
赋创小助手7 小时前
机器人研发负载拆解:数据、仿真、训练与推理分别需要哪些计算资源?
服务器·人工智能·机器人·具身智能·gpu计算