[2024] [π0] [π0: A Vision-Language-Action Flow Model for General Robot Control]

π0: A Vision-Language-Action Flow Model for General Robot Control, 2024

RT-2 中将动作离散化为 256 个离散 token

  • 缺点:精度受限、动作生硬

π0 通过 Flow Matching 直接输出连续动作,避免离散化

  • 使用一个动作专家

损失函数

L τ ( θ ) = E p ( A t ∣ o t ) , q ( A t τ ∣ A t ) ∥ v θ ( A t τ , o t ) − u ( A t τ ∣ A t ) ∥ 2 L^\tau(\theta) = E_{p(A_t|o_t),q(A_t^\tau|A_t)} \| v_\theta(A_t^\tau,o_t) - u(A_t^\tau|A_t) \|^2 Lτ(θ)=Ep(At∣ot),q(Atτ∣At)∥vθ(Atτ,ot)−u(Atτ∣At)∥2

  • 其中 t 表示机器人的时间步,τ 表示 flow matching 中的时间步
  • 加噪动作:A_t\^τ= τ A_t + (1-τ) ε
  • 目标速度场: u = A t − ε u = A_t - ε u=At−ε
  • ε 是高斯噪声

这个公式对比 Flow Matching 中的 公式 (9)

  • A t A_t At 对应公式 (9) 中的目标数据 x 1 x_1 x1,
  • A t τ A_t^\tau Atτ 对应公式 (9) 中的中间数据 x, 是真实动作块 A t A_t At 在时间 τ 时刻被噪声 "污染" 后的版本

训练目标是得到一个去噪器:学会了如何将任何噪声动作块"拉回"到真实动作流形上

推理时,从随机噪声 A t 0 ~ N ( 0 , I ) A_t^0~ N(0, I) At0~N(0,I) 开始

A t τ + δ = A t τ + δ v θ ( A t τ , o t ) A_t^{\tau+\delta} = A_t^{\tau} + \delta v_\theta(A_t^\tau, o_t) Atτ+δ=Atτ+δvθ(Atτ,ot)

  • 其中 δ 是步长
    RT-2 试图端到端解决规划和控制,而 π 0 π_0 π0 也可以作为一个可插拔、独立的技能执行模块(结合一个高层的规划 VLM)
  • 好处:增加系统可解释性

结论:

  • 预训练模型有一些 zero-shot 的能力,但是复杂任务需要在高质量数据上微调
  • 如果没有预训练,模型会比较脆弱,不会从失败中恢复
  • 如果没有微调,模型经常无法完成流畅的策略
相关推荐
Java小白笔记1 小时前
AI Agent-CLI 的启动命令与跳过权限模式
人工智能·ai·ai编程
萝萝仔1 小时前
02.人工智能训练师三级是什么?谁适合考?考了有什么用?
人工智能·深度学习·机器学习·ai·云计算
Query*2 小时前
Agent 开发之项目 AI 能力自我进化:通过浏览器自动化与数据采集实现持续学习
java·人工智能·ai·自动化
A55566677787893 小时前
AI漫剧制作平台怎么选?2026一站式影视制作工具与AI真人剧创作软件测评
人工智能·ai
俊哥V3 小时前
每日 AI 研究简报 · 2026-08-28
人工智能·ai
张忠琳3 小时前
【deepseek-harness】Cordis 时空可组合性编程范式 — 三段式精读笔记(一)
ai·agent·deepseek·harness·cordis·dsh
神奇霸王龙3 小时前
Codex MCP GA 实测:Qwen / GLM / Kimi / DeepSeek / MiniMax 调度 Codex 沙箱的真实成本
人工智能·ai·agent·ai编程·原型模式·mcp
SamChan903 小时前
Python+PyMuPDF提取PDF表格并翻译:表格结构检测与双语重建实战
windows·python·ai·pdf·wpf
StarRocks_labs4 小时前
从 6000+ Commit 中识别升级风险:一个 StarRocks AI 升级扫描工具的实现
starrocks·ai·commit·分析·claude code