具身智能开放策略之Octo详解:开放策略如何把多机器人经验变成可微调的通用底座

写在前面

从零走向AGI 】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。

项目地址 🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间

猫先生

从零走向AGI

面试面经

AIGC算法岗/开发岗面试面经交流社群 (涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

Octo详解:开放策略如何把多机器人经验变成可微调的通用底座

导读

Octo(An Open-Source Generalist Robot Policy)要回答的问题,是机器人策略能不能像视觉或语言模型一样,先在多种机器人、多种任务上预训练,再用少量目标域数据迁移到新的平台。论文发布了一个完整开放的通用机器人策略:模型、训练代码、数据处理流程和检查点都可获得。它使用 Open X-Embodiment 中筛选出的 25 个数据集、约 80 万条轨迹进行训练,并在 9 个机器人设置上评估。

Octo 的关键不只是"把数据集做大",而是把不同机器人的输入和输出都拆成可插拔 token。语言指令、目标图像、多个相机和本体感知信息先进入各自 tokenizer,再由同一个 Transformer 处理;新增传感器或动作空间时,只需增加轻量编码器、位置嵌入或 action head,就能在下游微调,而不必重训整个骨干。动作端使用条件扩散头预测动作片段,使策略可以表达多峰、连续的操作分布。

实验显示,Octo 在预训练分布内可直接控制多种机器人;在每个新领域约 100 条示范的条件下,微调平均成功率达到 72%,高于从头训练和 VC-1 视觉表征基线。它的价值由此落在一个很实际的接口上:预训练阶段吸收跨机器人经验,部署阶段允许用户更换观察和动作定义

猫先生认为,Octo 最值得关注的不是"通用"这个标签,而是它把通用性落实成了可替换的输入 token、readout token 和输出 head。机器人形态无法统一时,接口的可扩展性比强行寻找一个固定动作空间更重要。
论文标题 :Octo: An Open-Source Generalist Robot Policy

论文地址https://arxiv.org/abs/2405.12213

项目主页https://octo-models.github.io

GitHubhttps://github.com/octo-models/octo

原文脉络

论文按照"为什么需要通用策略---Octo 如何设计---跨平台实验---设计选择消融---讨论与未来工作"的顺序展开。前两节说明单机器人、单任务策略的数据成本和泛化边界;第三节把灵活 token 接口、跨数据集训练和扩散动作头组合起来;第四节分别验证零样本控制、数据高效微调以及架构、数据、目标函数和模型规模的影响。

1-2. 背景与相关工作:机器人策略为何需要开放接口

传统机器人学习通常为一台机器人和一个任务单独采集示范,策略输入、相机配置和动作空间在训练时就被固定。跨机器人数据可以增加经验覆盖,但不同平台的摄像头、自由度、控制频率和动作定义并不一致,直接拼接数据往往会把模型锁死在某一种接口上。

此前的 RT-X、RoboCat 等工作证明多机器人预训练有价值,但通常限制了下游输入,或缺少方便的微调方案。Octo 的定位更接近一个可复用的策略初始化:它不承诺一个模型零样本解决所有新任务,而是让预训练骨干能够在新传感器、新动作空间和新机器人形态上继续学习。

3. Octo 模型:把策略接口拆成 token

3.1 统一的输入 token 与 Transformer 骨干

Octo 将任务定义和观测序列写成统一 token 序列。语言指令经过预训练的 T5-base 编码;目标图像和相机图像经过轻量卷积网络后切成 patch token;本体状态等结构化信号则由对应的小型 tokenizer 映射到相同维度。序列大致可以写成:

T = T T , T o , 1 , T o , 2 , ... , T o , H + p , \mathcal{T}=\left\\mathcal{T}_{T},\\mathcal{T}_{o,1},\\mathcal{T}_{o,2},\\ldots,\\mathcal{T}_{o,H}\\right+p, T=TT,To,1,To,2,...,To,H+p,

其中 T T \mathcal{T}{T} TT 是语言或目标图像等任务 token, T o , t \mathcal{T}{o,t} To,t 是第 t t t 个时刻的观测 token, p p p 是可学习位置嵌入。

图 1:Octo 以 80 万条 Open X-Embodiment 轨迹预训练,同时支持语言或目标图像指令,并可微调到新的观察和动作空间。来源:论文 Figure 1。

Transformer 使用 block-wise attention。当前观测只能访问任务 token 以及当前和过去的观测,避免未来信息泄漏;数据集中不存在的输入通道则整体 mask。这样,带语言和不带语言、单相机和多相机的数据都可以共用同一骨干。

3.2 Readout token 与可插拔输出头

每个时刻插入一个 learned readout token。它可以读取此前的任务和观测表示,却不会反向影响这些 token,作用类似 BERT 的 [CLS]:把到当前时刻为止的上下文压缩成动作解码器需要的向量。新增动作空间时,保留 Transformer 参数,只增加新的 readout 位置嵌入和输出 head。

图 2:模型架构与 block-wise attention。虚线模块表示微调时可以新增的传感器或动作输出,主干参数无需重新初始化。来源:论文 Figure 1(Model architecture)。

猫先生认为,Octo 的工程关键是"主干稳定、接口可换"。它没有假设所有机器人都能被压成统一关节向量,而是把差异留在输入 tokenizer 和输出 head,让共享表示承担跨任务迁移。

3.3 扩散动作头:预测连续的动作片段

Readout embedding 进入轻量条件扩散头。模型从高斯噪声 x K x^K xK 开始,经过 K K K 次去噪得到一段连续动作,而 Transformer 只需前向一次:

x k − 1 = α ( x k − γ ϵ θ ( x k , e , k ) + N ( 0 , σ 2 I ) ) . x^{k-1}=\alpha\left(x^k-\gamma\epsilon_{\theta}(x^k,e,k)+\mathcal{N}(0,\sigma^2I)\right). xk−1=α(xk−γϵθ(xk,e,k)+N(0,σ2I)).

训练时对专家动作加入噪声,再让 ϵ θ \epsilon_\theta ϵθ 恢复原动作。动作以 chunk 形式预测,能够覆盖多个连续控制步,并通过扩散分布表达同一观察下可能存在的多种合理行为。论文的消融显示,扩散头比 MSE 动作头或离散化动作分布更适合跨数据集的行为多样性。

3.4 训练数据与开放实现

Octo 从 Open X-Embodiment 中筛选 25 个包含图像、末端执行器动作且行为较多样的数据集,形成约 80 万条轨迹的训练混合。数据预处理会移除没有图像流、分辨率过低或过于重复的数据;更丰富的数据集提高采样权重,缺失的相机通道用零填充,夹爪动作也被对齐到统一语义。模型提供 27M 和 93M 参数两个检查点,并开放预训练与微调代码。

图 3:25 个训练数据集在每个 batch 中的采样组成。数据混合同时考虑数据量、行为多样性和重复样本问题。来源:论文 Figure 2。

4. 实验设置与结果:零样本控制和少样本微调

4.1 九个机器人设置覆盖不同迁移难点

实验覆盖 4 个机构的 9 个真实机器人设置,既包括预训练分布中的平台,也包括需要新输入、新动作空间或新形态的目标域。评测任务包含长时序操作、精确插入、双臂协作和不同物体交互。

图 4:九个机器人设置及典型任务。评测同时考察预训练分布内控制和新域微调。来源:论文 Figure 3。

4.2 零样本:目标图像提供更强的任务约束

在预训练数据覆盖的环境中,Octo 可直接接受自然语言任务并控制多种机器人。与 35M 参数的 RT-1-X 相比,平均成功率高出约 29%;在 WidowX 和 RT-1 Robot 上,其表现与参数量 55B 的 RT-2-X 相近。Octo 还支持目标图像条件,在 WidowX 任务上目标图像条件比语言条件高约 25%,说明目标状态的视觉描述能减少语言歧义。

零样本能力并不等于任意新任务都能执行。新物体通常保持较高成功率,但换场景会下降,翻转或精确插入等新行为下降更明显;这正是微调接口存在的原因。

4.3 约 100 条示范即可迁移到新域

六个目标域各使用约 100 条示范、统一微调超参数和 20 次试验。Octo 微调成功率分别为 Berkeley Insertion 70%、Stanford Coffee 75%、CMU Baking 50%、Berkeley Pick-Up 60%、Berkeley Coke 100%、Berkeley Bimanual 80%,平均 72%。从头训练基线平均 20%,VC-1 视觉表征基线平均 15%。

这些任务还刻意加入新条件:Insertion 增加力矩传感器,Pick-Up 和 Bimanual 切换到关节位置控制,Coke 和 Bimanual 使用新的机器人形态。Octo 的收益因此不仅来自视觉特征迁移,也来自可扩展的观察与动作接口。

4.4 设计消融:数据规模、灵活性与动作分布同样重要

消融围绕四组变量展开。架构方面,允许更灵活输入输出的 token 化设计优于固定输入布局;数据方面,更宽的数据混合通常优于只使用单一数据集;目标函数方面,扩散动作头优于 MSE 和离散动作头;模型规模方面,93M 参数模型通常优于 27M,但收益取决于数据覆盖和微调设置。

图 5:论文对不同机器人设置和设计选择的比较结果,体现 Octo 在零样本控制与微调中的整体优势。来源:论文 Figure 4 及相关实验。

猫先生认为,实验最有说服力的地方不是单个最高成功率,而是同一套微调配方能够跨越传感器、控制方式和机器人形态变化。它把"通用策略"从展示型 demo 推进成了可迁移的工程起点。

5. 讨论、局限与可复现性

Octo 的开放性覆盖检查点、训练代码、数据处理、微调脚本和监控工具,这降低了复现实验和继续训练的门槛。但开放策略仍受数据混合质量制约:不同数据集的动作语义、相机分布和任务难度并不完全一致,零填充和夹爪对齐只能解决接口层问题,不能消除数据偏差。

模型在预训练分布外的全新技能、长时序规划和高精度接触操作上仍需要目标域数据。93M 参数规模也不意味着可以忽略真实机器人采集、控制延迟和安全约束。后续工作需要更系统地研究数据权重、跨形态动作表示,以及如何让微调不破坏原有通用能力。

总结:开放策略的核心是可迁移接口

Octo 的技术路线可以收束为三点:用大规模跨机器人轨迹获得通用初始化;用 tokenizer、block-wise attention 和 readout token 保持观察与动作接口可替换;用条件扩散头表达连续、多峰的动作片段。结果表明,在已有经验覆盖的任务上可以直接控制多种机器人,在新传感器、新动作空间和新形态上也能用约 100 条示范完成有效微调。

它并没有消除机器人数据和真实部署的成本,但把每个新任务从"重新训练一个策略"变成"接入接口并微调一个开放底座"。这正是 Octo 对后续通用机器人模型最实际的贡献。

参考资料

  1. Octo: An Open-Source Generalist Robot Policy
  2. Octo 官方项目主页
  3. Octo GitHub

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

相关推荐
星云API技术支持2 小时前
企业微信二次开发:外部群机器人如何把群消息接入工单系统?
机器人·企业微信
星云API技术支持。4 小时前
企业微信二次开发:外部群机器人,从群消息到业务系统如何打通?
机器人·企业微信
AI科技先锋报5 小时前
如何为陪伴机器人搭建自然的对话式 AI?技术链路与声网方案怎么选?
人工智能·机器人·语音识别
CES_asd5 小时前
2027赛逸展聚焦工业场景,加速机器人产线落地应用
机器人
沫儿笙5 小时前
焊接机器人节气系统
人工智能·机器人
星云API|微信接口开发6 小时前
企业微信二次开发外部群机器人,图片文件消息如何统一解析?
机器人·企业微信
广州虚拟动力-动捕&虚拟主播6 小时前
Ego数据采集服务上线!构筑具身智能的数据基石
机器人·数据采集
恒锐丰小瑞7 小时前
率能SS8837T 12V/1.8A/单通道H桥电机驱动IC,超低睡眠电流(120nA)与独立逻辑电源,用于摄像机/玩具/机器人
嵌入式硬件·机器人
tianxuanjg8 小时前
工业 / 协作机器人手腕手掌零部件采购指南|轻量化复杂结构件如何平衡精度与加工效率
经验分享·机器人·无人机·制造