EI :Emboded Intelligent,NN:Neural Network
一、依托9种深度神经网络的机器人动作训练
前置说明:面向模仿学习(Behavior Cloning)+ 少量强化学习微调 ,适配动捕 BVH、LeRobot 数据集。机器人策略网络分为两大类:视觉编码器(提取图像 / 深度特征) 、动作策略主干网络(输入观测,输出关节 / 末端轨迹) ;下面全部是动作预测主干网络 (视觉骨干 ResNet、ViT 属于感知,后面附带)。
训练范式:行为克隆 BC 、动作分块 Action Chunking 、条件生成模型 、时序序列建模;部署时配合闭环控制(滚动时域 Receding Horizon)。
a. MLP 多层感知器(全连接网络)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 纯全连接层,输入当前观测(本体感知:关节、末端位姿;低维状态),直接输出单步动作,无历史时序记忆。最基础 BC 基线模型。 | 1. 结构极简,参数量小,训练速度极快;2. 推理延迟极低(亚 ms 级),嵌入式控制器可部署;3. 调试简单,收敛稳定,可作为所有任务的 baseline;4. 低维状态空间(仅本体传感、无图像)下效果很好。 | 1. 无记忆能力 ,无法建模时序依赖,只能马尔可夫单步预测;2. 多峰动作分布会直接输出均值,平均化问题严重(同一个观测对应多种可行动作,模型取平均,动作失效);3. 无法直接处理图像输入,必须手工提取特征;4. 长任务误差累积严重,闭环 rollout 极易漂移。 |
框架策略
- 适用场景:低维状态、简单点位控制,单步 BC 基线;四足平衡、简单点位移动。
- 训练框架:PyTorch/TensorFlow 原生,LeRobot 基线;
- 训练策略:监督学习 MSE 损失;
- 部署策略 :单步闭环,每次观测预测下一时刻动作;不适合复杂接触抓取;
- 扩展方案:拼接历史观测窗口(把最近 N 帧状态拼接输入),临时增加时序能力。
b. CNN / 1D Temporal CNN(含 Temporal U-Net,Diffusion Policy-C 的主干)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 2D CNN 用于图像特征提取;**1D 时序 CNN(Temporal U-Net)**专门用于动作序列生成:卷积在时间维度滑动,捕捉局部时序相关性,编码器压缩、解码器恢复动作序列。Diffusion Policy 经典 CNN 版本就是 1D U-Net。 | 1. 局部时序建模能力强,天然适合连续平滑轨迹;2. 训练稳定、超参少,收敛快;3. 1D U-Net 可一次性输出一整段动作 chunk;4. 相比 Transformer 显存开销低;适合小数据集。 | 1. 卷积局部感受野限制,长距离时序依赖弱;2. 容易过平滑,快速突变动作、多模态动作容易丢失细节;3. 无法原生支持语言条件输入;跨模态对齐弱。 |
框架策略
- 适用场景:Diffusion Policy-C,单任务操作、平滑轨迹任务(放置、推物体);
- 训练框架:Diffusion Policy 官方 repo、LeRobot 原生支持;
- 训练策略:扩散模型目标,加噪 - 预测噪声;滚动时域(Receding Horizon);
- 部署策略:DDIM 加速采样(10~20 步去噪),控制推理延迟;
- 选型建议:优先用 CNN-U-Net 做 Diffusion Policy 起步,工程落地首选。
c. LSTM / GRU(循环神经网络 RNN 系列)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 循环结构维护隐藏状态,逐帧读取观测,持续更新内部记忆,输出单步动作;适合时序序列建模,早期机器人模仿学习主力。 | 1. 内置时序记忆,维护任务状态;不需要固定窗口拼接历史;2. 模型体量中等,推理速度尚可;3. 适合时序连续、状态缓慢变化任务(布料折叠、连续跟随)。 | 1. 长序列梯度消失,长任务记忆衰减;2. 并行训练差,只能时序串行;训练慢;3. 长距离依赖建模弱;多峰分布依然存在均值坍缩;4. 现在基本被 Transformer/Mamba 替代。 |
框架策略
- 适用场景:时序缓慢形变物体操作、简单连续任务;多用于仿真基线;
- 框架:PyTorch 原生 LSTM;RoboSuite 旧版;
- 训练策略:序列 BC,逐帧 MSE;
- 部署策略 :在线递归更新 hidden state;不推荐新工程作为主策略,仅做对比 baseline。
d. Transformer(含 ACT,Action Chunking Transformer;Diffusion Policy-T)
ACT:CVAE+Transformer,一次性预测未来 K 步动作 chunk(如 K=100,2s 动作);训练学习动作分布;推理采用时序集成 Temporal Ensembling ,平滑动作块接缝抖动。
Diffusion Policy-T:Transformer 作为去噪网络,cross-attention 把视觉 / 本体观测作为条件,迭代生成动作序列。
| 原理 | 优点 | 缺点 |
|---|---|---|
| 自注意力机制,把观测、动作、语言 embedding 全部变成 token;全局注意力建模任意时序距离依赖。 | 1. 全局时序建模,长距离依赖能力极强;2. Cross-Attention 天然支持多模态条件输入(图像 + 本体 + 自然语言指令),VLA 视觉语言动作模型的标准底座;3. ACT 的 action chunking 大幅缓解单步 BC 的误差累积;4. 多任务、跨本体迁移潜力强;灵巧手、双臂协同表现突出。 | 1. 参数量大,显存占用高;训练、推理开销高于 CNN;2. 超参敏感,注意力权重容易不稳定,调参成本高;3. ACT 属于 CVAE,依然存在一定模式平均问题;4. Transformer 版 Diffusion Policy 推理慢,采样步数多。 |
框架策略
ACT(Action Chunking Transformer)
- 适用场景:桌面双臂操作、插入、精密装配(ALOHA);50~200 条 demo 小数据集;
- 框架:Stanford ACT 源码、LeRobot 原生集成;
- 训练策略:CVAE 变分下界损失;动作块分块预测;
- 部署策略:滚动时域 + 时序集成,消除动作块拼接抖动;推理~10ms,实时性优秀。
Diffusion Policy Transformer 版本
- 适用场景:多模态、多可行轨迹任务,灵巧手高维动作空间;
- 训练:DDPM/DDIM,噪声预测;
- 部署:DDIM 加速采样;算力充足场景。
e. Mamba(结构化状态空间模型 SSM)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 结构化状态空间,线性复杂度,替代 Transformer;输入序列 token,状态空间递归建模时序;复杂度 O (N),Transformer 是 O (N²),长序列成本显著降低。MaIL(Mamba Imitation Learning)专门用于模仿学习。 | 1. 长序列推理速度远快于 Transformer,显存低;2. 对小样本模仿学习效果优于 Transformer;3. 时序连续性强,适合长 horizon 任务。 | 1. 机器人领域生态较新,开源案例少于 Transformer;2. Cross-attention 多模态融合不如 Transformer 成熟;3. 真机落地验证案例偏少。 |
框架策略
- 适用场景:长时序任务、大观测窗口、长轨迹人形步态;
- 框架:MaIL 开源,可接入 LeRobot;
- 训练策略:行为克隆监督学习;
- 部署策略:在线流式状态更新;适合长 horizon 规划 + 动作生成。
f. CVAE / VAE(变分自编码器,常搭配 Transformer/MLP,ACT 底层就是 CVAE)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 编码器把观测压缩为隐变量 z;解码器基于 z 生成动作序列;学习动作分布,而不是学习单一确定动作。 | 1. 建模动作分布,缓解单峰均值坍缩;2. 隐空间采样,可生成多条候选轨迹;3. 输出动作 chunk,时序平滑。 | 1. 隐空间容易模式坍缩,多峰能力弱于扩散模型;2. 隐变量采样会带来随机抖动; |
框架策略
一般不作为独立主干,作为包装器,搭配 Transformer 使用,典型即 ACT。
g. Diffusion Model(扩散模型,Diffusion Policy)
扩散是生成建模范式,不是独立网络结构;主干可以是 1D U-Net CNN 或者 Transformer。
| 原理 | 优点 | 缺点 |
|---|---|---|
| 训练阶段:给示教动作序列逐步加高斯噪声;网络学习预测噪声;推理:从纯噪声迭代去噪,条件约束在视觉 + 本体观测,输出完整动作 chunk。 | 1. 最强多峰分布建模能力,同一个观测下可以学习多种可行动作,解决 BC 均值坍缩;2. 高维动作空间(20 + 自由度灵巧手)表现突出;3. 对示教数据的噪声鲁棒性更好;接触丰富任务性能高。 | 1. 推理需要多步迭代,原生 DDPM 延迟高;DDIM 加速后 40~100ms;2. 训练开销大;对坏示教数据敏感;3. 动作块接缝抖动(chunk 边界跳变)是工程通病。 |
框架策略
- 适用场景:多模态操作、灵巧手、非刚性物体操作;示教存在多种可行方案的任务;
- 框架:Columbia Diffusion Policy、LeRobot;
- 训练:MSE 噪声预测损失;
- 部署:DDIM 10 步加速,滚动时域;可结合知识蒸馏单步扩散(Consistency Model)降低延迟。
h. Flow Matching(流匹配,新一代动作生成范式,RDT / π0 / GR00T)
| 原理 | 优点 | 缺点 |
|---|---|---|
| 属于生成模型,替代 Diffusion;直接学习从噪声到目标动作的连续流场,推理只需要 1~4 步,大幅降低延迟。主干常用 DiT(Diffusion Transformer)。 | 1. 推理速度远优于 DDPM;实时闭环 50Hz 可行;2. 训练更稳定;不需要调大量采样步; | 1. 机器人生态新;开源落地案例仍在积累;2. 同样存在动作块拼接抖动。 |
框架策略
- 适用场景:需要高频闭环的人形机器人、动态交互任务;
- 框架:RDT、π0,LeRobot 新版本支持;
- 部署:1~4 步采样,适合真机实时控制。
i. 视觉骨干网络(配套,非动作策略,但必须搭配使用)
- ResNet(Res18/Res34/Res50):图像编码,经典,轻量;提取视觉特征送入动作策略。优点稳定;缺点全局建模弱。
- ViT Vision Transformer:图像分块 token,全局视觉特征;VLA 模型标配。优点全局感知;缺点显存高。
工程标准组合:ResNet/ViT 图像编码器 + 动作主干网络(CNN-Unet / Transformer / Mamba)
二、横向完整对比表(面向模仿学习,LeRobot 数据集、动捕采集的示教数据)
表格
| 网络 / 模型 | 时序能力 | 多模态(图像 + 语言) | 多峰动作建模 | 推理延迟 | 小样本性能 | 核心短板 | 推荐场景 |
|---|---|---|---|---|---|---|---|
| MLP | ❌无,仅单帧 | ❌不支持图像 | ❌均值坍缩 | 极低 < 1ms | 中等 | 无记忆,长任务漂移 | 低维状态基线、点位控制 |
| LSTM/GRU | ✅短时序 | ❌弱 | ❌均值坍缩 | 低 | 中等 | 长序列梯度消失 | 缓慢连续形变任务,仅基线 |
| 1D Temporal CNN(U-Net) | ✅局部时序 | ❌弱 | ✅一般 | 低 | 良好 | 长距离依赖弱、易过平滑 | Diffusion Policy-C、平滑轨迹操作 |
| ACT(CVAE+Transformer) | ✅全局 | ✅支持图像 | ✅一般 | ~10ms | 优秀 | 隐变量模式坍缩 | 双臂精密装配、ALOHA 桌面抓取 |
| Diffusion Policy (Transformer) | ✅全局 | ✅强 | ✅最优 | 40~120ms(DDIM) | 优秀 | 推理迭代耗时,块抖动 | 灵巧手、多可行轨迹操作 |
| Mamba(SSM) | ✅线性长时序 | ✅可扩展 | ✅良好 | 中低 | 优秀 | 生态新,真机案例少 | 长 horizon 人形步态、长任务 |
| Flow Matching(DiT) | ✅全局 | ✅强 | ✅优秀 | 极快(1~4 步) | 良好 | 动作块接缝抖动 | 高频闭环人形、动态交互 |
三、工程选型策略(结合动捕采集、BVH、LeRobot 数据集)
- 科研基线、快速原型验证:MLP + 1D CNN;训练快,用来验证数据集质量(动捕采集的 BVH 转 LeRobot h5/parquet)。
- 桌面机械臂、双臂精密装配,数据集 50~200 条 demo,看重低延迟 :ACT,LeRobot 原生支持,推理延迟最低,工程落地最成熟。
- 灵巧手、高自由度,同一个场景存在多种可行操作方式(多模态动作):Diffusion Policy,优先 CNN-Unet 版本;算力充足选 Transformer 版本。
- 人形机器人、长时序步态、大 horizon 任务:Mamba 或者 Flow Matching;Mamba 适合长序列建模;Flow Matching 适合高频实时闭环。
- VLA 视觉语言动作(自然语言指令控制机器人):Transformer 主干(ACT/Diffusion-T/Flow Matching DiT),Cross-Attention 接入语言 embedding。
- 大规模跨任务数据集、Open X-Embodiment:ViT 视觉编码器 + Transformer / Flow Matching。
四、训练 & 部署通用工程注意点(模仿学习,动捕数据集)
- 数据:光学动捕采集 BVH,预处理转为 LeRobot HDF5/Parquet,动作归一化;动作 chunk 长度需要和机器人控制频率匹配;
- 误差累积:所有单步 BC 模型都会漂移,一律使用动作块预测 + 滚动时域闭环;
- 视觉本体融合:图像特征 + 本体感知(关节、末端 6D)拼接送入策略网络;
- 后处理:网络输出原始动作,增加低通滤波,抑制策略输出抖动(动捕示教噪声、策略噪声);
- 仿真到真机:预训练在 MuJoCo 仿真,再用少量真机动捕数据微调。