IL_策略训练---CNN/1D神经网络种类三

EI :Embodied Intelligent, CNN :Convolutional Neural Network,IL:Imitation Learning

CNN / 1D Temporal CNN(含 1D U-Net)作为机器人动作预测主干网络

概念区分:

  1. 2D CNN :一般不作为动作预测主干 ,多用于视觉感知编码器,提取 RGB 图像特征,输出特征向量送入动作主干网络(MLP/1D-CNN)。
  2. 1D Temporal CNN(时序卷积,TCN / 1D U-Net) :动作预测主干 ,卷积沿时间维度滑动,输入历史观测窗口,一次性输出一段连续动作 chunk,是模仿学习 Diffusion Policy-C 的标准主干。
    1D U-Net 本质属于 1D Temporal CNN 的编码器 - 解码器变体,也是当前机器人领域使用最多的 1D 时序卷积结构。
    适配常规的动捕和数采链路:光学动捕 BVH → 转为 HDF5/Parquet LeRobot 数据集,训练 1D U-Net 时序策略,一次性输出多步动作序列。

一、采用 1D Temporal CNN / 1D U-Net 作为动作主干的训练算法 & 框架(论文 + 开源库 + 数据集)

1. Diffusion Policy(Diffusion Policy-CNN,最主流)

  • 网络主干 :1D U-Net(1D Temporal CNN 编码器解码器)
  • 论文 :Diffusion Policy: Visuomotor Policy Learning via Action Diffusion(RSS 2023 / IJRR 2024,哥伦比亚大学)Diffusion ...
  • 原理 :条件扩散生成模型,1D U-Net 作为去噪网络;输入历史观测序列(图像特征 + 本体状态时序),迭代去噪,一次性预测未来一段动作 chunk;天然支持多峰动作分布 ,解决 BC 均值坍缩;推理使用滚动时域 Receding Horizon。
  • 开源仓库 :https://github.com/real-stanford/diffusion_policy
  • 数据集:Push-T、Robomimic、ALOHA 双臂数据集;可导入你自己光学动捕 BVH 转换的 LeRobot 数据集(HDF5/Zarr)
  • LeRobot 原生集成 Diffusion Policy-CNN 版本,开箱即用 1D U-Net 主干。

2. Behavior Cloning(BC)时序版本,TCN-BC / 1D U-Net BC

  • 主干:1D Temporal CNN / 1D U-Net
  • 原理:监督学习,MSE 损失;输入历史观测窗口,直接回归未来动作序列(Action Chunk BC),不需要扩散迭代,属于基线方案。
  • 开源:Robomimic、LeRobot、ManiSkill;
  • 数据集:Robomimic 数据集、ALOHA 双臂示教数据集、LeRobot 公开示教数据集。

和单步 MLP-BC 的区别:MLP 只输入当前一帧;1D-TCN-BC 输入连续时序窗口,建模局部时序依赖,一次性输出多步动作。

3. TCN-GAIL(时序对抗模仿学习)

  • 主干:Actor 使用 1D-TCN,判别器可以是 MLP 或 1D-TCN
  • 原理:GAIL 的对抗学习框架,把逐帧((s,a))改成时序窗口序列,用 TCN 建模时序轨迹分布;
  • 适用:连续长时序示教、布料形变操作;
  • 开源:imitation 库自定义 TCN 替换;
  • 缺点:对抗训练不稳定,真机落地案例偏少,多为仿真科研。

4. TCN + PPO / SAC(时序强化学习)

  • 主干:Actor/Critic 使用 1D Temporal CNN;输入历史状态窗口,输出动作分布
  • 原理:在 PPO/SAC 基础上,给策略增加时序窗口,替代 MLP 拼接历史帧的简陋方案;
  • 适用:动态交互、需要历史状态判断的机器人任务;
  • 开源:Stable Baselines3 自定义网络、RSL-RL 可替换 Actor 为 TCN;
  • 短板:四足 / 人形步态很少用,步态优先 MLP;多用于机械臂动态操作。

5. Time-Contrastive Networks(TCN,2D CNN 视觉编码器 + 时序学习)

注意:这里是视觉表征学习,不是动作主干;2D CNN 提取图像特征,学习时序对比损失,用来做视频模仿;DeepMind 经典工作,NIPS2017。

  • 论文:Time-Contrastive Networks: Self-Supervised Learning from Pixels
  • 仓库:sermanet.github.io/tcn
  • 定位:自监督预训练视觉编码器,特征再送入动作策略。

6. Diff-Control(1D U-Net 时序扩散策略)

  • 论文:Enabling Stateful Behaviors for Diffusion-based Policy Learning
  • 主干:1D Temporal CNN U-Net;在 Diffusion Policy 基础上增加状态记忆模块,减少策略不确定性,提升长时序任务稳定性arXiv
  • 开源 :https://github.com/ir-lab/Diff-Control

二、机器人厂商:使用 CNN / 1D Temporal CNN 作为动作主干的企业

重要区分:几乎所有公司都会用 2D CNN 作为视觉编码器;但把 1D Temporal CNN(1D U-Net)作为动作预测主干,以科研原型、桌面操作机器人为主;人形全身步态几乎不用 1D-TCN,步态依旧 MLP。

  1. 智元机器人(A01 人形,灵巧手 / 双臂操作模块)
    • 方案:高层操作策略采用 Diffusion Policy(1D U-Net 主干),用于灵巧手抓取、插拔、柔性物体操作;全身行走平衡依然采用 MLP+PPO。
    • 定位:分层架构,移动层 MLP,精细操作层 1D U-Net 时序策略。
  2. Figure AI Figure01
    • 桌面双臂操作原型:Diffusion Policy 1D U-Net 动作主干,用于物体抓取、放置;全身 locomotion 为 MLP 策略。
  3. Agility Robotics Digit
    • 操作任务科研原型:1D U-Net Diffusion Policy;行走平衡使用 MLP。
  4. 国内具身创业公司(如眸深、德塔智能)
    • 双臂、灵巧手原型系统,LeRobot+Diffusion Policy(1D U-Net),基于动捕 BVH 示教数据训练操作策略;全身运动依然 MLP。
  5. 工业机械臂厂商(Franka Emika、Universal Robots)
    • 科研开发套件,大量学术团队在 Franka 上部署 Diffusion Policy 1D U-Net;原厂控制器本身不内置,是上层 AI 策略。
  6. 特斯拉 Optimus
    • 2D CNN 用于视觉感知 ;底层步态平衡策略依旧 MLP;在精细操作研究原型中测试 Diffusion Policy(1D U-Net),未进入量产。

行业现状总结:

2D CNN :所有做视觉具身机器人的公司都在用,作为图像特征提取模块(感知层)

1D Temporal CNN/1D U-Net :多用于双臂、灵巧手精细操作任务,属于操作层策略;量产全身人形步态几乎不用,步态优先 MLP

三、CNN / 1D Temporal CNN 神经网络主要完成功能

1. 2D CNN(不作为动作主干,感知编码器,配套使用)

  1. RGB 图像特征提取:对相机单帧图像做空间卷积,提取像素级空间特征(物体轮廓、位置),降维为特征向量;
  2. 多视图图像融合,深度图编码;
  3. 输出的特征向量拼接本体状态(关节、末端位姿),送入动作主干网络(1D-Unet/MLP/Transformer);

一句话:2D CNN 看懂图像,不输出机器人动作。

2. 1D Temporal CNN / 1D U-Net(动作预测主干,核心,输出机器人动作序列)

  1. 时序局部特征建模,一次性输出动作 Chunk
    输入一段历史观测窗口(连续 N 帧视觉特征 + 本体状态时序),沿着时间维度卷积,捕捉相邻帧之间的时序相关性;一次性预测未来一段连续动作序列(如 horizon=16 步动作),而不是单步动作。

解决 MLP 只能看当前一帧、无原生时序能力的短板。

  1. 多峰动作分布建模(1D U-Net+Diffusion Policy)
    同一个观测场景下存在多种可行操作轨迹(比如抓取物体可以从左侧或右侧抓),1D U-Net 扩散策略可以学习多模态分布,不会像 MLP 出现均值坍缩,接触丰富操作任务成功率显著提升。
  2. 平滑连续轨迹生成,抑制动作抖动
    编码器压缩时序特征,解码器恢复动作序列,天然生成平滑连续轨迹;适合机械臂抓取、推、插入、布料、线缆这类连续接触操作。
  3. 时序噪声滤波,对示教噪声鲁棒
    卷积窗口对示教噪声(动捕采集 Marker 噪声、遥操作抖动)有平滑作用,相比 Transformer,对小数据集更加稳定。
  4. 滚动时域闭环控制的动作生成器
    推理时每次生成一段动作 chunk,执行前几步,再采集新观测重新预测下一动作块;解决长时序误差累积。
  5. 时序动力学预测(衍生用途)
    1D TCN 也可以作为前向动力学模型,预测下一段时间窗口的状态,用于模型预测控制 MPC 的模型学习。

不擅长的任务(选型边界)

  1. 长距离全局时序依赖 :卷积感受野由卷积核、空洞卷积控制,长时序任务弱于 Transformer/Mamba;
  2. 全身人形高速步态、跑跳平衡:1D-Unet 参数量、推理延迟高于 MLP;全身动态平衡工程落地几乎全部 MLP;
  3. 跨模态 VLA(语言 + 视觉 + 动作)原生能力弱,需要额外 Cross-Attention 模块,原生 1D-CNN 不支持文本条件输入。

四、1D Temporal CNN(1D U-Net)优缺点

优点

  1. 时序局部相关性建模强,天然支持动作 chunk 预测;
  2. 相比 Transformer,参数量更小、显存占用低、训练收敛更快;
  3. Diffusion Policy-CNN 工程成熟,LeRobot 原生支持,论文案例多;
  4. 生成轨迹平滑,对接触型操作友好;
  5. 对小样本示教数据集鲁棒性优于 Transformer;
  6. 可直接使用 BVH 动捕时序数据训练。

缺点

  1. 感受野局限,长距离时序依赖建模弱;需要空洞卷积扩大感受野,调参变复杂;
  2. 原生不支持语言指令、跨模态条件;
  3. Diffusion 版本推理需要多步去噪,延迟高于 MLP;DDIM 加速后一般 20~60ms;
  4. 动作块拼接边界会产生抖动(chunk 接缝问题),需要时序集成、低通滤波;
  5. 高自由度超长 horizon 任务,性能上限低于 Transformer。

五、横向对比(和前面 MLP、ACT、Diffusion Transformer 对照)

表格

网络主干 时序能力 多模态 (图像 + 语言) 多峰动作建模 推理延迟 小样本性能 核心短板 推荐场景
MLP ❌单帧马尔可夫 ❌图像需单独编码 ❌均值坍缩 <1ms 中等 无记忆,长任务漂移 四足 / 人形步态、平衡、点位控制
1D Temporal CNN /1D U-Net ✅局部时序 ❌原生不支持语言 ✅优秀 20~60ms(DDIM) 良好 长距离时序弱,chunk 接缝抖动 机械臂抓取、推、插入、柔性物体操作,Diffusion Policy-CNN
ACT CVAE+Transformer ✅全局时序 ✅支持图像 + 语言 ✅一般 ~10ms 优秀 隐变量模式坍缩 双臂精密装配 ALOHA,小数据集
Diffusion Policy Transformer ✅全局时序 ✅强 ✅最优 40~120ms 优秀 显存大、推理慢 灵巧手,多模态复杂操作

六、工程落地要点(结合动捕 BVH/LeRobot 数据链路)

  1. 数据预处理:光学动捕 BVH 提取关节时序 → 构建观测窗口(obs_horizon),构建 LeRobot HDF5/Parquet 数据集;
  2. 网络输入:视觉特征(2D CNN 提取)+ 本体时序状态拼接,送入 1D U-Net;
  3. 动作 Chunk 参数:pred_horizon、action_horizon 是核心超参,一般 pred_horizon=16~64;
  4. 推理加速:使用 DDIM 代替原生 DDPM,把采样步数压缩到 10~20 步,降低延迟;
  5. 后处理:动作 chunk 输出增加指数低通滤波,消除块边界跳变;
  6. 选型决策 :全身移动、平衡 → MLP;桌面机械臂、灵巧手接触操作,多可行轨迹 → 1D U-Net Diffusion Policy。

七、选型决策总结

  • 2D CNN :感知层图像编码器,几乎所有视觉机器人标配,不输出动作;
  • 1D Temporal CNN(1D U-Net) :操作任务动作生成主干,Diffusion Policy-CNN 核心,适合双臂 / 灵巧手接触操作;不适合人形全身步态;
  • 开源首选:LeRobot + Diffusion Policy 1D U-Net;数据集直接导入动捕 BVH 转换的时序数据。
相关推荐
Omics Pro1 小时前
强生:以机理为中心!虚拟细胞世界模型
数据库·人工智能·python·深度学习·算法·机器学习·自然语言处理
高升说1 小时前
多路相机带宽与存储怎么算?从单路码率到盘位规划的完整链路
人工智能·数码相机
全栈道1 小时前
AI 时代,软件开发应该如何学习
人工智能·学习
YOLO数据集集合1 小时前
遥感滑坡图像识别数据集 | 滑坡识别 遥感影像 语义分割 灾害监测 无人机航拍 目标检测 深度学习数据集 计算机视觉9172期
人工智能·yolo·目标检测·计算机视觉·无人机·滑坡
czq_26867194871 小时前
Python打卡第34天
开发语言·python·机器学习
FPGA信号处理1 小时前
【凸优化】第一节课(下):保凸运算、分离超平面与 Farkas 引理
人工智能·算法·机器学习
stsdddd2 小时前
v11扑克牌数字检测数据集8992张实测:标注质量与划分比例一览
人工智能·计算机视觉·目标跟踪
商业白皮书2 小时前
2026年上海豆包DeepSeekKimi百度AI通义千问GEO服务商选择
人工智能·笔记
马剑威(威哥爱编程)2 小时前
【AI全栈后端12-09】Spring Boot 用流式输出做打字机对话:点下去不再干等
java·人工智能·spring boot·后端