EI :Embodied Intelligent,SSM :Structured State Space Models,IL:Imitation Learning
Mamba(SSM 结构化状态空间模型)作为机器人动作预测主干网络:训练算法、开源库、厂商、功能详解
前置定义:Mamba 属于选择性结构化状态空间模型(SSM),兼具 RNN 流式隐状态和 Transformer 长序列建模两大优点;计算复杂度(O(N))线性复杂度(Transformer 是(O(N^2))二次复杂度)。
- LSTM:串行训练、长序列梯度消失;
- Transformer:长序列显存开销爆炸;
- Mamba:训练阶段可并行,推理阶段流式递推,隐状态选择性记忆,只保留有用历史信息,丢弃无关时序,专门解决长时序 POMDP、长 horizon 示教轨迹。
行业现状:Mamba 属于前沿预研架构(2024 年后爆发) ,没有大规模量产落地 ,全部为科研原型、仿真验证,少数真机小范围测试,尚未替代 MLP 底层步态策略。
适配链路:光学动捕 BVH 时序姿态序列,转为 HDF5/Parquet,训练 Mamba 动作策略。
一、Mamba 作为动作主干的训练算法、开源代码库、论文 & 数据集
1. PPO-Mamba(HuMam / LocoMamba,强化学习,人形 / 四足全身运动)
- 网络主干:Mamba Block 作为观测时序融合主干;Actor/Critic 由 Mamba+MLP 头构成
- 论文
- HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba(2025),首个 Mamba 人形全身运动控制器,基于 MuJoCo JVRC-1 人形仿真验证arXiv
- LocoMamba: Vision-Driven Locomotion via End-to-End Deep Reinforcement Learning with Mamba(2025),视觉输入 + Mamba+PPO 四足地形行走,带域随机化、课程学习arXiv
- 原理:PPO 近端策略优化,GAE 优势估计;Mamba 编码历史时序观测(IMU、关节、图像特征),解决 POMDP(传感器延迟、部分观测);输出 PD 目标关节位置。
- 开源 :基于
state-spaces/mamba底层库,在 RSL-RL / IsaacLab 上二次开发;HuMam/LocoMamba 项目开放实验脚本。 - 数据集:CMU Motion BVH、仿真本体传感器时序、深度相机时序观测。
2. Mamba Policy(Diffusion + Mamba,扩散模仿学习,灵巧手 / 机械臂操作)
- 主干:Mamba/XMamba Block 替代 Diffusion Policy 的 1D U-Net 或 DiT,作为扩散模型去噪主干
- 论文 :Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models(2024)arXiv
- 原理:条件扩散生成;Mamba 作为去噪网络,输入时序观测,生成动作 Chunk;相比原版 Diffusion Policy,参数量减少 80%,长 horizon 任务鲁棒性更强。
- 开源 :https://andycao1125.github.io/mamba_policy/,提供代码、Libero/Adroit/Dexart 仿真 + 真机实验脚本
- 数据集:Adroit 灵巧手、DexArt、MetaWorld、Robomimic。
3. MaIL Mamba Imitation Learning(Mamba-BC,时序行为克隆)
- 主干:Mamba 编码器 - 解码器架构,行为克隆 BC
- 论文 :MaIL: Improving Imitation Learning with Mamba(2024)arXiv
- 原理 :监督学习,输入示教时序观测序列,回归动作序列;小样本性能显著优于 Transformer,对示教噪声鲁棒;可单独作为策略,也可嵌入扩散模型。
- 开源:基于 mamba-ssm 库,Libero 基准,Franka 真机实验代码;LeRobot 可自定义替换主干为 Mamba(非原生内置)
- 数据集:LIBERO、Robomimic、ALOHA 双臂示教数据集、BVH 动捕轨迹。
4. RoboMamba(Mamba VLA 视觉语言动作端到端)
- 主干:Mamba 作为 VLA 时序主干
- 论文 :RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation NeurIPS2024(北大 + 智平方)arXiv
- 原理:多模态 VLA;图像 token、本体状态 token、语言指令 token 送入 Mamba;线性复杂度,长时序任务推理,小参数实现语言驱动操作。
- 开源 :https://github.com/lmzpai/roboMamba
- 数据集:Open X-Embodiment、多任务机械臂示教数据。
5. Decision Mamba(Offline RL 离线强化学习)
- 主干:Mamba,多粒度 SSM,离线 RL
- 论文 :Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL(2024)arXiv
- 原理:处理离线轨迹数据集,Mamba 建模状态 - 动作 - 回报时序;自演化正则,降低离线数据集噪声过拟合;适合从大量历史示教轨迹学习策略。
- 开源 :https://github.com/aopolin-lv/DecisionMamba
6. Drama(Mamba 世界模型,基于模型强化学习 MBRL)
区分:Mamba 作为动力学前向世界模型(不是动作策略主干,配套策略一起使用)
- 论文 :Drama: Mamba-Enabled Model-Based Reinforcement Learning Is Sample and Parameter Efficient(2024)arXiv
- 原理:Mamba 预测未来环境状态序列,在想象虚拟环境内做 rollout,提升样本效率;替代 LSTM/Transformer 世界模型;
- 开源 :https://github.com/realwenlongwang/Drama
底层基础库
- mamba-ssm :Mamba 官方底层库 https://github.com/state-spaces/mamba;PyPI 包
mamba-ssm,Mamba1/Mamba2; - CleanRL、TorchRL:可自定义 Mamba 作为 Actor/Critic 主干;
- IsaacLab、RSL-RL:可替换原生 MLP 策略,接入 Mamba 模块做 POMDP 人形 / 四足实验。
二、使用 Mamba 作为动作预测主干的机器人公司(全部处于预研原型阶段,无量产主策略)
重要说明:没有任何厂商将 Mamba 用于底层高频全身步态闭环控制;底层步态依然 MLP;Mamba 仅用于上层 VLA、长时序操作、POMDP 运动预研原型。
- 智平方(RoboMamba)
- 国内最早落地 Mamba VLA 原型;RoboMamba,Mamba 作为端到端 VLA 主干,用于双臂移动操作;相比 Transformer 推理速度提升,参数量大幅降低;
- 定位:上层语言 - 视觉 - 动作策略;底层本体运动控制器依旧 MLP。
- 眸深智能
- STI-WM 时空一体世界动作模型,Mamba 作为时序主干,用于人形 / 机械臂长时序操作预研。
- Figure AI、智元机器人
- 预研基线对比:在灵巧手 / 双臂操作原型中,测试 Mamba Policy(Mamba 扩散策略),和 ACT、Diffusion DiT 横向对比;未进入正式产品版本。
- 高校实验室(北大、CMU、ETH、苏黎世联邦理工)
- HuMam、LocoMamba、MaIL 全部是学术原型;Franka、Unitree 四足硬件上做真机小实验,仅论文验证。
补充:特斯拉 Optimus、宇树、傅里叶、优必选:暂未公开 Mamba 真机策略方案;底层运动策略全部 MLP;Mamba 仅作为论文基线备选。
三、Mamba(SSM)神经网络作为动作预测主干主要完成功能
-
长时序 POMDP 部分可观测问题建模(Mamba 核心优势)
传感器延迟、观测不完整、单帧信息不足以确定机器人完整状态;Mamba 内置选择性隐状态,线性复杂度记忆超长历史序列;没有 LSTM 的长序列梯度消失,没有 Transformer 二次复杂度显存爆炸。适合带 IMU / 关节传感器延迟的人形、四足运动。
-
长 Horizon 动作 Chunk 生成,模仿学习
一次性输出长序列动作片段;滚动时域闭环;对长时序多阶段任务(多步骤装配、线缆整理、连续工具操作)效果优于 1D-TCN(固定窗口),推理开销低于 Transformer。MaIL 实验证明小样本示教场景,Mamba 性能超过 Transformer,对遥操作、动捕采集的含噪声 BVH 轨迹鲁棒性更强。
-
Mamba 扩散策略:多峰动作分布建模
Mamba Policy 替代 DiT/U-Net 作为扩散去噪主干;同一个观测可以学习多种可行操作轨迹,解决 MLP/LSTM 均值坍缩;同时参数量更小、推理更快,适合嵌入式边缘设备部署灵巧手策略。
-
多模态 VLA 融合(图像、本体、语言)
RoboMamba:图像 patch token、关节本体时序、自然语言指令,统一送入 Mamba,原生长时序多模态融合;序列越长,相比 Transformer 的算力优势越明显,适合资源受限移动操作机器人。
-
人形全身运动预研:带历史记忆的步态、地形自适应
HuMam/LocoMamba:Mamba 融合历史本体 + 视觉时序,学习拟人行走、爬坡,在存在观测噪声时步态更平滑,能耗更低;科研原型,不替代 MLP 量产步态。
-
离线 RL、世界模型时序动力学预测
Decision Mamba 处理大量离线示教轨迹;Drama 用 Mamba 构建世界模型,预测未来状态序列,用于想象 rollout,提升强化学习样本效率。
Mamba 不擅长的任务
- 超精细空间注意力推理:Mamba 原生没有自注意力,细粒度空间物体交互弱于 Transformer;复杂接触任务常需要混合 Mamba + 少量 Attention(XMamba);
- 高频 100Hz 以上强扰动动态平衡:Mamba 推理延迟高于 MLP,底层强冲击扰动场景工程稳定性不如 MLP;
- 训练生态成熟度低:库版本、ONNX 导出、嵌入式部署工具链不完善;
- 选择性记忆存在遗忘偏置:模型自主筛选历史信息,极端场景下会丢失关键短时序信号。
四、Mamba 优缺点
优点
- 计算复杂度(O(N))线性,序列越长,相比 Transformer 显存 / 速度优势越大;
- 训练可并行、推理流式递推,兼具 TCN 并行训练、LSTM 流式推理双重优势;
- 长序列无梯度消失问题;
- 小样本模仿学习性能强,对示教噪声鲁棒;
- 参数量轻,适合边缘嵌入式部署;
- 原生适合 POMDP,处理传感器延迟、历史时序融合。
缺点
- 原生缺少空间自注意力,纯 Mamba 细粒度空间交互弱;一般需要混合注意力模块;
- 工程生态新,ONNX、TensorRT 部署困难;
- 属于前沿预研架构,真机大规模验证案例少,稳定性待验证;
- 底层硬件算子支持不如 CNN/MLP 成熟;
- 不适合高频强扰动底层闭环运动控制。
五、全部 5 类主干横向汇总对比
表格
| 网络主干 | 时序能力 | 多模态 (图像 + 语言) | 多峰动作建模 | 推理延迟 | 小样本性能 | 核心短板 | 推荐场景 |
|---|---|---|---|---|---|---|---|
| MLP | ❌单帧马尔可夫 | ❌图像需单独编码 | ❌均值坍缩 | <1ms | 中等 | 无记忆,长任务漂移 | 四足 / 人形步态、平衡、点位控制 |
| 1D Temporal CNN /1D U-Net | ✅局部时序 | ❌原生不支持语言 | ✅优秀 | 20~60ms(DDIM) | 良好 | 长距离时序弱,chunk 接缝抖动 | 机械臂抓取、推、插入、柔性物体操作,Diffusion Policy-CNN |
| LSTM/GRU(RNN) | ✅短时序记忆(隐状态) | ❌原生不支持语言 | ❌均值坍缩 | 5~20ms | 中等 | 串行训练、长序列梯度消失、隐状态管理复杂 | 传感器延迟、POMDP、布料 / 线缆慢时序操作;科研基线原型 |
| ACT CVAE+Transformer | ✅全局时序 | ✅支持图像 + 语言 | ✅一般 | ~10ms | 优秀 | 隐变量模式坍缩 | 双臂精密装配 ALOHA,小数据集 |
| Diffusion Policy Transformer(DiT) | ✅全局时序 | ✅强 | ✅最优 | 40~120ms | 优秀 | 显存大、推理慢 | 灵巧手,多模态复杂操作 |
| Mamba SSM | ✅超长时序选择性记忆 | ✅支持多模态 VLA | ✅优秀(Mamba Policy 扩散) | 10~40ms | 优秀 | 缺少原生空间注意力,部署生态不成熟 | 长 horizon 多阶段任务、POMDP、资源受限嵌入式 VLA、长时序示教模仿学习;科研原型 |
六、工程落地要点(对接 BVH 动捕、LeRobot)
- 数据预处理:BVH 人体姿态转为时序状态序列;Mamba 输入是时序片段,支持非常长的序列,不需要人工限制固定滑动窗口;
- 选型决策
- 高频全身步态、抗扰动量产 → MLP
- 局部时序、算力有限、中等长度操作任务 →1D U-Net
- 传感器延迟、短时序慢形变 → GRU/LSTM
- 小样本双臂精细装配 → ACT Transformer
- 灵巧手多可行轨迹、语言指令操作 → Diffusion DiT
- 超长 horizon、POMDP、嵌入式算力受限长时序 VLA → Mamba(科研原型)
- 部署:Mamba-2 算子对 GPU 版本、CUDA 版本敏感;导出 ONNX 难度高于 MLP/TCN;嵌入式部署需要专门算子优化;
- 混合架构方案:XMamba(Mamba + 少量 Attention),兼顾 Mamba 高效长时序建模 + Attention 细粒度空间交互,是当前 Mamba 机器人策略主流改进方案。