总体目标与系统架构

日期:2026-09-02


2. SmolVLA 与 LeRobot 定位

2.1 SmolVLA

SmolVLA 是面向机器人操作任务的轻量级 Vision-Language-Action 模型。

典型输入:

text 复制代码
RGB Camera
+
Robot State
+
Language Instruction

输出:

text 复制代码
Action Chunk

抽象表示:

text 复制代码
        Front Camera ─────┐
                         │
        Wrist Camera ─────┤
                         │
        Robot State ──────┼──→ SmolVLA ──→ Action Chunk
                         │
        Language ─────────┘

相比单步策略:

text 复制代码
obs_t → action_t

SmolVLA 更接近:

text 复制代码
obs_t → [action_t, action_t+1, ..., action_t+N]

因此 Action Chunking 能减少模型推理频率,但会引入一个新的工程问题:

模型预测频率、机器人执行频率和 Action Chunk 长度必须协调。


2.2 LeRobot

LeRobot 在整个系统中承担:

  • Robot Dataset 统一格式;
  • 摄像头 / Robot State / Action 数据组织;
  • Policy 接口;
  • SmolVLA / ACT 等策略训练;
  • Checkpoint 管理;
  • 仿真环境接入;
  • Evaluation;
  • 真机数据采集;
  • 模型推理。

推荐把 LeRobot 当成:

text 复制代码
              LeRobot
                 │
   ┌─────────────┼─────────────┐
   │             │             │
Dataset       Policy        Robot I/O
   │             │             │
   └─────────────┼─────────────┘
                 │
              Evaluation

而不是把它当成单独的"VLA 模型仓库"。


3. 推荐总体架构

3.1 开发阶段架构

text 复制代码
┌────────────────────────────────────────────────┐
│                 Training PC                    │
│                                                │
│   LeRobotDataset                               │
│         │                                      │
│         ▼                                      │
│   SmolVLA Fine-tune                            │
│         │                                      │
│         ▼                                      │
│   checkpoint / pretrained_model                │
│         │                                      │
│         ▼                                      │
│   lerobot-eval                                 │
└─────────┬──────────────────────────────────────┘
          │
          ▼
┌────────────────────────────────────────────────┐
│             MuJoCo / gym-aloha                 │
│                                                │
│ Camera → Observation → Policy → Action         │
│                ↑                    │           │
│                └──── Environment ───┘           │
└────────────────────────────────────────────────┘

3.2 真机部署架构

推荐:

text 复制代码
Camera Drivers
     │
     ├──── Front RGB
     ├──── Wrist RGB
     └──── Optional Side RGB
     │
     ▼
Sensor Synchronizer
     │
     ├────────── Joint State
     └────────── Task Instruction
                 │
                 ▼
          SmolVLA Policy Node
                 │
            Action Chunk
                 │
                 ▼
        Action Postprocessor
                 │
       ┌─────────┼──────────┐
       │         │          │
 Joint Limit  Velocity    Workspace
   Check       Limit        Check
       │         │          │
       └─────────┼──────────┘
                 │
                 ▼
          Trajectory Buffer
                 │
                 ▼
      ros2_control / MoveIt 2
                 │
                 ▼
            Robot Driver
                 │
                 ▼
              Robot

重要:

text 复制代码
SmolVLA
   ≠
Safety Controller

VLA 输出必须经过独立安全层。


4. 推荐验证阶段

建议划分为 7 个阶段。

阶段 内容 是否控制真机
P0 软件环境 / 模型 Smoke Test
P1 Dataset 离线验证
P2 SmolVLA 离线推理
P3 ALOHA 仿真闭环
P4 ROS 2 Replay / Shadow Mode
P5 真机低速闭环
P6 正式任务闭环与长期回归

最终:

text 复制代码
P0 → P1 → P2 → P3 → P4 → P5 → P6

任何阶段未通过,都不建议直接跳到下一阶段。


相关推荐
回眸&啤酒鸭1 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智1 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅1 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein1 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu1 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台1 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb1 天前
智能网联汽车安全能力框架
人工智能
风合星语1 天前
2026 具身智能技术实战(一):VLA 到底怎么控制机器人?——用 LeRobot 跑通 SmolVLA 推理
pytorch·机器人·具身智能·vla·lerobot·smolvla
鲁邦通物联网1 天前
图书馆机器人跨楼层运行,机器人梯控低噪设计与架构分析
机器人·巡检机器人·机器人梯控·agv梯控·非侵入式采集·机器人乘梯·机器人自主乘梯