总体目标与系统架构

日期:2026-09-02


2. SmolVLA 与 LeRobot 定位

2.1 SmolVLA

SmolVLA 是面向机器人操作任务的轻量级 Vision-Language-Action 模型。

典型输入:

text 复制代码
RGB Camera
+
Robot State
+
Language Instruction

输出:

text 复制代码
Action Chunk

抽象表示:

text 复制代码
        Front Camera ─────┐
                         │
        Wrist Camera ─────┤
                         │
        Robot State ──────┼──→ SmolVLA ──→ Action Chunk
                         │
        Language ─────────┘

相比单步策略:

text 复制代码
obs_t → action_t

SmolVLA 更接近:

text 复制代码
obs_t → [action_t, action_t+1, ..., action_t+N]

因此 Action Chunking 能减少模型推理频率,但会引入一个新的工程问题:

模型预测频率、机器人执行频率和 Action Chunk 长度必须协调。


2.2 LeRobot

LeRobot 在整个系统中承担:

  • Robot Dataset 统一格式;
  • 摄像头 / Robot State / Action 数据组织;
  • Policy 接口;
  • SmolVLA / ACT 等策略训练;
  • Checkpoint 管理;
  • 仿真环境接入;
  • Evaluation;
  • 真机数据采集;
  • 模型推理。

推荐把 LeRobot 当成:

text 复制代码
              LeRobot
                 │
   ┌─────────────┼─────────────┐
   │             │             │
Dataset       Policy        Robot I/O
   │             │             │
   └─────────────┼─────────────┘
                 │
              Evaluation

而不是把它当成单独的"VLA 模型仓库"。


3. 推荐总体架构

3.1 开发阶段架构

text 复制代码
┌────────────────────────────────────────────────┐
│                 Training PC                    │
│                                                │
│   LeRobotDataset                               │
│         │                                      │
│         ▼                                      │
│   SmolVLA Fine-tune                            │
│         │                                      │
│         ▼                                      │
│   checkpoint / pretrained_model                │
│         │                                      │
│         ▼                                      │
│   lerobot-eval                                 │
└─────────┬──────────────────────────────────────┘
          │
          ▼
┌────────────────────────────────────────────────┐
│             MuJoCo / gym-aloha                 │
│                                                │
│ Camera → Observation → Policy → Action         │
│                ↑                    │           │
│                └──── Environment ───┘           │
└────────────────────────────────────────────────┘

3.2 真机部署架构

推荐:

text 复制代码
Camera Drivers
     │
     ├──── Front RGB
     ├──── Wrist RGB
     └──── Optional Side RGB
     │
     ▼
Sensor Synchronizer
     │
     ├────────── Joint State
     └────────── Task Instruction
                 │
                 ▼
          SmolVLA Policy Node
                 │
            Action Chunk
                 │
                 ▼
        Action Postprocessor
                 │
       ┌─────────┼──────────┐
       │         │          │
 Joint Limit  Velocity    Workspace
   Check       Limit        Check
       │         │          │
       └─────────┼──────────┘
                 │
                 ▼
          Trajectory Buffer
                 │
                 ▼
      ros2_control / MoveIt 2
                 │
                 ▼
            Robot Driver
                 │
                 ▼
              Robot

重要:

text 复制代码
SmolVLA
   ≠
Safety Controller

VLA 输出必须经过独立安全层。


4. 推荐验证阶段

建议划分为 7 个阶段。

阶段 内容 是否控制真机
P0 软件环境 / 模型 Smoke Test
P1 Dataset 离线验证
P2 SmolVLA 离线推理
P3 ALOHA 仿真闭环
P4 ROS 2 Replay / Shadow Mode
P5 真机低速闭环
P6 正式任务闭环与长期回归

最终:

text 复制代码
P0 → P1 → P2 → P3 → P4 → P5 → P6

任何阶段未通过,都不建议直接跳到下一阶段。


相关推荐
科技风向标go18 分钟前
奥维云网×洛图科技:2026监控品牌“功能延伸”vs垂直品牌“底层设计”——品牌选型与产业趋势
网络·人工智能·科技·户外安防
小王20419 分钟前
Day 33:目标跟踪基础 — SORT与DeepSORT
人工智能·计算机视觉·目标跟踪
您^_^20 分钟前
DeepSeek-Harness 升级排障完全指南:三类本地残留逐个拆解
人工智能·windows·个人开发·deepseekharness·deepseekv4pro
旖旎夜光26 分钟前
【AI入门】大模型介绍全解析:从模型、LLM 到提示词与嵌入
人工智能·笔记·python·学习·ai编程
牧羊人.33327 分钟前
计算机视觉基础 第13章 |背景建模与运动目标检测
图像处理·人工智能·目标检测·计算机视觉·目标跟踪
卷无止境27 分钟前
SIE:当一个推理引擎决定把100多个模型装进一个集群里
人工智能·python
阳明山水29 分钟前
概念漂移分类与自适应策略解析
人工智能·深度学习·算法·机器学习·架构
狂师31 分钟前
AI 测试提效 | 别搞万能 Skill,推荐5 个 Agent Skill 串起 UI 自动化执行到报告生成全流程
人工智能·agent·测试
动物园猫33 分钟前
超市空货架目标检测数据集:1,500张图像 | 目标检测
人工智能·目标检测·计算机视觉