microduck_rl(MuJoCo+PPO+WandB+UV训练机器人)

MuJoCo:

PPO:

WandB:

UV:

一、训练步骤

Step 1:准备 Ubuntu + NVIDIA GPU

确认能正常看到 GPU:

复制代码
nvidia-smi

Step 2:安装 uv

复制代码
curl -LsSf https://astral.sh/uv/install.sh | sh

Step 3:下载代码

复制代码
git clone https://github.com/pollen-robotics/microduck_rl
cd microduck_rl

Step 4:安装依赖

复制代码
uv sync

Step 5:登录 WandB(登录需要api-key,需要到WandB官网注册账号后创建)

复制代码
wandb login

Step 6:查看任务

复制代码
uv run list-envs

Step 7:跑 smoke test,先确认这个成功。

复制代码
uv run train Mjlab-Velocity-Flat-MicroDuck \
    --env.scene.num-envs 64 \
    --agent.max_iterations 5

Step 8:正式训练

复制代码
uv run train Mjlab-Velocity-Flat-MicroDuck \
    --env.scene.num-envs 4096

官方给出的经验是,4096 environments 下,得到一个可用 gait 大约需要 1--2 小时,具体当然取决于 GPU。

Step 9:查看训练结果

复制代码
uv run play \
    Mjlab-Velocity-Flat-MicroDuck \
    --wandb-run-path <entity/project/run_id>

Step 10:导出

复制代码
uv run scripts/export.py \
    Mjlab-Velocity-Flat-MicroDuck \
    --wandb-run-path <entity/project/run_id>

得到:

复制代码
output.onnx

Step 11:CPU仿真验证

复制代码
uv run scripts/infer_policy.py \
    --walking output.onnx

Step 12:再考虑部署到真实 Microduck

复制代码
output.onnx
      │
      ▼
Microduck policy/runtime
      │
      ▼
robotd
      │
      ▼
真实机器人

二、创建自定义动作

三、创建自定义训练任务

四、创建自定义机器人

五、PPO训练详解(结合cuda+GPU、GPGPU)

相关推荐
底层信号15 小时前
NVIDIA Halos 会刹车,但机器人安全架构还缺一块仪表盘
人工智能·机器人
风合星语6 天前
2026 具身智能技术实战(一):VLA 到底怎么控制机器人?——用 LeRobot 跑通 SmolVLA 推理
pytorch·机器人·具身智能·vla·lerobot·smolvla
鲁邦通物联网6 天前
图书馆机器人跨楼层运行,机器人梯控低噪设计与架构分析
机器人·巡检机器人·机器人梯控·agv梯控·非侵入式采集·机器人乘梯·机器人自主乘梯
PascalXie6 天前
人形机器人的“眼睛“:多目视觉方案怎么选?
计算机视觉·机器人
广州虚拟动力-动捕&虚拟主播6 天前
产教融合,具身智能数据采集实训室打造五大真实场景
机器人
微信开发api6 天前
微信iPad协议怎么用?基于协议的二次开发实践
微信·机器人·ipad
QYR-分析6 天前
机器人精密运动升级,机器人关节动态旋转密封件行业全景市场报告
人工智能·机器人
QYRdata6 天前
年均增速24.2%!机器人数据湖未来六年增长动能强劲
网络·机器人·服务发现
workflower6 天前
SSH(Struts+Spring+Hibernate)
人工智能·机器学习·机器人·云计算·无人机
微信开发api6 天前
微信机器人接口:REST API vs WebSocket 选型建议
微信·机器人·ipad