MuJoCo:
PPO:
WandB:
UV:
一、训练步骤
Step 1:准备 Ubuntu + NVIDIA GPU
确认能正常看到 GPU:
nvidia-smi
Step 2:安装 uv
curl -LsSf https://astral.sh/uv/install.sh | sh
Step 3:下载代码
git clone https://github.com/pollen-robotics/microduck_rl
cd microduck_rl
Step 4:安装依赖
uv sync
Step 5:登录 WandB(登录需要api-key,需要到WandB官网注册账号后创建)
wandb login
Step 6:查看任务
uv run list-envs
Step 7:跑 smoke test,先确认这个成功。
uv run train Mjlab-Velocity-Flat-MicroDuck \
--env.scene.num-envs 64 \
--agent.max_iterations 5
Step 8:正式训练
uv run train Mjlab-Velocity-Flat-MicroDuck \
--env.scene.num-envs 4096
官方给出的经验是,4096 environments 下,得到一个可用 gait 大约需要 1--2 小时,具体当然取决于 GPU。
Step 9:查看训练结果
uv run play \
Mjlab-Velocity-Flat-MicroDuck \
--wandb-run-path <entity/project/run_id>
Step 10:导出
uv run scripts/export.py \
Mjlab-Velocity-Flat-MicroDuck \
--wandb-run-path <entity/project/run_id>
得到:
output.onnx
Step 11:CPU仿真验证
uv run scripts/infer_policy.py \
--walking output.onnx
Step 12:再考虑部署到真实 Microduck
output.onnx
│
▼
Microduck policy/runtime
│
▼
robotd
│
▼
真实机器人