NVIDIA Isaac GR00T:从视觉与语言到机器人动作
大语言模型可以把提示词变成文本。视觉语言模型可以理解图像并回答相关问题。而一台真正有用的机器人还需要再往前走一步:把感知和指令转换成物理动作。
这正是 **NVIDIA Isaac GR00T** 要解决的问题。GR00T全称是 **Generalist Robot 00 Technology**(通用机器人00技术)。
人们常把Isaac GR00T说成一个机器人模型,这个说法并不完整。这个名字同时覆盖:
-
**Isaac GR00T**:用于构建、训练、测试和部署通用机器人的开放参考平台。
-
**GR00T N模型**:该平台中的视觉--语言--动作(vision-language-action)基础模型系列。
这个区分很重要。模型负责预测动作,而一台能工作的机器人还需要数据采集、仿真、后训练、评估、优化推理、中间件,以及考虑安全的控制。
1. 什么是Isaac GR00T?
NVIDIA将Isaac GR00T(https://developer.nvidia.com/isaac/gr00t)描述为面向通用人形机器人的开放参考平台。该平台汇集了:
-
开放的机器人基础模型
-
真实与合成机器人数据集
-
数据准备与后训练流水线
-
用于采集示教的遥操作工具
-
用于仿真与策略训练的NVIDIA Isaac Sim和Isaac Lab
-
用于合成数据的NVIDIA Omniverse与Cosmos技术
-
中间件以及经CUDA-X加速的运行时库
-
面向NVIDIA Jetson Thor的部署支持
因此,该平台覆盖了机器人开发的全生命周期:
```text
采集示教
↓
准备并增强数据
↓
对GR00T模型做后训练
↓
在仿真中评估
↓
优化并部署
↓
在实体机器人上运行
```
GR00T模型是这条工作流的核心,但并不是工作流的全部。
2. 什么是视觉--语言--动作模型?
GR00T N是一种 **视觉--语言--动作**(**VLA**,vision-language-action)模型。VLA模型连接三个域:
-
**视觉:** 机器人看到了什么?
-
**语言:** 机器人被要求做什么?
-
**动作:** 机器人应该如何运动?
推理时,GR00T模型主要消费三类输入:
```text
机载相机画面
-
自然语言指令
-
机器人本体感觉状态
→ 预测的机器人动作
```
本体感觉(proprioceptive)状态描述的是机器人自身,例如关节位置、夹爪状态,或其他控制器观测。
以这条指令为例:
```text
"拿起红色杯子,放到托盘上。"
```
普通语言模型可以解释该怎么做。VLA模型则必须把"红色杯子"和"托盘"对应到相机图像中的像素,结合机器人当前构型,并生成机器人能够执行的运动。
于是输出从文本token变成了动作值:
```text
LLM:提示词 → 文本token
VLM:图像 + 提示词 → 文本token
VLA:图像 + 提示词 + 机器人状态 → 动作序列
```
3. GR00T预测动作块
GR00T不必在每次推理时只预测一个瞬时指令。它预测的是 **动作块**(action chunk):一段未来动作序列。
概念上:
```text
时刻t的当前观测
↓
GR00T策略
↓
动作(t), 动作(t+1), ... 动作(t+H-1)
```
这里的`H`是动作视野(action horizon)。
动作分块有若干实际好处:
-
减少昂贵的模型前向次数。
-
提供时间上相关的动作,而不是孤立指令。
-
有助于产生更平滑的机器人运动。
-
让推理和控制可以按不同频率运行。
具体的动作表示取决于机器人和训练配置。它可能描述相对关节运动、末端执行器指令,或其他策略特定的动作空间。模型输出通常由机器人控制器消费;除非所部署的策略被明确设计成那样,否则不要把它理解成原始电机电流或力矩指令。
4. GR00T模型架构
当前的GR00T N1.7系列把高层多模态理解与连续动作生成结合在一起。
主要概念组件如下:
```text
RGB图像 ───────────────┐
│
语言指令 ───────────────┼─→ 多模态表示
│
机器人状态 ─────────────┘
↓
流匹配动作模型
↓
动作块
```
视觉--语言骨干
GR00T N1.7使用基于Qwen3-VL架构的 **Cosmos-Reason2-2B** 作为视觉--语言骨干。这部分模型提取视觉特征、理解指令,并构建任务与场景的表示。
机器人状态编码
机器人状态是数值,而不是视觉或文本。它会被编码,并与视觉--语言表示融合,从而使动作预测以机器人当前物理构型为条件。
流匹配动作Transformer
流匹配(flow-matching)动作Transformer在视觉、语言和本体感觉的条件下生成连续动作块。这不同于LLM的下一token预测:机器人动作是连续、时间相关的数值。
GR00T N1.7模型卡(https://huggingface.co/nvidia/GR00T-N1.7-3B)描述的模型约有30亿参数。不同GR00T版本的模型细节可能变化,因此架构表述应始终对应到具体版本。
5. "跨本体"是什么意思?
机器人并不都有同样的身体。它们可能在以下方面不同:
-
关节数量与顺序
-
手臂与手部几何
-
相机安装位置
-
夹爪设计
-
状态向量维度
-
动作向量维度
-
控制频率与控制器语义
GR00T被设计为 **跨本体**(cross-embodiment)模型:一个预训练基础模型可以适配到多种机器人本体,而不是每个机器人开发者都从随机权重开始。
跨本体 **并不** 意味着任意机器人都可以在不做配置或训练的情况下安全使用基础checkpoint。目标机器人仍然需要:
-
图像、状态和动作的正确映射
-
模型所期望的本体描述或标识
-
能代表其运动学与任务的示教
-
针对目标本体与环境的后训练
-
评估以及与控制器的集成
基础模型的价值是更强的起点和可复用的操作知识------而不是取消机器人特定工程。
6. GR00T的训练数据从哪来?
通用机器人行为需要多样性。真实机器人示教很有价值,但采集昂贵且缓慢。GR00T结合了多种数据来源:
真实机器人示教
遥操作示教把相机观测和指令,与在实体硬件上成功执行的动作连在一起。它们提供真实的动力学、接触、传感器噪声和控制器行为。
合成仿真数据
仿真可以在物体、环境、光照条件和任务变化上生成大量轨迹。Isaac Sim和Isaac Lab有助于在物理建模环境中创建、训练和测试策略,然后再做实体部署。
人类视频
互联网规模和第一人称人类视频,提供关于物体、环境以及任务如何展开的广泛视觉与语义知识。人类视频并不直接包含目标机器人的关节指令,因此还需要额外学习方法,才能把视觉行为变成有用的机器人先验或带标注轨迹。
生成与增强数据
NVIDIA Cosmos世界模型以及GR00T数据生成工作流,有助于扩展场景与行为的多样性。合成生成用来补充------而不是自动替代------真实示教和真实世界验证。
根据NVIDIA对GR00T N1.7的介绍,其预训练混合数据包含大规模真实人类示教、第一人称数据以及仿真rollout。具体配比因版本而异。
7. 针对某台机器人后训练GR00T
预训练模型包含广泛先验,但可部署策略通常仍需要在目标机器人和任务上做后训练。
典型工作流如下:
步骤1:定义任务与动作空间
明确策略应观测和预测什么:
```text
观测:
-
头部相机
-
腕部相机
-
关节位置
-
夹爪状态
-
语言指令
动作:
-
相对手臂关节指令
-
夹爪指令
```
动作语义含糊时,即使每个张量形状都正确,数据集也没法用。
步骤2:采集示教
使用遥操作或现有控制器记录成功轨迹。每条轨迹应对齐:
```text
带时间戳的图像
-
机器人状态
-
指令动作或已执行动作
-
任务指令
```
步骤3:转换并校验数据集
公开的GR00T工作流支持与Hugging Face LeRobot生态兼容的数据集。校验应在训练前捕获缺失帧、时间戳错位、维度错误、无效episode,以及不一致的归一化。
步骤4:对基础模型做后训练
在目标本体的示教上微调模型。数据集质量和覆盖范围,往往比单纯增加梯度步数更重要。
步骤5:在仿真和离线评估
不要只看训练损失。有用的度量包括:
-
任务成功率
-
碰撞与安全违规
-
完成时间
-
动作平滑度
-
对相机与物体变化的鲁棒性
-
对未见初始状态的泛化
步骤6:带着安全约束部署
先用保守的速度、工作空间和力限制。在扩大运行包络之前,先验证感知、策略输出、控制器行为、急停和恢复路径。
8. GR00T平台各组件如何配合
GR00T周围有多项NVIDIA技术,它们扮演不同角色。
Isaac Teleop
在仿真或实体系统上采集人类示教。结果是用于模仿学习和策略后训练的数据。
Isaac Sim
提供高保真机器人仿真与渲染。用于创建环境、测试集成,以及在不立刻拿实体硬件冒险的情况下验证行为。
Isaac Lab
提供模块化的机器人学习环境,包括围绕仿真构建的强化学习和模仿学习工作流。
Omniverse与Cosmos
Omniverse支持仿真与数字世界构建。Cosmos提供世界基础模型与工具,可参与物理AI数据生成与推理工作流。
GR00T-WholeBodyControl
提供全身控制组件和策略。VLA模型可以决定执行什么行为,而全身控制器负责动态稳定的执行。它们是相关的不同层,不是同一个模型的可互换名称。
CUDA-X与TensorRT
CUDA-X库加速感知、张量运算和AI推理。TensorRT针对NVIDIA GPU优化模型执行。GR00T N1.7增加了用于部署工作流的ONNX与TensorRT导出路径。
Jetson Thor
Jetson Thor在边缘提供Blackwell GPU算力,用于多模态推理和机器人控制,使机器人不必把每一帧相机画面都送到远端服务器。
9. 训练、仿真和部署是不同工作负载
完整工作流通常在不同阶段使用不同计算平台:
```text
大型GPU系统 / DGX
模型预训练和大规模后训练任务
RTX工作站或服务器
仿真、合成数据、开发、评估
Jetson Thor
机载推理与实时机器人集成
```
这不是硬性规则。小实验可以在更少资源上运行,部署拓扑也取决于机器人。关键点是:最适合训练数千条轨迹的硬件,未必是应该装进机器人内部的硬件。
10. GR00T不是完整的机器人控制器
GR00T策略是重要的决策组件,但量产机器人周围仍需要常规系统:
```text
传感器与时间戳同步
↓
感知与状态估计
↓
GR00T策略推理
↓
动作校验与安全过滤
↓
轨迹 / 全身控制器
↓
电机控制器与硬件
```
还可能包括:
-
定位与建图
-
碰撞检测
-
关节、速度、力和工作空间限制
-
故障检测与看门狗
-
确定性底层控制回路
-
人员安全系统
-
日志、回放与事故分析
基准测试中一次成功的模型rollout,本身并不能证明机器人已可无监督运行。
11. GR00T适合做什么
GR00T旨在为如下技能提供可复用基础:
-
抓取与移动物体
-
单臂与双臂操作
-
双手之间传递物体
-
由语言条件化的抓取放置
-
多步操作
-
物料搬运、包装与检测工作流
-
在不同机器人本体上做后训练
当项目需要把视觉理解、语言指令和连续机器人动作结合起来,而不是为每个单独任务各建一个模型时,它尤其有用。
GR00T并不保证:
-
在任意硬件上零样本运行
-
从仿真到现实的完美迁移
-
对未见的安全关键情形行为正确
-
可以不做示教或后训练
-
可以替代底层实时控制
12. GR00T N1.7与更早版本
GR00T N系列经历了N1、N1.5、N1.6、N1.7等版本。架构细节、数据集、支持的本体、许可证、导出工具和发布支持都可能不同。
对N1.7,NVIDIA描述的显著变化包括:
-
Cosmos-Reason2-2B / Qwen3-VL视觉--语言骨干
-
灵活的图像分辨率与原生宽高比处理
-
流匹配动作Transformer
-
更强的长视野任务推理与分解
-
更强的跨本体泛化
-
用于部署的ONNX与TensorRT导出
-
与Hugging Face LeRobot工作流集成
务必让文档、模型卡、代码分支和checkpoint版本互相匹配。不要把N1.5或N1.6的安装说明与N1.7 checkpoint混用,并假定接口相同。
发布状态和支持条款可能变化。在为生产环境选择版本前,请查看当前官方页面、仓库和模型许可证。
13. 如何开始
从官方资源入手:
-
Isaac GR00T平台概览(https://developer.nvidia.com/isaac/gr00t)
-
NVIDIA Isaac GR00T GitHub仓库(https://github.com/NVIDIA/Isaac-GR00T)
-
GR00T N1.7 3B模型卡(https://huggingface.co/nvidia/GR00T-N1.7-3B)
-
GR00T基础模型论文(https://arxiv.org/abs/2503.14734)
-
NVIDIA GR00T开发工作流(https://developer.nvidia.com/blog/develop-humanoid-robot-policies-end-to-end-with-nvidia-isaac-gr00t/)
合理的第一个项目不是不受约束的人形机器人部署。先从一台机器人、一两路相机、明确定义的动作空间,以及可重复的操作任务开始。在扩大任务多样性之前,先建立数据采集、回放、评估和安全限制。
结语
Isaac GR00T既是机器人开发平台,也是NVIDIA GR00T机器人基础模型的所在。其VLA模型把相机观测、语言指令和机器人状态,连接到连续动作块。模型周围,平台还提供数据、仿真、训练、运行时和部署组件,帮助从研究checkpoint走向可工作的机器人。
核心想法很直接:
```text
看见世界
-
理解指令
-
知道机器人当前状态
→ 生成有用的物理动作
```
难的工程在于让这个闭环可靠:采集正确的示教、把模型适配到本体、在仿真和现实中验证、集成确定性控制,并落实安全。GR00T提供了强起点,但完整的机器人仍然是一个系统------而不只是一个模型。