Robotics / NVIDIA
GR00T N1一个面向通用人形机器人的开放基础模型
官方英文标题:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
NVIDIA 技术报告,arXiv:2503.14734(v2,2025-03-27)。这是一份 arXiv 技术报告,不是已同行评审的顶会论文。
主来源:arXiv 摘要页 · 论文 HTML 全文
这篇报告要解决的现实矛盾是:人形机器人数据又少又贵,但训练一个能换任务、换身体的模型需要大量而多样的经验。GR00T N1 的办法不是假装所有数据都一样,而是给它们加上能互相对接的“翻译接口”。
先把四座“数据孤岛”接进同一座金字塔
图中越靠下的数据越多、越通用,却离真实机器人电机越远;越靠上越贴近具体身体,却更昂贵。预训练统计共 592.9M 帧、8,375.7 小时,其中真实机器人、人类、仿真和神经生成数据分别为 3,288.8、2,517.0、1,742.6 和 827.3 小时。论文还把 88.4 小时自采 GR-1 遥操作数据扩成 827.3 小时生成视频。请注意:生成视频增加的是候选经验,不等于增加了同等可靠的真实动作记录。(论文 §2.2、§3,表 7)
没有电机指令的人类视频不能直接教机器人转哪一个关节。作者从“当前画面变成未来画面”中提取潜在动作;对生成的机器人视频,还用逆动力学模型补出伪动作。这样,不同来源才都能被整理成“状态与画面、语言指令 → 动作目标”的训练样本。(论文 §2.2)
一个系统看懂任务,另一个系统连续出手
上路先看懂地图,开车时再连续微调方向盘;GR00T N1 也把两种节奏接在一起。System 2 用 Eagle-2 视觉语言模型读取画面和指令,论文给出的运行频率是 10 Hz;System 1 用扩散 Transformer 参考这些语义特征和机器人自身状态,以最高 120 Hz 的闭环频率生成动作。两部分并非各训各的,而是端到端联合优化。(论文 §1、§2.1)
不同机器人拥有不同数量的关节和不同动作含义,因此每种身体都有自己的状态编码器和动作解码器,中间则共享模型主体。公开的 GR00T-N1-2B 共 2.2B 参数,一次生成 16 步动作块在 L40 GPU、bf16 下耗时 63.9 ms。这个设计支持“共用知识”,但不意味着把同一串关节数值原封不动发给所有机器人。(论文 §2.1)
动作从噪声里修四次,再用少量新示范收口
System 1 不直接猜唯一动作,而是从一段随机动作草稿开始,反复问模型“下一小步该往哪里改”。论文使用 16 步动作块和 4 次去噪更新;画面、语言和机器人状态始终约束修改方向。训练时,模型学习的正是“从带噪动作回到真实示范动作”的修正方向。(论文 §2.1,式 1)
先在混合数据上预训练,再针对一种身体和一组新任务做后训练。后训练数据不足时,作者把真实轨迹与生成轨迹按 1:1 抽样共同训练;在 RoboCasa 的 30、100、300 条示范档位,加入神经轨迹平均增加 4.2、8.8、6.8 个百分点,在 8 个 GR-1 真实任务的低数据设置中平均增加 5.8 个百分点。这些是真实任务集合上的平均增益,不证明每条生成轨迹都正确。(论文 §2.3、§4.4)
换三种身体与三类场景,优势仍能测出来
这张图固定每个任务 100 条示范,比较三套仿真基准的平均成功率。GR00T-N1-2B 在 RoboCasa、DexMimicGen 和 GR-1 桌面任务上分别达到 32.1%、66.5% 和 50.0%;对应的 Diffusion Policy 是 25.6%、56.1% 和 32.7%。三套基准覆盖单臂、双臂夹爪、双灵巧手和 GR-1 人形机器人,因此它检验的是“同一组权重能否跨身体适配”,不是只在一种手臂上刷分。(论文 §4.1、§4.4,表 2)
仿真结果按每项 100 次试验统计,并取最后 5 个检查点中的最高分。这个协议与 RoboCasa 既有做法一致,但“挑最高检查点”会比只报最终检查点更乐观;而且仿真成功率不能直接等同于真实世界可靠性。(论文 §4.3)
到真实 GR-1 上,少量数据的价值最明显
真实 GR-1 桌面任务分为拾放、开合结构、工业操作和双手协调。只用各任务 10% 的后训练数据时,GR00T-N1-2B 平均成功率为 42.6%,Diffusion Policy 为 10.2%;用完整数据时,两者分别为 76.8% 和 46.4%。更直观地说,GR00T 用 10% 数据的 42.6%,已经接近基线用完整数据的 46.4%。(论文 §4.4,表 3)
真实任务通常每项只测 10 次,并采用分阶段的部分得分;机械零件打包任务只测 5 次,计分方式也不同。因此图中差距很大,但置信区间并未报告,不能把这些百分数理解成部署环境中的长期故障率。(论文 §4.3)
它会拿起桌上物体,还不会包办漫长家务
论文最扎实地展示了短时桌面操作:拾放、开柜门、倒取、交接和双手协调。预训练模型还在两个小型真实测试中取得 76.6%(11.5/15)和 73.3%(11/15);但后训练也可能“学窄”,例如只见过右手数据后,模型反而失去预训练时出现过的左右手交接行为。(论文 §4.4–§4.5)
证据没有覆盖长时间移动加操作,也没有证明生成视频总能遵守物理规律。作者明确把长时 loco-manipulation、合成数据的多样性与物理一致性列为限制;训练本身约用了 50,000 H100 GPU 小时,规模复制也有现实门槛。(论文 §2.3、§4.6)
研究附录
一句话还原方法
GR00T N1 先把多来源经验转成可共同学习的动作目标,用视觉语言模型提供“任务与场景是什么意思”,再让流匹配动作模型针对不同机器人身体生成 16 步动作块;最后用少量目标任务示范做后训练。
核心数据账本
| 数据类别 | 帧数 | 小时 | 它主要提供什么 | 不能替代什么 |
|---|---|---|---|---|
| 真实机器人 | 262.3M | 3,288.8 | 与传感器、关节和接触真实对齐的动作 | 大范围场景多样性 |
| 人类第一视角视频 | 181.3M | 2,517.0 | 丰富的人类物体交互与视觉先验 | 真实机器人电机指令 |
| 物理仿真 | 125.5M | 1,742.6 | 可规模化、可验证成功的轨迹 | 完整现实接触与视觉偏差 |
| 神经生成视频 | 23.8M | 827.3 | 新物体、位置和语言条件下的候选轨迹 | 物理可靠的真实轨迹 |
| 合计 | 592.9M | 8,375.7 | 异构预训练混合物 | 同质、同质量的数据集 |
来源:论文表 7。另有“780,000 条仿真轨迹、折合 6,500 小时、11 小时生成”的统计,它覆盖论文所述预训练与后训练仿真数据总量,不应与表 7 的预训练统计直接相加。
动作生成的数学问题:怎样学会把随机草稿改成示范动作?
具体情境:机器人需要连续移动 16 步。训练时已有正确动作块 ,其中 。作者先把它与随机噪声 淋在一起:
输入是正确动作块 、随机噪声 和混合比例 。运算是加权平均;输出 是一份带噪动作草稿。若 ,草稿全是噪声;若 ,它就是正确动作。比如一维动作 、噪声 、,混合后是 :它更靠近正确动作 2,但仍需要修正。
模型 还会看到视觉语言特征 和机器人状态 。训练目标是:
这条式子回答“模型给出的修正方向,与训练样本要求的方向差多远”。双竖线平方把每个动作维度的误差平方后相加,外面的期望表示对不同噪声时刻取平均。损失越小,预测方向越贴近训练目标;降到 0 表示在所采样训练点上方向完全吻合,但不保证遇到新场景也成功。
推理时没有正确动作可看,因此从 开始,按下式走 小步:
输入是当前动作草稿、画面与指令提取出的 、机器人自身状态 。每次把模型建议方向的 加回草稿,四次后得到一个 16 步动作块。 增大意味着步子更小、计算更多;论文只报告 在各身体上效果良好,没有给出“越大一定越好”的结论。这里省略了 Beta 时间采样、Euler 积分假设和网络层细节,因为它们不改变读者理解贡献所需的因果链。
三套仿真基准:100 条示范/任务
| 模型 | RoboCasa(24 项) | DexMG(9 项) | GR-1(24 项) | 论文表中平均值 |
|---|---|---|---|---|
| BC Transformer | 26.3% | 53.9% | 16.1% | 26.4% |
| Diffusion Policy | 25.6% | 56.1% | 32.7% | 33.4% |
| GR00T-N1-2B | 32.1% | 66.5% | 50.0% | 45.0% |
来源:论文表 2。表中的 “Average” 与三个可见列的普通算术平均不一致,论文未在表注中解释权重方式,因此此处原样保留,主图不使用该列。
真实 GR-1:后训练数据量对比
| 模型与数据量 | 拾放 | 开合结构 | 工业操作 | 双手协调 | 平均 |
|---|---|---|---|---|---|
| Diffusion Policy,10% | 3.0% | 14.3% | 6.7% | 27.5% | 10.2% |
| Diffusion Policy,完整 | 36.0% | 38.6% | 61.0% | 62.5% | 46.4% |
| GR00T-N1-2B,10% | 35.0% | 62.0% | 31.0% | 50.0% | 42.6% |
| GR00T-N1-2B,完整 | 82.0% | 70.9% | 70.0% | 82.5% | 76.8% |
来源:论文表 3、表 5。大多数任务 10 次试验;部分得分意味着“完成一半”可能得到非零分。
关键术语
| 术语 | 本文中的意思 |
|---|---|
| 身体形态(embodiment) | 一套具体机器人硬件及其传感器、关节、动作维度和控制方式 |
| VLA | 把视觉、语言与动作连接起来的模型 |
| 潜在动作 | 从前后画面的变化中学出的动作编码,不直接等于某个关节角 |
| 逆动力学模型(IDM) | 根据当前与未来画面,反推动作序列的模型 |
| 动作块 | 一次预测未来若干步动作;本文 |
| 后训练 | 在预训练模型上,用目标身体和目标任务数据继续适配 |
与前作的明确关系
- Open X-Embodiment:论文 §1、§3.1 明确说它汇集跨机器人数据;GR00T N1 采用其中多个数据集,并继续处理身体、传感器和动作维度不同造成的数据孤岛。
- Eagle-2:论文 §2.1 明确把它作为视觉语言主干,并取第 12 层中间表示。
- Flow Matching:论文 §2.1 明确采用流匹配训练动作生成。
- Action Chunking with Transformers(ACT):论文 §2.1 明确沿用动作分块思路,一次处理 步。
- Latent Action Pretraining from Videos(LAPA):论文 §2.2 明确采用潜在动作编码,把无动作标签视频纳入预训练。
证据边界与未解问题
- 报告证明的是所列基准和短时桌面任务上的表现,不是开放世界家庭通用能力。
- 真实任务重复次数少,未报告置信区间;结果适合看趋势,不适合估计罕见故障。
- 生成视频经过多模态模型过滤与重写描述,但该自动评审自身的误差未被单独量化。
- 后训练可能提升目标分布表现,也可能覆盖预训练行为;左右手交接案例就是论文给出的反例。
- 论文报告使用最多 1,024 张 GPU,GR00T-N1-2B 预训练约 50,000 H100 GPU 小时;开放权重不等于低成本复现训练。
来源定位
| 主张 | 论文位置 |
|---|---|
| 数据金字塔与统一样本格式 | §1,图 1 |
| 双系统架构、10 Hz / 120 Hz | §1、§2.1,图 2–3 |
| 潜在动作、IDM 与生成轨迹 | §2.2,图 4–5 |
| 预训练/后训练流程 | §2.3 |
| 数据总量 | 附录 F,表 7 |
| 仿真与真实结果 | §4.3–§4.4,表 2–3 |
| 后训练遗忘案例 | §4.5,图 11 |
| 长时任务与合成数据限制 | §4.6 |
自测:你能验证这些理解吗?
- 为什么人类视频不能直接当作 GR-1 的关节动作?论文用了哪两类“翻译”办法?
- System 2 和 System 1 各自看什么、输出什么?为什么频率不同?
- 在 与 时分别是什么?
- 哪组数字最能支持“预训练提高低数据效率”?为什么它仍不是部署可靠性证明?
- 如果模型只在右手示范上后训练,论文观察到了什么反效果?
关于这篇论文的三个关键问题
GR00T N1:一个面向通用人形机器人的开放基础模型 解决了什么问题?
这篇报告要解决的现实矛盾是:人形机器人数据又少又贵,但训练一个能换任务、换身体的模型需要大量而多样的经验。GR00T N1 的办法不是假装所有数据都一样,而是给它们加上能互相对接的“翻译接口”。
GR00T N1:一个面向通用人形机器人的开放基础模型 的核心结论有哪些证据?
真实 GR-1 桌面任务分为拾放、开合结构、工业操作和双手协调。只用各任务 10% 的后训练数据时,GR00T-N1-2B 平均成功率为 42.6%,Diffusion Policy 为 10.2%;用完整数据时,两者分别为 76.8% 和 46.4%。更直观地说,GR00T 用 10% 数据的 42.6%,已经接近基线用完整数据的 46.4%。
阅读 GR00T N1:一个面向通用人形机器人的开放基础模型 时最需要注意什么局限?
证据没有覆盖长时间移动加操作,也没有证明生成视频总能遵守物理规律。作者明确把长时 loco-manipulation、合成数据的多样性与物理一致性列为限制;训练本身约用了 50,000 H100 GPU 小时,规模复制也有现实门槛。