返回报告库

Robotics / NVIDIA

GR00T N1一个面向通用人形机器人的开放基础模型

官方英文标题:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
NVIDIA 技术报告,arXiv:2503.14734(v2,2025-03-27)。这是一份 arXiv 技术报告,不是已同行评审的顶会论文。
主来源:arXiv 摘要页 · 论文 HTML 全文

这篇报告要解决的现实矛盾是:人形机器人数据又少又贵,但训练一个能换任务、换身体的模型需要大量而多样的经验。GR00T N1 的办法不是假装所有数据都一样,而是给它们加上能互相对接的“翻译接口”。

先把四座“数据孤岛”接进同一座金字塔

图中越靠下的数据越多、越通用,却离真实机器人电机越远;越靠上越贴近具体身体,却更昂贵。预训练统计共 592.9M 帧、8,375.7 小时,其中真实机器人、人类、仿真和神经生成数据分别为 3,288.8、2,517.0、1,742.6 和 827.3 小时。论文还把 88.4 小时自采 GR-1 遥操作数据扩成 827.3 小时生成视频。请注意:生成视频增加的是候选经验,不等于增加了同等可靠的真实动作记录。(论文 §2.2、§3,表 7)

没有电机指令的人类视频不能直接教机器人转哪一个关节。作者从“当前画面变成未来画面”中提取潜在动作;对生成的机器人视频,还用逆动力学模型补出伪动作。这样,不同来源才都能被整理成“状态与画面、语言指令 → 动作目标”的训练样本。(论文 §2.2)

一个系统看懂任务,另一个系统连续出手

上路先看懂地图,开车时再连续微调方向盘;GR00T N1 也把两种节奏接在一起。System 2 用 Eagle-2 视觉语言模型读取画面和指令,论文给出的运行频率是 10 Hz;System 1 用扩散 Transformer 参考这些语义特征和机器人自身状态,以最高 120 Hz 的闭环频率生成动作。两部分并非各训各的,而是端到端联合优化。(论文 §1、§2.1)

不同机器人拥有不同数量的关节和不同动作含义,因此每种身体都有自己的状态编码器和动作解码器,中间则共享模型主体。公开的 GR00T-N1-2B 共 2.2B 参数,一次生成 16 步动作块在 L40 GPU、bf16 下耗时 63.9 ms。这个设计支持“共用知识”,但不意味着把同一串关节数值原封不动发给所有机器人。(论文 §2.1)

动作从噪声里修四次,再用少量新示范收口

System 1 不直接猜唯一动作,而是从一段随机动作草稿开始,反复问模型“下一小步该往哪里改”。论文使用 16 步动作块和 4 次去噪更新;画面、语言和机器人状态始终约束修改方向。训练时,模型学习的正是“从带噪动作回到真实示范动作”的修正方向。(论文 §2.1,式 1)

先在混合数据上预训练,再针对一种身体和一组新任务做后训练。后训练数据不足时,作者把真实轨迹与生成轨迹按 1:1 抽样共同训练;在 RoboCasa 的 30、100、300 条示范档位,加入神经轨迹平均增加 4.2、8.8、6.8 个百分点,在 8 个 GR-1 真实任务的低数据设置中平均增加 5.8 个百分点。这些是真实任务集合上的平均增益,不证明每条生成轨迹都正确。(论文 §2.3、§4.4)

换三种身体与三类场景,优势仍能测出来

这张图固定每个任务 100 条示范,比较三套仿真基准的平均成功率。GR00T-N1-2B 在 RoboCasa、DexMimicGen 和 GR-1 桌面任务上分别达到 32.1%、66.5% 和 50.0%;对应的 Diffusion Policy 是 25.6%、56.1% 和 32.7%。三套基准覆盖单臂、双臂夹爪、双灵巧手和 GR-1 人形机器人,因此它检验的是“同一组权重能否跨身体适配”,不是只在一种手臂上刷分。(论文 §4.1、§4.4,表 2)

仿真结果按每项 100 次试验统计,并取最后 5 个检查点中的最高分。这个协议与 RoboCasa 既有做法一致,但“挑最高检查点”会比只报最终检查点更乐观;而且仿真成功率不能直接等同于真实世界可靠性。(论文 §4.3)

到真实 GR-1 上,少量数据的价值最明显

真实 GR-1 桌面任务分为拾放、开合结构、工业操作和双手协调。只用各任务 10% 的后训练数据时,GR00T-N1-2B 平均成功率为 42.6%,Diffusion Policy 为 10.2%;用完整数据时,两者分别为 76.8% 和 46.4%。更直观地说,GR00T 用 10% 数据的 42.6%,已经接近基线用完整数据的 46.4%。(论文 §4.4,表 3)

真实任务通常每项只测 10 次,并采用分阶段的部分得分;机械零件打包任务只测 5 次,计分方式也不同。因此图中差距很大,但置信区间并未报告,不能把这些百分数理解成部署环境中的长期故障率。(论文 §4.3)

它会拿起桌上物体,还不会包办漫长家务

论文最扎实地展示了短时桌面操作:拾放、开柜门、倒取、交接和双手协调。预训练模型还在两个小型真实测试中取得 76.6%(11.5/15)和 73.3%(11/15);但后训练也可能“学窄”,例如只见过右手数据后,模型反而失去预训练时出现过的左右手交接行为。(论文 §4.4–§4.5)

证据没有覆盖长时间移动加操作,也没有证明生成视频总能遵守物理规律。作者明确把长时 loco-manipulation、合成数据的多样性与物理一致性列为限制;训练本身约用了 50,000 H100 GPU 小时,规模复制也有现实门槛。(论文 §2.3、§4.6)

研究附录

一句话还原方法

GR00T N1 先把多来源经验转成可共同学习的动作目标,用视觉语言模型提供“任务与场景是什么意思”,再让流匹配动作模型针对不同机器人身体生成 16 步动作块;最后用少量目标任务示范做后训练。

核心数据账本

数据类别帧数小时它主要提供什么不能替代什么
真实机器人262.3M3,288.8与传感器、关节和接触真实对齐的动作大范围场景多样性
人类第一视角视频181.3M2,517.0丰富的人类物体交互与视觉先验真实机器人电机指令
物理仿真125.5M1,742.6可规模化、可验证成功的轨迹完整现实接触与视觉偏差
神经生成视频23.8M827.3新物体、位置和语言条件下的候选轨迹物理可靠的真实轨迹
合计592.9M8,375.7异构预训练混合物同质、同质量的数据集

来源:论文表 7。另有“780,000 条仿真轨迹、折合 6,500 小时、11 小时生成”的统计,它覆盖论文所述预训练与后训练仿真数据总量,不应与表 7 的预训练统计直接相加。

动作生成的数学问题:怎样学会把随机草稿改成示范动作?

具体情境:机器人需要连续移动 16 步。训练时已有正确动作块 At=[at,at+1,,at+H1]A_t=[a_t,a_{t+1},\ldots,a_{t+H-1}],其中 H=16H=16。作者先把它与随机噪声 ϵ\epsilon 淋在一起:

Atτ=τAt+(1τ)ϵ,τ[0,1].A_t^\tau=\tau A_t+(1-\tau)\epsilon,\qquad \tau\in[0,1].

输入是正确动作块 AtA_t、随机噪声 ϵ\epsilon 和混合比例 τ\tau。运算是加权平均;输出 AtτA_t^\tau 是一份带噪动作草稿。若 τ=0\tau=0,草稿全是噪声;若 τ=1\tau=1,它就是正确动作。比如一维动作 At=2A_t=2、噪声 ϵ=2\epsilon=-2τ=0.75\tau=0.75,混合后是 11:它更靠近正确动作 2,但仍需要修正。

模型 VθV_\theta 还会看到视觉语言特征 ϕt\phi_t 和机器人状态 qtq_t。训练目标是:

Lfm(θ)=Eτ[Vθ(ϕt,Atτ,qt)(ϵAt)2].\mathcal{L}_{\textit{fm}}(\theta)= \mathbb{E}_{\tau}\left[ \left\|V_{\theta}(\phi_t,A_t^\tau,q_t)-(\epsilon-A_t)\right\|^2 \right].

这条式子回答“模型给出的修正方向,与训练样本要求的方向差多远”。双竖线平方把每个动作维度的误差平方后相加,外面的期望表示对不同噪声时刻取平均。损失越小,预测方向越贴近训练目标;降到 0 表示在所采样训练点上方向完全吻合,但不保证遇到新场景也成功。

推理时没有正确动作可看,因此从 At0N(0,I)A_t^0\sim\mathcal N(\mathbf0,\mathbf I) 开始,按下式走 K=4K=4 小步:

Atτ+1/K=Atτ+1KVθ(ϕt,Atτ,qt).A_t^{\tau+1/K}=A_t^\tau+\frac{1}{K}V_\theta(\phi_t,A_t^\tau,q_t).

输入是当前动作草稿、画面与指令提取出的 ϕt\phi_t、机器人自身状态 qtq_t。每次把模型建议方向的 1/K1/K 加回草稿,四次后得到一个 16 步动作块。KK 增大意味着步子更小、计算更多;论文只报告 K=4K=4 在各身体上效果良好,没有给出“越大一定越好”的结论。这里省略了 Beta 时间采样、Euler 积分假设和网络层细节,因为它们不改变读者理解贡献所需的因果链。

三套仿真基准:100 条示范/任务

模型RoboCasa(24 项)DexMG(9 项)GR-1(24 项)论文表中平均值
BC Transformer26.3%53.9%16.1%26.4%
Diffusion Policy25.6%56.1%32.7%33.4%
GR00T-N1-2B32.1%66.5%50.0%45.0%

来源:论文表 2。表中的 “Average” 与三个可见列的普通算术平均不一致,论文未在表注中解释权重方式,因此此处原样保留,主图不使用该列。

真实 GR-1:后训练数据量对比

模型与数据量拾放开合结构工业操作双手协调平均
Diffusion Policy,10%3.0%14.3%6.7%27.5%10.2%
Diffusion Policy,完整36.0%38.6%61.0%62.5%46.4%
GR00T-N1-2B,10%35.0%62.0%31.0%50.0%42.6%
GR00T-N1-2B,完整82.0%70.9%70.0%82.5%76.8%

来源:论文表 3、表 5。大多数任务 10 次试验;部分得分意味着“完成一半”可能得到非零分。

关键术语

术语本文中的意思
身体形态(embodiment)一套具体机器人硬件及其传感器、关节、动作维度和控制方式
VLA把视觉、语言与动作连接起来的模型
潜在动作从前后画面的变化中学出的动作编码,不直接等于某个关节角
逆动力学模型(IDM)根据当前与未来画面,反推动作序列的模型
动作块一次预测未来若干步动作;本文 H=16H=16
后训练在预训练模型上,用目标身体和目标任务数据继续适配

与前作的明确关系

  • Open X-Embodiment:论文 §1、§3.1 明确说它汇集跨机器人数据;GR00T N1 采用其中多个数据集,并继续处理身体、传感器和动作维度不同造成的数据孤岛。
  • Eagle-2:论文 §2.1 明确把它作为视觉语言主干,并取第 12 层中间表示。
  • Flow Matching:论文 §2.1 明确采用流匹配训练动作生成。
  • Action Chunking with Transformers(ACT):论文 §2.1 明确沿用动作分块思路,一次处理 H=16H=16 步。
  • Latent Action Pretraining from Videos(LAPA):论文 §2.2 明确采用潜在动作编码,把无动作标签视频纳入预训练。

证据边界与未解问题

  • 报告证明的是所列基准和短时桌面任务上的表现,不是开放世界家庭通用能力。
  • 真实任务重复次数少,未报告置信区间;结果适合看趋势,不适合估计罕见故障。
  • 生成视频经过多模态模型过滤与重写描述,但该自动评审自身的误差未被单独量化。
  • 后训练可能提升目标分布表现,也可能覆盖预训练行为;左右手交接案例就是论文给出的反例。
  • 论文报告使用最多 1,024 张 GPU,GR00T-N1-2B 预训练约 50,000 H100 GPU 小时;开放权重不等于低成本复现训练。

来源定位

主张论文位置
数据金字塔与统一样本格式§1,图 1
双系统架构、10 Hz / 120 Hz§1、§2.1,图 2–3
潜在动作、IDM 与生成轨迹§2.2,图 4–5
预训练/后训练流程§2.3
数据总量附录 F,表 7
仿真与真实结果§4.3–§4.4,表 2–3
后训练遗忘案例§4.5,图 11
长时任务与合成数据限制§4.6

自测:你能验证这些理解吗?

  1. 为什么人类视频不能直接当作 GR-1 的关节动作?论文用了哪两类“翻译”办法?
  2. System 2 和 System 1 各自看什么、输出什么?为什么频率不同?
  3. AtτA_t^\tauτ=0\tau=0τ=1\tau=1 时分别是什么?
  4. 哪组数字最能支持“预训练提高低数据效率”?为什么它仍不是部署可靠性证明?
  5. 如果模型只在右手示范上后训练,论文观察到了什么反效果?

关于这篇论文的三个关键问题

GR00T N1:一个面向通用人形机器人的开放基础模型 解决了什么问题?

这篇报告要解决的现实矛盾是:人形机器人数据又少又贵,但训练一个能换任务、换身体的模型需要大量而多样的经验。GR00T N1 的办法不是假装所有数据都一样,而是给它们加上能互相对接的“翻译接口”。

GR00T N1:一个面向通用人形机器人的开放基础模型 的核心结论有哪些证据?

真实 GR-1 桌面任务分为拾放、开合结构、工业操作和双手协调。只用各任务 10% 的后训练数据时,GR00T-N1-2B 平均成功率为 42.6%,Diffusion Policy 为 10.2%;用完整数据时,两者分别为 76.8% 和 46.4%。更直观地说,GR00T 用 10% 数据的 42.6%,已经接近基线用完整数据的 46.4%。

阅读 GR00T N1:一个面向通用人形机器人的开放基础模型 时最需要注意什么局限?

证据没有覆盖长时间移动加操作,也没有证明生成视频总能遵守物理规律。作者明确把长时 loco-manipulation、合成数据的多样性与物理一致性列为限制;训练本身约用了 50,000 H100 GPU 小时,规模复制也有现实门槛。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro