返回报告库

Robotics / NVIDIA

DreamDojo从大规模人类视频学会预演机器人动作

官方英文标题: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
论文: arXiv:2602.06949 · 发表状态: ICML 2026 Spotlight

DreamDojo 不是直接教机器人“下一步该做什么”,而是训练一个能预演“如果这样动,接下来会看到什么”的视频世界模型。它的关键路线是:先从大量人类第一视角视频学物体互动,再用少量目标机器人数据学会机器人自己的控制方式。

先把 44,711 小时生活经验装进模型

先看规模,也看来源:最终混合数据共 44,711 小时,其中 DreamDojo-HV 占 43,827 小时,EgoDex 占 829 小时,实验室采集占 55 小时。它覆盖家居、工业、零售、教育等场景,让模型见过的物体互动远多于单一机器人数据集。论文 §3.2、表 1

但“看得多”不等于“会被动作控制”。这些视频大多没有逐帧的关节动作标签;而且论文中的技能数由语言标注估算,不能当作人工逐条核验的精确类别数。

没有动作标签,就从相邻画面里压出“发生了什么动作”

想象两帧画面:第一帧里手在杯子旁,第二帧里杯子被拿起。潜在动作模型把这两帧压成一个短向量 a^t\hat a_t,只保留解释变化所需的信息;再让解码器用“前一帧 + 这个向量”重建后一帧。于是不同的人、机器人和背景可以共享“拿起”“推开”这类变化线索,原本无标签的视频就有了统一的代理动作。论文 §3.3.2、图 3

这里学到的是画面变化的紧凑编码,不是人类可直接读取的动作名称。相机移动、遮挡和环境变化仍可能混进这个编码;跨身体迁移是实验支持的能力,不是保证每个向量都只表示纯动作。

人类经验要经过机器人“小课”,才能变成关节控制

预训练先教模型广泛的物体互动,后训练再教它“这台机器人怎样动”。研究者重置动作输入层,用目标机器人的连续动作重新连接模型,并更新全部权重。动作改写成相对位移,每 4 个连续动作只送给对应的视频潜帧,减少模型把未来动作偷用到当前预测里的因果混乱。论文 §3.3.1、§3.3.3

这一步仍需要目标机器人数据和大量算力:默认后训练使用 128 张 H100、训练 50,000 步。论文展示了在有限场景数据之后迁移到新物体和新环境,但没有证明任何新机器人都能零成本接入。

把慢老师蒸馏成会连续直播的快学生

原模型像一位反复修改整段视频的老师:每次要去噪 35 步,只看一个条件帧,速度是 2.72 FPS。学生改成只向前看的因果注意力,去噪缩到 4 步,并在训练时接着自己刚生成的画面继续预测。这样训练时遇到的输入,更接近真正运行时会遇到的输入。论文 §3.3.4、§4.6

结果是 10.81 FPS,接近 4 倍提速,还能利用 12 帧上下文;代价是长时视频指标下降,例如 PSNR 从 14.086 降到 13.146。实时不是“无损加速”,而是速度、画质与稳定性的交换。

预演不是终点:它要帮机器人筛动作

规划时,策略先提出多个候选动作;DreamDojo 批量生成各自的未来视频;外部价值模型挑出最接近子任务完成的一个,再交给真实机器人执行。另一项水果装袋实验中,模拟成功率与真实成功率的线性相关达到 Pearson r=0.995r=0.995,排序误差 MMRV 为 0.003论文 §4.7、图 5

这些证据说明它在该任务与 20 个场景里很会“排顺序”,不代表模拟成功率本身完全准确。论文明确说,DreamDojo 往往比现实更乐观;规划增益也来自特定策略组,不能直接外推到所有机器人任务。

泛化变强了,但罕见动作和真实失败仍是盲区

在 50 个新背景样本的成对人评中,14B DreamDojo 相对原始 Cosmos-Predict2.5 的胜率为:物理正确性 73.50%,动作跟随 72.55%。这是目前最直观的域外证据:大规模人类视频预训练确实让模型更能处理未见环境与物体互动。论文 §4.4、表 4

边界同样清楚:论文点名快速挥手、拍打等少见动作仍会失败;模型会低估细微失败,不原生支持多视角;人评只有 12 名志愿者,域外新背景集共 50 个样本。它展示的是有希望的泛化,不是“已经理解现实世界”。

研究附录

一句话训练循环

  1. 用 In-lab、EgoDex、DreamDojo-HV 的第一视角人类视频做预训练。
  2. 从相邻帧自监督提取 32 维连续潜在动作,把无标签视频变成“画面 + 代理动作”训练对。
  3. 在 Cosmos-Predict2.5 视频扩散模型上学习动作条件下的未来帧。
  4. 换到目标机器人数据,重置动作输入层并全量微调,让模型接收真实连续动作。
  5. 把双向、35 步的老师蒸馏成因果、4 步的学生;学生用自己的历史输出继续滚动。
  6. 用生成的未来做遥操作预览、策略评估或候选动作筛选。

核心数字账本

证据精确值该怎么读来源
In-lab55 小时;13.9k 轨迹有精确手部追踪的实验室数据§3.2,表 1
EgoDex829 小时;30k 轨迹Apple Vision Pro 记录的带手部姿态数据§3.2,表 1
DreamDojo-HV43,827 小时;1,135k 轨迹众包第一视角生活视频主体§3.2,表 1
最终人类视频混合44,711 小时;1,179k 轨迹三者之和;正文简称 44k 小时§3.2,表 1
世界模型2B 与 14B 两档从 Cosmos-Predict2.5 初始化§4.1
预训练256 张 H100,140k 步有效批量 1024§4.1
默认后训练128 张 H100,50k 步全权重更新§4.1
蒸馏64 张 H10010k 预热迭代 + 3k 蒸馏迭代§4.1
老师 → 学生2.72 → 10.81 FPSH100 单卡长时评测§4.6,表 6
14B 对基础模型的人评胜率73.50% / 72.55%物理正确性 / 动作跟随§4.4,表 4

两个真正需要的数学问题

问题一:模型怎样把两帧之间的变化压成“代理动作”?

Lθ,ϕpred(ft+1)=Eqϕ(a^ft:t+1)logpθ(ft+1a^,ft)βDKL(qϕ(a^ft:t+1)p(a^))\mathcal{L}^{pred}_{\theta,\phi}(f^{t+1}) =\mathbb{E}_{q_{\phi}(\hat{a}|f^{t:t+1})}\log p_{\theta}(f^{t+1}|\hat{a},f^{t}) -\beta D_{KL}(q_{\phi}(\hat{a}|f^{t:t+1})\|p(\hat{a}))

输入是相邻两帧 ft,ft+1f^t,f^{t+1}。编码器 qϕq_\phi 生成潜在动作 a^\hat a;解码器 pθp_\theta 接收前一帧和 a^\hat a,尝试还原后一帧。第一项奖励重建得像,第二项用 DKLD_{KL} 约束编码不要随意塞进无限信息;β\beta 决定约束力度。

可以把它想成写一张很短的“找不同”便签。便签若只能写几个字,就更可能写“杯子向上移动”,而不是复制整张第二帧。若 β\beta 太小,便签可能偷藏背景细节,跨场景迁移会变差;若太大,便签容量不够,动作也会丢失。论文用 β=106\beta=10^{-6},潜在动作维度为 32。公式中的第一项按常见 VAE 写法是最大化目标;实现时通常取其负号作为要最小化的损失。

问题二:为什么蒸馏学生要看自己生成的历史?

Ldistill=DKL(pteacherpstudent)\mathcal{L}_{\text{distill}} =D_{\text{KL}}(p_{\text{teacher}}\|p_{\text{student}})

输入是老师与学生对未来视频的概率分布;DKLD_{KL} 衡量两种分布有多不一致;输出是一个差距。差距越小,学生给各种未来分配的相对可能性越接近老师。它不是逐像素抄答案,而是在整体分布上靠近老师。

关键不只在公式,还在喂给学生的上下文。若训练时学生总看老师的完美上一帧,运行时一旦看到自己的小错误,就会进入陌生状态。DreamDojo 让学生在蒸馏阶段接着自己的输出滚动,再用老师纠偏。就像练习口述故事时,不是每句话都拿标准稿重新开头,而是从自己上一句继续说;这样才能练到错误如何累积。论文还让学生生成比老师训练窗口更长的片段,再随机选窗口监督,以增加长时滚动的耐受力。

为什么主文没有展示更多公式

论文还使用流匹配损失、时间一致性损失、热身回归损失和可计算的蒸馏梯度。它们影响训练细节,但不是理解“人类视频 → 代理动作 → 机器人适配 → 实时学生”的必要门槛。时间一致性损失的核心作用,是让相邻预测帧之间的变化贴近真实视频的变化;实验权重为 λ=0.1\lambda=0.1。完整公式见论文式 (2)、(4)–(8)。

评测怎么做,结论能走多远

自动指标使用 PSNR、SSIM(越高越好)和 LPIPS(越低越好)。未蒸馏模型通常生成 49 帧、100 个样本;长时蒸馏评测生成 600 帧,即 1 分钟。域外人评由 12 名志愿者比较物理正确性与动作跟随,两个新背景集合各 25 个样本。

最强的因果证据来自消融:在 Counterfactual Eval 上,从基础结构到加入相对动作、分块动作和时间一致性损失后,PSNR 从 19.448 升到 20.980,LPIPS 从 0.211 降到 0.189。数据混合消融也显示,加入更多人类数据后,多数指标改善,但并非每个数据集的每项指标都单调变好。

与前人工作的明确关系

  • DreamDojo 继承 Cosmos-Predict2.5 作为视频扩散世界模型的初始化骨架。
  • 采用并扩展 AdaWorld 的连续潜在动作思路,把它用到 44,711 小时、跨身体的人类视频预训练。
  • 采用 Self Forcing 的训练—推理对齐范式,增加更长学生滚动与随机窗口监督,得到实时自回归学生。
  • 论文还把 WorldEval / SIMPLER 的相关性与排序评测用于策略评估,但没有声称替代真实机器人测试。

术语

本文里的意思
世界模型给定当前画面与动作,生成接下来可能出现的视频
第一视角视频摄像头随人的头部或身体移动,看到操作者所见
潜在动作从相邻画面变化压缩出的短向量,不是人工动作名称
后训练用目标机器人自己的数据把预训练模型接到真实动作空间
蒸馏让更快的学生模仿较慢老师的生成分布
自回归每次生成一小段,并把自己的历史输出作为下一次输入
域外(OOD)评测对象、动作或背景不在机器人训练数据的常见分布里
Pearson rr两组数是否近似按直线一起升降;接近 1 表示线性排序趋势很一致

不确定性与限制

  • 论文称数据混合包含至少 6,015 个技能;该数字由 GPT 根据全局语言标注估算。
  • 表 1 的“场景”口径在不同数据集间未必完全一致;正文另报 9,869 个 unique scenes,与表中逐视频统计口径不同。
  • 策略评估的 r=0.995r=0.995 来自一个水果装袋任务、20 个场景和若干策略检查点;样本范围较窄。
  • 模型对罕见快速动作、细微失败、多视角状态仍不可靠。
  • 训练算力很高,论文没有提供完整能耗、数据采集成本或复现总成本。
  • 论文展示的是生成视频对真实结果的近似,不是可证明正确的物理模拟器。

来源核对

读完后自测

  1. 为什么只有大量视频、没有动作代理时,模型仍可能“不听指挥”?
  2. 潜在动作模型为什么同时需要“还原后一帧”和“限制便签容量”?
  3. 人类视频预训练与机器人后训练分别负责什么?
  4. 学生为什么要在训练时接着自己的输出继续生成?
  5. 10.81 FPS 相比老师换来了什么,又牺牲了什么?
  6. r=0.995r=0.995 能支持“排序很一致”,为什么不能支持“模拟绝对准确”?

关于这篇论文的三个关键问题

DreamDojo:从大规模人类视频学会预演机器人动作 解决了什么问题?

DreamDojo 不是直接教机器人“下一步该做什么”,而是训练一个能预演“如果这样动,接下来会看到什么”的视频世界模型。它的关键路线是:先从大量人类第一视角视频学物体互动,再用少量目标机器人数据学会机器人自己的控制方式。

DreamDojo:从大规模人类视频学会预演机器人动作 的核心结论有哪些证据?

在 50 个新背景样本的成对人评中,14B DreamDojo 相对原始 Cosmos-Predict2.5 的胜率为:物理正确性 73.50%,动作跟随 72.55%。这是目前最直观的域外证据:大规模人类视频预训练确实让模型更能处理未见环境与物体互动。论文 §4.4、表 4

阅读 DreamDojo:从大规模人类视频学会预演机器人动作 时最需要注意什么局限?

边界同样清楚:论文点名快速挥手、拍打等少见动作仍会失败;模型会低估细微失败,不原生支持多视角;人评只有 12 名志愿者,域外新背景集共 50 个样本。它展示的是有希望的泛化,不是“已经理解现实世界”。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro