Robotics / NVIDIA
DreamDojo从大规模人类视频学会预演机器人动作
官方英文标题: DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
论文: arXiv:2602.06949 · 发表状态: ICML 2026 Spotlight
DreamDojo 不是直接教机器人“下一步该做什么”,而是训练一个能预演“如果这样动,接下来会看到什么”的视频世界模型。它的关键路线是:先从大量人类第一视角视频学物体互动,再用少量目标机器人数据学会机器人自己的控制方式。
先把 44,711 小时生活经验装进模型
先看规模,也看来源:最终混合数据共 44,711 小时,其中 DreamDojo-HV 占 43,827 小时,EgoDex 占 829 小时,实验室采集占 55 小时。它覆盖家居、工业、零售、教育等场景,让模型见过的物体互动远多于单一机器人数据集。论文 §3.2、表 1
但“看得多”不等于“会被动作控制”。这些视频大多没有逐帧的关节动作标签;而且论文中的技能数由语言标注估算,不能当作人工逐条核验的精确类别数。
没有动作标签,就从相邻画面里压出“发生了什么动作”
想象两帧画面:第一帧里手在杯子旁,第二帧里杯子被拿起。潜在动作模型把这两帧压成一个短向量 ,只保留解释变化所需的信息;再让解码器用“前一帧 + 这个向量”重建后一帧。于是不同的人、机器人和背景可以共享“拿起”“推开”这类变化线索,原本无标签的视频就有了统一的代理动作。论文 §3.3.2、图 3
这里学到的是画面变化的紧凑编码,不是人类可直接读取的动作名称。相机移动、遮挡和环境变化仍可能混进这个编码;跨身体迁移是实验支持的能力,不是保证每个向量都只表示纯动作。
人类经验要经过机器人“小课”,才能变成关节控制
预训练先教模型广泛的物体互动,后训练再教它“这台机器人怎样动”。研究者重置动作输入层,用目标机器人的连续动作重新连接模型,并更新全部权重。动作改写成相对位移,每 4 个连续动作只送给对应的视频潜帧,减少模型把未来动作偷用到当前预测里的因果混乱。论文 §3.3.1、§3.3.3
这一步仍需要目标机器人数据和大量算力:默认后训练使用 128 张 H100、训练 50,000 步。论文展示了在有限场景数据之后迁移到新物体和新环境,但没有证明任何新机器人都能零成本接入。
把慢老师蒸馏成会连续直播的快学生
原模型像一位反复修改整段视频的老师:每次要去噪 35 步,只看一个条件帧,速度是 2.72 FPS。学生改成只向前看的因果注意力,去噪缩到 4 步,并在训练时接着自己刚生成的画面继续预测。这样训练时遇到的输入,更接近真正运行时会遇到的输入。论文 §3.3.4、§4.6
结果是 10.81 FPS,接近 4 倍提速,还能利用 12 帧上下文;代价是长时视频指标下降,例如 PSNR 从 14.086 降到 13.146。实时不是“无损加速”,而是速度、画质与稳定性的交换。
预演不是终点:它要帮机器人筛动作
规划时,策略先提出多个候选动作;DreamDojo 批量生成各自的未来视频;外部价值模型挑出最接近子任务完成的一个,再交给真实机器人执行。另一项水果装袋实验中,模拟成功率与真实成功率的线性相关达到 Pearson ,排序误差 MMRV 为 0.003。论文 §4.7、图 5
这些证据说明它在该任务与 20 个场景里很会“排顺序”,不代表模拟成功率本身完全准确。论文明确说,DreamDojo 往往比现实更乐观;规划增益也来自特定策略组,不能直接外推到所有机器人任务。
泛化变强了,但罕见动作和真实失败仍是盲区
在 50 个新背景样本的成对人评中,14B DreamDojo 相对原始 Cosmos-Predict2.5 的胜率为:物理正确性 73.50%,动作跟随 72.55%。这是目前最直观的域外证据:大规模人类视频预训练确实让模型更能处理未见环境与物体互动。论文 §4.4、表 4
边界同样清楚:论文点名快速挥手、拍打等少见动作仍会失败;模型会低估细微失败,不原生支持多视角;人评只有 12 名志愿者,域外新背景集共 50 个样本。它展示的是有希望的泛化,不是“已经理解现实世界”。
研究附录
一句话训练循环
- 用 In-lab、EgoDex、DreamDojo-HV 的第一视角人类视频做预训练。
- 从相邻帧自监督提取 32 维连续潜在动作,把无标签视频变成“画面 + 代理动作”训练对。
- 在 Cosmos-Predict2.5 视频扩散模型上学习动作条件下的未来帧。
- 换到目标机器人数据,重置动作输入层并全量微调,让模型接收真实连续动作。
- 把双向、35 步的老师蒸馏成因果、4 步的学生;学生用自己的历史输出继续滚动。
- 用生成的未来做遥操作预览、策略评估或候选动作筛选。
核心数字账本
| 证据 | 精确值 | 该怎么读 | 来源 |
|---|---|---|---|
| In-lab | 55 小时;13.9k 轨迹 | 有精确手部追踪的实验室数据 | §3.2,表 1 |
| EgoDex | 829 小时;30k 轨迹 | Apple Vision Pro 记录的带手部姿态数据 | §3.2,表 1 |
| DreamDojo-HV | 43,827 小时;1,135k 轨迹 | 众包第一视角生活视频主体 | §3.2,表 1 |
| 最终人类视频混合 | 44,711 小时;1,179k 轨迹 | 三者之和;正文简称 44k 小时 | §3.2,表 1 |
| 世界模型 | 2B 与 14B 两档 | 从 Cosmos-Predict2.5 初始化 | §4.1 |
| 预训练 | 256 张 H100,140k 步 | 有效批量 1024 | §4.1 |
| 默认后训练 | 128 张 H100,50k 步 | 全权重更新 | §4.1 |
| 蒸馏 | 64 张 H100 | 10k 预热迭代 + 3k 蒸馏迭代 | §4.1 |
| 老师 → 学生 | 2.72 → 10.81 FPS | H100 单卡长时评测 | §4.6,表 6 |
| 14B 对基础模型的人评胜率 | 73.50% / 72.55% | 物理正确性 / 动作跟随 | §4.4,表 4 |
两个真正需要的数学问题
问题一:模型怎样把两帧之间的变化压成“代理动作”?
输入是相邻两帧 。编码器 生成潜在动作 ;解码器 接收前一帧和 ,尝试还原后一帧。第一项奖励重建得像,第二项用 约束编码不要随意塞进无限信息; 决定约束力度。
可以把它想成写一张很短的“找不同”便签。便签若只能写几个字,就更可能写“杯子向上移动”,而不是复制整张第二帧。若 太小,便签可能偷藏背景细节,跨场景迁移会变差;若太大,便签容量不够,动作也会丢失。论文用 ,潜在动作维度为 32。公式中的第一项按常见 VAE 写法是最大化目标;实现时通常取其负号作为要最小化的损失。
问题二:为什么蒸馏学生要看自己生成的历史?
输入是老师与学生对未来视频的概率分布; 衡量两种分布有多不一致;输出是一个差距。差距越小,学生给各种未来分配的相对可能性越接近老师。它不是逐像素抄答案,而是在整体分布上靠近老师。
关键不只在公式,还在喂给学生的上下文。若训练时学生总看老师的完美上一帧,运行时一旦看到自己的小错误,就会进入陌生状态。DreamDojo 让学生在蒸馏阶段接着自己的输出滚动,再用老师纠偏。就像练习口述故事时,不是每句话都拿标准稿重新开头,而是从自己上一句继续说;这样才能练到错误如何累积。论文还让学生生成比老师训练窗口更长的片段,再随机选窗口监督,以增加长时滚动的耐受力。
为什么主文没有展示更多公式
论文还使用流匹配损失、时间一致性损失、热身回归损失和可计算的蒸馏梯度。它们影响训练细节,但不是理解“人类视频 → 代理动作 → 机器人适配 → 实时学生”的必要门槛。时间一致性损失的核心作用,是让相邻预测帧之间的变化贴近真实视频的变化;实验权重为 。完整公式见论文式 (2)、(4)–(8)。
评测怎么做,结论能走多远
自动指标使用 PSNR、SSIM(越高越好)和 LPIPS(越低越好)。未蒸馏模型通常生成 49 帧、100 个样本;长时蒸馏评测生成 600 帧,即 1 分钟。域外人评由 12 名志愿者比较物理正确性与动作跟随,两个新背景集合各 25 个样本。
最强的因果证据来自消融:在 Counterfactual Eval 上,从基础结构到加入相对动作、分块动作和时间一致性损失后,PSNR 从 19.448 升到 20.980,LPIPS 从 0.211 降到 0.189。数据混合消融也显示,加入更多人类数据后,多数指标改善,但并非每个数据集的每项指标都单调变好。
与前人工作的明确关系
- DreamDojo 继承 Cosmos-Predict2.5 作为视频扩散世界模型的初始化骨架。
- 它 采用并扩展 AdaWorld 的连续潜在动作思路,把它用到 44,711 小时、跨身体的人类视频预训练。
- 它 采用 Self Forcing 的训练—推理对齐范式,增加更长学生滚动与随机窗口监督,得到实时自回归学生。
- 论文还把 WorldEval / SIMPLER 的相关性与排序评测用于策略评估,但没有声称替代真实机器人测试。
术语
| 词 | 本文里的意思 |
|---|---|
| 世界模型 | 给定当前画面与动作,生成接下来可能出现的视频 |
| 第一视角视频 | 摄像头随人的头部或身体移动,看到操作者所见 |
| 潜在动作 | 从相邻画面变化压缩出的短向量,不是人工动作名称 |
| 后训练 | 用目标机器人自己的数据把预训练模型接到真实动作空间 |
| 蒸馏 | 让更快的学生模仿较慢老师的生成分布 |
| 自回归 | 每次生成一小段,并把自己的历史输出作为下一次输入 |
| 域外(OOD) | 评测对象、动作或背景不在机器人训练数据的常见分布里 |
| Pearson | 两组数是否近似按直线一起升降;接近 1 表示线性排序趋势很一致 |
不确定性与限制
- 论文称数据混合包含至少 6,015 个技能;该数字由 GPT 根据全局语言标注估算。
- 表 1 的“场景”口径在不同数据集间未必完全一致;正文另报 9,869 个 unique scenes,与表中逐视频统计口径不同。
- 策略评估的 来自一个水果装袋任务、20 个场景和若干策略检查点;样本范围较窄。
- 模型对罕见快速动作、细微失败、多视角状态仍不可靠。
- 训练算力很高,论文没有提供完整能耗、数据采集成本或复现总成本。
- 论文展示的是生成视频对真实结果的近似,不是可证明正确的物理模拟器。
来源核对
读完后自测
- 为什么只有大量视频、没有动作代理时,模型仍可能“不听指挥”?
- 潜在动作模型为什么同时需要“还原后一帧”和“限制便签容量”?
- 人类视频预训练与机器人后训练分别负责什么?
- 学生为什么要在训练时接着自己的输出继续生成?
- 10.81 FPS 相比老师换来了什么,又牺牲了什么?
- 能支持“排序很一致”,为什么不能支持“模拟绝对准确”?
关于这篇论文的三个关键问题
DreamDojo:从大规模人类视频学会预演机器人动作 解决了什么问题?
DreamDojo 不是直接教机器人“下一步该做什么”,而是训练一个能预演“如果这样动,接下来会看到什么”的视频世界模型。它的关键路线是:先从大量人类第一视角视频学物体互动,再用少量目标机器人数据学会机器人自己的控制方式。
DreamDojo:从大规模人类视频学会预演机器人动作 的核心结论有哪些证据?
在 50 个新背景样本的成对人评中,14B DreamDojo 相对原始 Cosmos-Predict2.5 的胜率为:物理正确性 73.50%,动作跟随 72.55%。这是目前最直观的域外证据:大规模人类视频预训练确实让模型更能处理未见环境与物体互动。论文 §4.4、表 4
阅读 DreamDojo:从大规模人类视频学会预演机器人动作 时最需要注意什么局限?
边界同样清楚:论文点名快速挥手、拍打等少见动作仍会失败;模型会低估细微失败,不原生支持多视角;人评只有 12 名志愿者,域外新背景集共 50 个样本。它展示的是有希望的泛化,不是“已经理解现实世界”。