Robotics / NVIDIA
DreamGen视频世界模型如何批量“梦出”机器人训练轨迹
官方标题: DreamGen: Unlocking Generalization in Robot Learning through Video World Models
作者: Joel Jang 等 · 发表: CoRL 2025(第 9 届机器人学习大会)· 论文: arXiv:2505.12705 · 会议论文集
教机器人学一个新动作,通常要人反复遥控示范。DreamGen 换了一个扩充数据的入口:先让视频模型生成“机器人可能怎样完成任务”的画面,再把画面补成带动作标签的训练轨迹。下面六幅图沿着这条证据链往前走。
真实起点很窄:一个房间里只练抓取和放置
先看起点,而不是被“22 个新行为”带走注意力。泛化实验用的是 Fourier GR1 人形机器人在一个实验室环境 里的 2,884 条抓取—放置轨迹;数据包含多种抓放动作,但没有“倒水、熨衣、开微波炉”这些新动词。它一方面让视频模型认识这台机器怎么动,另一方面训练后面负责还原动作的模型。(论文 §3.2)
这里的“小”是相对于目标范围:2,884 条并不是零数据。DreamGen 也没有证明一台从未采过真实动作的全新机器人可以直接学会这些任务;作者把“目标机器人零真实动作数据”明确留作开放问题。(论文 §3.1、§3.2)
视频模型先学会“这台机器人应该怎么动”
视频模型原本从大量普通视频里学过物体与动作。DreamGen 用目标机器人的真实轨迹做 LoRA 微调,让它补上这台机器的外形、关节运动和物理约束;随后输入一张起始画面和一句任务指令,它就逐帧生成后续。新房间只需拍首帧,新行为则由研究者手写指令。(论文 §2.1–2.2)
生成结果是“看起来会做”的视频,不是可直接执行的控制程序。首帧仍需人工拍摄,视频是否真的守住接触、受力和关节限制也不是天然保证;这些问题后来由基准测试筛查,而不是在生成阶段被彻底解决。(论文 §2.2、§4、§7)
只有画面还不够:两帧之间必须补上动作
真实示范像“带按键记录的录像”,生成视频却只有画面。DreamGen 主要用逆动力学模型(IDM)补标签:给它当前帧和稍后的帧,让它猜出中间那段机器人动作;滑动窗口不断向前,就得到整段伪动作。另一条路线 LAPA 不还原具体关节命令,而把两帧的视觉变化压成“潜在动作”。(论文 §2.3、附录 A)
这一步回答的是“从 A 画面变到 B 画面,机器人大概做了什么”,并不证明猜出的动作唯一或完全正确。IDM 仍要用这台机器的真实视频—动作对训练;潜在动作不需要目标机器人的真实动作标签,但论文主要实验最终默认采用 IDM。(论文 §2.3、§3.1)
视频与伪动作合在一起,才成为“神经轨迹”
一条神经轨迹由画面、语言指令和伪动作组成。策略看到时刻 的图像 与指令 ,学习输出接下来一小段动作 。这里 是一次预测覆盖的步数;输出可以是 IDM 动作,也可以是潜在动作。(论文 §2.4)
把它想成学开车时同时看前方画面和目的地,再决定接下来几秒怎么打方向:输入是“眼前所见 + 要做什么”,操作是把大量例子中相似的情境对齐,输出是一串近期动作。 变大时,模型一次规划得更远,但也要同时猜准更多步;论文没有把某个 宣称为通用最优值。DreamGen 可与真实轨迹 1:1 混合训练,也能在泛化实验里只用神经轨迹训练策略;它不绑定单一策略架构。(论文 §2.4)
生成轨迹把新行为从 11.2% 推到 43.2%
最值得看的不是案例视频,而是平均结果:在熟悉房间的 14 个新行为上,只有抓放数据的 GR00T N1 得 11.2%,加入 DreamGen 后是 43.2%;在 13 个新环境任务上,基线为 0%,DreamGen 为 28.5%。这些策略只用神经轨迹学习新行为;每项任务评估 10 次,并随机化目标物体初始位置。(论文表 1、附录 I.1)
“成功率”里允许部分得分,例如倒水任务只拿起瓶子可得 0.5,所以 43.2% 不是“43.2% 的尝试完整成功”。论文正文还称共有 22 个新行为,表 1 则把主要汇总拆成 14 个熟悉环境新行为和 13 个新环境任务;图中只画表 1 可直接核对的两个平均值。(论文 §3.2、表 1、附录表 8)
更好的视频往往带来更好的策略,但代价仍然很重
DreamGen Bench 分别检查视频是否听从指令、是否符合机器人结构与物理;论文在 4 个视频模型的零样本与微调版本上测试,并用每个模型生成的 7,000 条轨迹训练 RoboCasa 策略。作者观察到基准分数与下游策略表现正相关,因此它可作为“不先上真机器人”的低成本筛选器;但论文没有报告这里的相关系数,也没有证明相关就是因果。(论文 §4、表 2、图 6)
真正的规模账单不能省略:生成 24 万条 RoboCasa 样本用了 1,500 张 NVIDIA L40 GPU,耗时 54 小时。任务也仍较短,只覆盖机器人运动能力的一小部分;更复杂的灵巧控制、自动生成首帧,以及目标机器人完全没有真实动作数据时能否工作,都没有被解决。(论文 §7)
研究附录
方法流程与证据账本
| 环节 | 输入 | 处理 | 输出 | 主要证据与边界 |
|---|---|---|---|---|
| 机器人适配 | 真实遥操作视频、语言 | 视频模型 LoRA 微调 | 适配目标形态的视频模型 | §2.1;不同模型与数据对需要不同微调量 |
| 视频展开 | 首帧、任务指令 | 图生视频 rollout | 合成机器人视频 | §2.2;新环境仍需人工拍首帧 |
| 动作恢复 | 相邻/间隔画面 | IDM 或 LAPA | 伪动作序列 | §2.3;IDM 依赖真实动作标签,LAPA 可不依赖目标形态动作标签 |
| 策略训练 | 图像、指令、伪动作 | 模仿学习 | 视觉—动作策略 | §2.4;支持 Diffusion Policy、π₀、GR00T N1 |
| 泛化评估 | 新动词或新环境 | 每任务 10 次 rollout | 分级任务得分 | 表 1、附录 I.1;部分完成可得部分分 |
必要公式:策略到底学什么
论文用一句紧凑记号描述策略训练:
它回答的问题是:机器人此刻看到一张图,又收到一句任务要求,接下来一小段时间该怎么动? 是时刻 的相机画面, 是任务指令, 上方的帽子表示“模型预测”, 表示从现在到未来 步。模型把前两项送入视觉—语言策略,输出一个动作块,而不是只输出一个瞬间动作。动作块能减少每一帧都重新决策的负担,也能表达连续动作;跨度过长则会累积更多预测不确定性。论文没有把损失函数推导作为贡献核心,因此此处不展开流匹配、VQ-VAE 或扩散策略的非必要推导。
精确结果
| 设置 | 基线 | 加 DreamGen | 绝对变化 |
|---|---|---|---|
| 熟悉环境、14 个新行为 | 11.2% | 43.2% | +32.0 个百分点 |
| 13 个新环境任务 | 0.0% | 28.5% | +28.5 个百分点 |
| 4 个 GR1 真实任务平均 | 37.0% | 46.4% | +9.4 个百分点 |
| 3 个 Franka 真实任务平均 | 23.0% | 37.0% | +14.0 个百分点 |
| 2 个 SO-100 真实任务平均 | 21.0% | 45.5% | +24.5 个百分点 |
前两类泛化数字来自论文表 1 与 §3.2;跨机器人数据增强数字来自 §1、§3.1。后者每任务只用 10–13 条真实轨迹进入低数据设置,但合成轨迹数量随平台不同。
DreamGen Bench 怎么计分
“指令遵循”把生成视频交给视觉语言模型判断是否完成指定任务,输出 0 或 1;作者另做人工核验,并报告模型判断与人工判断的平均 Pearson 相关超过 90%。“物理一致”先追踪机器人关键点,再比较骨架比例是否稳定,目的是抓出手臂忽长忽短或结构破坏等问题。表 2 覆盖 HunyuanVideo、CogVideoX、WAN 2.1、Cosmos 的零样本与微调版本,以及 RoboCasa 和 GR1 两套设置。(论文 §4、附录 H)
术语
- 视频世界模型:根据首帧与文字生成后续画面的模型;“世界”表示它试图学会变化规律,不保证内部物理完全正确。
- 机器人形态(embodiment):机器人的身体配置,例如人形双臂、Franka 单臂或低成本 SO-100。
- 逆动力学模型(IDM):从变化前后的画面反推中间动作。
- 潜在动作:不直接对应关节角度,而是编码画面变化的连续向量。
- 神经轨迹:视频世界模型生成的画面,加上恢复出的伪动作。
- 视觉运动策略:从视觉观察与任务条件直接预测机器人动作的模型。
与前序工作的明确关系
DreamGen 采用 WAN 2.1 等视频模型作为生成底座,默认多数实验使用 WAN 2.1;采用 LAPA 作为潜在动作路线;采用 GR00T N1、π₀ 与 Diffusion Policy 验证生成数据不依赖单一策略,其中泛化实验以 GR00T N1 为底座。论文也明确对比以往把视频模型当实时规划器的做法:DreamGen 把生成和策略执行分开,离线批量造训练数据。(论文 §1–2、§5、参考文献 [2]、[5]、[9]、[13]、[24])
不能从论文推出什么
- 不能推出合成视频等价于真实机器人经验;动作标签是模型推断值。
- 不能推出 43.2% 是完整任务成功率;评估允许部分得分。
- 不能推出 Benchmark 与策略表现存在已量化的强因果关系;论文只展示正相关,未在正文报告相关系数。
- 不能推出方法已覆盖长时程、精密接触或全身控制;作者称任务相对简单。
- 不能推出成本已经低于遥操作;论文给出巨大算力开销,但没有完整成本对照。
来源定位
- 主来源:arXiv HTML v2,标题与版本见 arXiv 元数据;方法见 §2;实验见 §3;基准见 §4;限制见 §7;评估细则见附录 I。
- 发表状态:PMLR 305, CoRL 2025,页 5170–5194。
- 数字均取自论文正文、表 1、表 2 与附录;正文 2,884/2,885 的一条差异按原文保留为不确定性,本报告叙事采用 §3.2 首次给出的 2,884。
自测问题
- 为什么生成一段看起来正确的视频,还不能直接控制机器人?
- IDM 需要哪两类输入,它输出什么?
- 11.2% 到 43.2% 证明了什么,又没有证明什么?
- 为什么 DreamGen Bench 可以减少真机筛选成本,却不能替代真机评估?
- 如果换一台从未收集过动作数据的新机器人,论文中哪一步会首先缺少依据?
关于这篇论文的三个关键问题
DreamGen:视频世界模型如何批量“梦出”机器人训练轨迹 解决了什么问题?
教机器人学一个新动作,通常要人反复遥控示范。DreamGen 换了一个扩充数据的入口:先让视频模型生成“机器人可能怎样完成任务”的画面,再把画面补成带动作标签的训练轨迹。下面六幅图沿着这条证据链往前走。
DreamGen:视频世界模型如何批量“梦出”机器人训练轨迹 的核心结论有哪些证据?
“成功率”里允许部分得分,例如倒水任务只拿起瓶子可得 0.5,所以 43.2% 不是“43.2% 的尝试完整成功”。论文正文还称共有 22 个新行为,表 1 则把主要汇总拆成 14 个熟悉环境新行为和 13 个新环境任务;图中只画表 1 可直接核对的两个平均值。
阅读 DreamGen:视频世界模型如何批量“梦出”机器人训练轨迹 时最需要注意什么局限?
生成结果是“看起来会做”的视频,不是可直接执行的控制程序。首帧仍需人工拍摄,视频是否真的守住接触、受力和关节限制也不是天然保证;这些问题后来由基准测试筛查,而不是在生成阶段被彻底解决。