返回报告库

AI / Technology

用扩散模型构建世界模型Atari 中的视觉细节很重要

离散压缩与像素扩散对细节和动作选择的影响

世界模型像一台供智能体练习的游戏机:它根据过去画面和动作,生成下一帧。以往方法常把画面压成少量离散 token,再预测 token 序列。DIAMOND 改为直接在像素空间逐步去噪,生成下一帧。这样做的重点不是让画面更好看,而是避免把敌人、奖励点、砖块和分数这些小细节预测错。论文在 Atari 100k 上得到 1.459 的平均人类归一化分数,是当时“完全在世界模型里训练智能体”的方法中最高值。[来源:摘要;第 1、4.2、5.3 节;表 1]

离散 token 与像素扩散的跨帧一致性对比

智能体不直接看真实状态,只看图像。若模型把橙色敌人生成成红色奖励,智能体收到的训练信号就反了:本该避开的东西变成了追逐目标。砖块、分数或路面上的小奖励点跨帧闪烁,也会让智能体误判一次动作造成了什么结果。论文在 Asterix、Breakout 和 Road Runner 的逐帧对比中报告了这类差异。[来源:第 1、5.3 节;图 5]

少量去噪下 DDPM 与 EDM 的长程稳定性

普通 DDPM 在高噪声起点主要学习预测噪声;论文观察到,当每帧只允许很少次网络计算时,它容易在连续生成中迅速漂移。DIAMOND 采用 EDM 的预条件与训练目标:噪声占主导时,更直接地学习恢复干净信号。Breakout 的固定数据实验显示,EDM 即使每帧只做 1 次去噪也保持稳定,而 DDPM 会累积明显误差。[来源:第 3.1、5.1 节;图 3]

DIAMOND 的数据收集、世界模型更新与想象训练闭环

扩散模型负责下一帧,另一套 CNN-LSTM 预测奖励与回合是否结束,actor-critic 网络负责选动作和估值。训练反复循环:智能体先在真实环境收集少量数据;世界模型用全部数据更新;智能体再完全进入模型生成的想象轨迹里训练。真实环境只承担数据收集,不直接承担策略训练。[来源:第 3.2 节;算法 1]

一步预测平均多种结果,多步去噪选择一种结果

如果下一帧只有一种结果,一步去噪也可能足够。若对手的动作不可见,下一帧就可能有多个合理位置;一步预测会把多种结果平均成模糊影子。多步去噪能逐渐选定其中一种清晰结果。论文因此在所有 Atari 实验中统一采用每帧 3 步,而不是只用 1 步。[来源:第 5.2 节;图 4;附录 E]

论文已验证的范围与仍待验证的问题

主评测集中在离散控制;模型只用 4 帧堆叠提供短期记忆;奖励与终止仍由独立模型预测。附录对 CS:GO 和高速公路数据只评估静态数据上的视觉生成,没有训练强化学习智能体。因此,这篇论文不能证明 DIAMOND 已适用于连续控制、长时间因果依赖或现实机器人。[来源:第 7 节;附录 J.1]

研究附录

原题: Diffusion for World Modeling: Visual Details Matter in Atari
作者: Eloi Alonso、Adam Jelley、Vincent Micheli、Anssi Kanervisto、Amos Storkey、Tim Pearce、François Fleuret
版本: arXiv:2405.12399v2,NeurIPS 2024 Spotlight
来源: arXiv 摘要 · 论文全文

核心结论

DIAMOND 把“画面够不够真”变成了智能体能不能学对

世界模型像一台供智能体练习的游戏机:它根据过去画面和动作,生成下一帧。以往方法常把画面压成少量离散 token,再预测 token 序列。DIAMOND 改为直接在像素空间逐步去噪,生成下一帧。这样做的重点不是让画面更好看,而是避免把敌人、奖励点、砖块和分数这些小细节预测错。论文在 Atari 100k 上得到 1.459 的平均人类归一化分数,是当时“完全在世界模型里训练智能体”的方法中最高值。[来源:摘要;第 1、4.2、5.3 节;表 1]

读完最值得记住三点:

  1. 视觉细节会改变动作。 几个像素就可能区分“该追的奖励”和“该躲的敌人”。
  2. 扩散模型必须为逐帧模拟重新设计。 DIAMOND 采用 EDM 训练方式,并用每帧 3 次去噪,在成本与稳定性之间折中。
  3. 结果有力,但范围有限。 主实验是 26 个 Atari 离散控制游戏;连续控制、长时记忆和复杂真实场景中的强化学习仍未验证。

问题

世界模型错的不是装饰,而是行动依据

智能体不直接看真实状态,只看图像。若模型把橙色敌人生成成红色奖励,智能体收到的训练信号就反了:本该避开的东西变成了追逐目标。砖块、分数或路面上的小奖励点跨帧闪烁,也会让智能体误判一次动作造成了什么结果。论文在 Asterix、Breakout 和 Road Runner 的逐帧对比中报告了这类差异。[来源:第 1、5.3 节;图 5]

压缩能稳住长序列,也可能删掉任务需要的信息

离散表示把图像变成紧凑 token,优点是较容易控制多步预测中的误差累积。但压缩是有损的。增加 token 数可以少丢一些信息,却会增加计算量。DIAMOND 的选择是绕开离散化,直接学习“给定过去 4 帧和动作,下一帧像素会是什么”。[来源:第 1、2.3、3.1 节;附录 E]

方法

先从噪声中还原下一帧

训练时,模型拿到真实的下一帧,给它加入不同强度的高斯噪声,再学习如何还原。生成时则反过来:从噪声开始,结合过去画面与动作,经过若干次去噪得到下一帧。生成出的帧和智能体的新动作继续作为条件,于是模型可以一帧接一帧地“做梦”。这就是扩散世界模型的自回归展开。[来源:第 2.2、2.3 节;图 1]

EDM 让少量去噪也能撑住长程展开

普通 DDPM 在高噪声起点主要学习预测噪声;论文观察到,当每帧只允许很少次网络计算时,它容易在连续生成中迅速漂移。DIAMOND 采用 EDM 的预条件与训练目标:噪声占主导时,更直接地学习恢复干净信号。Breakout 的固定数据实验显示,EDM 即使每帧只做 1 次去噪也保持稳定,而 DDPM 会累积明显误差。[来源:第 3.1、5.1 节;图 3]

三套模型分工完成训练闭环

扩散模型负责下一帧,另一套 CNN-LSTM 预测奖励与回合是否结束,actor-critic 网络负责选动作和估值。训练反复循环:智能体先在真实环境收集少量数据;世界模型用全部数据更新;智能体再完全进入模型生成的想象轨迹里训练。真实环境只承担数据收集,不直接承担策略训练。[来源:第 3.2 节;算法 1]

证据与局限

Atari 100k 的总体结果领先同类世界模型

Atari 100k 包含 26 个游戏,每个游戏只允许 10 万次真实环境动作,约等于 2 小时人类游戏经验。DIAMOND 每个游戏训练 5 个随机种子,平均人类归一化分数为 1.459,四分位均值(IQM)为 0.641,并在 11 个游戏上超过人类分数。对比中 STORM 的平均分为 1.266、IQM 为 0.636;DIAMOND 的优势主要体现在平均分,IQM 只略高。[来源:第 4.1、4.2 节;表 1;图 2]

指标DIAMONDSTORMIRISDreamerV3
平均人类归一化分数1.4591.2661.0461.097
IQM0.6410.6360.5010.497
超过人类的游戏数1110109

更好的成绩与细节一致性相关,但不是完整因果证明

作者用同一批 10 万帧专家数据对比 IRIS 与 DIAMOND。IRIS 会出现敌人与奖励互换、砖块和分数闪烁;DIAMOND 的对应轨迹没有这些问题。两者分辨率相同,DIAMOND 每帧只需 3 次网络计算,IRIS 需 16 次。因为两者的智能体组件相似,作者判断性能改善很可能来自世界模型;但这仍是机制证据与合理归因,不是把“视觉细节”单独操纵后的严格因果实验。[来源:第 5.3 节;图 5;附录 H 表 4]

一步去噪为什么有时会变模糊?

如果下一帧只有一种结果,一步去噪也可能足够。若对手的动作不可见,下一帧就可能有多个合理位置;一步预测会把多种结果平均成模糊影子。多步去噪能逐渐选定其中一种清晰结果。论文因此在所有 Atari 实验中统一采用每帧 3 步,而不是只用 1 步。[来源:第 5.2 节;图 4;附录 E]

论文明确留下三条边界

主评测集中在离散控制;模型只用 4 帧堆叠提供短期记忆;奖励与终止仍由独立模型预测。附录对 CS:GO 和高速公路数据只评估静态数据上的视觉生成,没有训练强化学习智能体。因此,这篇论文不能证明 DIAMOND 已适用于连续控制、长时间因果依赖或现实机器人。[来源:第 7 节;附录 J.1]

实际意义

世界模型的视觉保真度应按“会不会改动作”来评估

这篇论文最实用的提醒是:世界模型不应只追求看起来像真的视频,也不应只看平均像素误差。更关键的问题是,模型有没有稳定保留决定奖励、风险和状态转移的细节。对产品和研究来说,这意味着评测应加入任务敏感的跨帧一致性检查,例如物体身份是否突然改变、计分是否按动作更新、微小目标是否持续存在。这是基于论文证据的实践解读,不是作者已经完成的新基准。

计算账并没有消失,只是换了位置

DIAMOND 用 13M 参数,少于 IRIS 的 30M;单次 Atari 训练约需一张 RTX 4090 跑 2.9 天,26 个游戏、每个 5 个种子合计约 1.03 GPU 年。它每帧 3 次去噪,比 IRIS 的 16 次少,但仍慢于 DreamerV3 的训练时间。扩散世界模型不是“免费增加细节”,而是在训练目标、采样步数和视觉稳定性之间重新分配成本。[来源:第 4.1、5.3 节;附录 H 表 4]

想继续验证,先问这四个问题

  • 把扩散模型换回离散表示、保持智能体和数据不变后,哪些游戏的差距仍然存在?
  • 用物体身份、计分一致性和小目标召回率等任务指标,能否预测最终策略得分?
  • 帧堆叠换成长时序模型后,收益是否大于额外计算和误差累积?
  • 在连续控制环境中,三步去噪的延迟是否仍能支持在线决策?

术语与核验索引

  • 世界模型:学习环境如何随动作变化的生成模型,可作为智能体的模拟训练场。
  • 人类归一化分数(HNS):通常把随机策略记为 0、人类分数记为 1,便于跨游戏汇总;极端游戏仍可能拉高平均值,所以论文同时报告 IQM 和置信区间。
  • NFE:生成一帧时调用去噪网络的次数;DIAMOND 的 Atari 配置为 3。
  • 最强证据:表 1 的 26 游戏结果,以及图 5 在同数据下与 IRIS 的逐帧对比。
  • 最大不确定性:视觉细节改善与策略得分之间缺少单变量因果消融,且主结论尚未在连续控制闭环中验证。

关于这篇论文的三个关键问题

用扩散模型构建世界模型:Atari 中的视觉细节很重要 解决了什么问题?

智能体不直接看真实状态,只看图像。若模型把橙色敌人生成成红色奖励,智能体收到的训练信号就反了:本该避开的东西变成了追逐目标。砖块、分数或路面上的小奖励点跨帧闪烁,也会让智能体误判一次动作造成了什么结果。论文在 Asterix、Breakout 和 Road Runner 的逐帧对比中报告了这类差异。[来源:第 1、5.3 节;图 5]

用扩散模型构建世界模型:Atari 中的视觉细节很重要 的核心结论有哪些证据?

Atari 100k 包含 26 个游戏,每个游戏只允许 10 万次真实环境动作,约等于 2 小时人类游戏经验。DIAMOND 每个游戏训练 5 个随机种子,平均人类归一化分数为 1.459,四分位均值(IQM)为 0.641,并在 11 个游戏上超过人类分数。对比中 STORM 的平均分为 1.266、IQM 为 0.636;DIAMOND 的优势主要体现在平均分,IQM 只略高。[来源:第 4.1、4.2 节;表 1;图 2]

阅读 用扩散模型构建世界模型:Atari 中的视觉细节很重要 时最需要注意什么局限?

主评测集中在离散控制;模型只用 4 帧堆叠提供短期记忆;奖励与终止仍由独立模型预测。附录对 CS:GO 和高速公路数据只评估静态数据上的视觉生成,没有训练强化学习智能体。因此,这篇论文不能证明 DIAMOND 已适用于连续控制、长时间因果依赖或现实机器人。[来源:第 7 节;附录 J.1]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro