返回报告库

AI / Technology

用扩散模型构建世界模型Atari 中的视觉细节很重要

关于这篇论文的三个关键问题

用扩散模型构建世界模型:Atari 中的视觉细节很重要 解决了什么问题?

智能体不直接看真实状态,只看图像。若模型把橙色敌人生成成红色奖励,智能体收到的训练信号就反了:本该避开的东西变成了追逐目标。砖块、分数或路面上的小奖励点跨帧闪烁,也会让智能体误判一次动作造成了什么结果。论文在 Asterix、Breakout 和 Road Runner 的逐帧对比中报告了这类差异。[来源:第 1、5.3 节;图 5]

用扩散模型构建世界模型:Atari 中的视觉细节很重要 的核心结论有哪些证据?

Atari 100k 包含 26 个游戏,每个游戏只允许 10 万次真实环境动作,约等于 2 小时人类游戏经验。DIAMOND 每个游戏训练 5 个随机种子,平均人类归一化分数为 1.459,四分位均值(IQM)为 0.641,并在 11 个游戏上超过人类分数。对比中 STORM 的平均分为 1.266、IQM 为 0.636;DIAMOND 的优势主要体现在平均分,IQM 只略高。[来源:第 4.1、4.2 节;表 1;图 2]

阅读 用扩散模型构建世界模型:Atari 中的视觉细节很重要 时最需要注意什么局限?

主评测集中在离散控制;模型只用 4 帧堆叠提供短期记忆;奖励与终止仍由独立模型预测。附录对 CS:GO 和高速公路数据只评估静态数据上的视觉生成,没有训练强化学习智能体。因此,这篇论文不能证明 DIAMOND 已适用于连续控制、长时间因果依赖或现实机器人。[来源:第 7 节;附录 J.1]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro