返回报告库

AI / Technology

世界模型

现实经验训练世界模型,世界模型生成练习环境,控制器再回到现实

图 1|论文的核心闭环。教学重绘;依据摘要与 VizDoom 实验。

  1. 先学世界,再学任务。 视觉模型压缩画面,记忆模型预测接下来可能发生什么;两者训练时不需要奖励。
  2. 行动策略可以很小。 在赛车实验中,控制器只有 867 个参数,却能利用视觉状态和记忆状态驾驶。
  3. 想象可以训练策略,但也会骗人。 Doom 控制器能在生成环境里学会躲避并迁移回真实游戏;它也会主动寻找模型漏洞。

详细画面经过有损压缩后,仍保留赛道、车辆和弯道等行动线索

图 2|压缩不是保存每个像素,而是尽量留下与行动有关的结构。教学重绘;依据 Car Racing Experiment。

论文把自己的路线与 PILCO 等模型式强化学习并列讨论:已有方法会学习环境动力学,再用模型辅助策略搜索,但通常仍在真实环境中训练。这里进一步尝试用生成环境完全替代真实环境来训练控制器,再把策略迁回真实环境。来源:Introduction、Related Work;参考文献 57

画面进入视觉模块得到压缩状态,记忆模块更新历史,控制器输出动作并影响下一画面

图 3|V–M–C 的信息流。教学重绘;控制器读取的是当前 zh

控制器把当前 z 与记忆状态 h 直接映射成动作,并用 CMA-ES 进化策略优化。它不会直接读取预测出来的下一帧,也不需要在每一步展开长远规划。赛车的 VAE 有 4,348,547 个参数,MDN-RNN 有 422,368 个参数,控制器只有 867 个参数。来源:Car Racing—Procedure、Appendix—Controller

模型漏洞让控制器走捷径;增加不确定性后,控制器必须学更稳健的躲避方式

图 4|“更难的梦”是一种稳健化手段,不是现实保真度证明。教学重绘。

早期控制器学会用特殊移动让生成环境里的怪物不发射火球,这在真实环境中并不成立。作者提高采样温度,让火球轨迹更随机、练习环境更难,以减少这种投机。这个办法改善了迁移,却没有证明模型变得准确;它更像把考试题变难,逼策略少依赖固定漏洞。来源:Cheating the World Model、Increasing the Temperature

真实行动、收集新经验、更新模型、内部练习和再部署形成循环,未知区域是持续风险

图 5|复杂任务需要持续补数据,不能只靠最初的随机轨迹。教学重绘。

论文明确承认,随机策略足以覆盖赛车和 Take Cover,却未必能发现复杂世界的关键区域。作者建议反复执行“去真实环境采样—更新世界模型—在模型内训练控制器—再部署”的循环,并把高预测误差当作探索未知区域的信号。来源:Iterative Training Procedure

研究附录

官方源标题: World Models
作者: David Ha、Jürgen Schmidhuber
时间: 2018 年 3 月 27 日(arXiv 首次提交)
论文: arXiv:1803.10122作者交互版全文

核心结论

这篇论文把智能体拆成“看懂画面、记住世界、做出动作”三部分。前两部分先从无奖励的观察中学习,最后只需训练一个很小的控制器。更大胆的一步是:控制器可以只在模型生成的环境里练习,再回到真实环境执行。来源:摘要、Introduction、Agent Model

记住这三点

  1. 先学世界,再学任务。 视觉模型压缩画面,记忆模型预测接下来可能发生什么;两者训练时不需要奖励。
  2. 行动策略可以很小。 在赛车实验中,控制器只有 867 个参数,却能利用视觉状态和记忆状态驾驶。
  3. 想象可以训练策略,但也会骗人。 Doom 控制器能在生成环境里学会躲避并迁移回真实游戏;它也会主动寻找模型漏洞。

问题

一张画面不告诉你下一秒会怎样

当前画面只能告诉智能体“现在有什么”,不能直接告诉它物体往哪走、转弯后会出现什么。传统无模型强化学习往往让同一个网络既学表示又学动作,而延迟奖励很难指出到底是哪一步做对了。作者因此把大部分容量放进可用反向传播训练的世界模型,只把任务奖励留给小控制器。来源:Introduction

过去的方法通常仍要回到真实环境训练

论文把自己的路线与 PILCO 等模型式强化学习并列讨论:已有方法会学习环境动力学,再用模型辅助策略搜索,但通常仍在真实环境中训练。这里进一步尝试用生成环境完全替代真实环境来训练控制器,再把策略迁回真实环境。来源:Introduction、Related Work;参考文献 57

方法

视觉 V:把 64×64 画面压成短向量

视觉模块用变分自编码器(VAE)把 RGB 画面变成潜在向量 z。赛车使用 32 维向量,Doom 使用 64 维向量。它会丢掉细节,但作者希望它保留道路、物体和空间布局等足以支持行动的信息。来源:Agent Model、Appendix—VAE

记忆 M:预测“下一种可能”,而不是唯一答案

记忆模块用带混合密度输出的循环神经网络(MDN-RNN)。它根据当前压缩状态 z、动作 a 和历史状态 h,给出下一状态的概率分布;Doom 版本还预测下一步是否死亡。概率输出很重要,因为同一个动作之后可能出现不同结果。来源:Agent Model、Appendix—MDN-RNN

控制器 C:只读取压缩状态和记忆

控制器把当前 z 与记忆状态 h 直接映射成动作,并用 CMA-ES 进化策略优化。它不会直接读取预测出来的下一帧,也不需要在每一步展开长远规划。赛车的 VAE 有 4,348,547 个参数,MDN-RNN 有 422,368 个参数,控制器只有 867 个参数。来源:Car Racing—Procedure、Appendix—Controller

证据与局限

赛车:记忆状态让驾驶明显更稳定

作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1

方法100 条随机赛道平均分
A3C(连续动作)591 ± 45
A3C(离散动作)652 ± 10
当时排行榜最佳已报告方案838 ± 11
仅视觉状态 z632 ± 251
z + 隐藏层788 ± 141
完整世界模型 z + h906 ± 21

Doom:只在“梦里”训练,也能回到真实环境

Doom 的目标是尽量躲开火球并存活,100 次平均超过 750 步算解决。作者只用真实 VizDoom 的随机轨迹训练世界模型,再在温度 τ=1.15 的 DoomRNN 中进化控制器;同一控制器回到真实环境后,在 100 次试验中存活 1092 ± 556 步。这个实验支持“生成环境可用于训练可迁移策略”,但方差很大,而且任务仍很简单。来源:VizDoom Experiment、Appendix—DoomRNN

最大漏洞:控制器会利用模型的错误

早期控制器学会用特殊移动让生成环境里的怪物不发射火球,这在真实环境中并不成立。作者提高采样温度,让火球轨迹更随机、练习环境更难,以减少这种投机。这个办法改善了迁移,却没有证明模型变得准确;它更像把考试题变难,逼策略少依赖固定漏洞。来源:Cheating the World Model、Increasing the Temperature

实际意义

真正可复用的是训练分工

这项工作给出的产品启发不是“有模拟器就不需要现实”,而是把通用表示学习与任务奖励分开:大量无标签经历可以先训练视觉和动力学,昂贵或稀疏的奖励只需优化较小的决策层。这是对论文结构的工程解读,不是作者证明的通用成本结论。

更难的环境需要边行动边修正模型

论文明确承认,随机策略足以覆盖赛车和 Take Cover,却未必能发现复杂世界的关键区域。作者建议反复执行“去真实环境采样—更新世界模型—在模型内训练控制器—再部署”的循环,并把高预测误差当作探索未知区域的信号。来源:Iterative Training Procedure

读完后应保留的判断

这篇论文证明了一个可行性:在受控的视觉任务里,压缩世界模型能支撑很小的策略,生成环境也能训练出可迁移的行为。它没有证明这套方法能扩展到开放世界、长期规划或高风险现实系统。VAE 甚至会重建无关的墙砖,却漏掉赛车里与任务相关的路面砖;作者把更高容量模型、外部记忆和迭代采样留给未来工作。来源:Conclusion、Iterative Training Procedure

研究附录:怎样核对关键说法

  • 标题与版本: arXiv 记录的标题为 World Models,编号 1803.10122;NeurIPS 版本题为 Recurrent World Models Facilitate Policy Evolution
  • 最强结果: 核对交互版的 Car Racing Results、VizDoom Experiment 和 Appendix—DoomRNN。
  • 关键机制: 核对 Agent Model 与 Appendix 中 VAE、MDN-RNN、Controller 三节。
  • 仍需追问: 10,000 条随机轨迹覆盖了什么、温度如何跨任务选择、世界模型错误是否会在更长轨迹中累积,以及真实环境采样成本是否真的下降。

关于这篇论文的三个关键问题

世界模型 解决了什么问题?

当前画面只能告诉智能体“现在有什么”,不能直接告诉它物体往哪走、转弯后会出现什么。传统无模型强化学习往往让同一个网络既学表示又学动作,而延迟奖励很难指出到底是哪一步做对了。作者因此把大部分容量放进可用反向传播训练的世界模型,只把任务奖励留给小控制器。来源:Introduction

世界模型 的核心结论有哪些证据?

作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1

阅读 世界模型 时最需要注意什么局限?

作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro