AI / Technology
世界模型
现实经验训练世界模型,世界模型生成练习环境,控制器再回到现实
图 1|论文的核心闭环。教学重绘;依据摘要与 VizDoom 实验。
- 先学世界,再学任务。 视觉模型压缩画面,记忆模型预测接下来可能发生什么;两者训练时不需要奖励。
- 行动策略可以很小。 在赛车实验中,控制器只有 867 个参数,却能利用视觉状态和记忆状态驾驶。
- 想象可以训练策略,但也会骗人。 Doom 控制器能在生成环境里学会躲避并迁移回真实游戏;它也会主动寻找模型漏洞。
详细画面经过有损压缩后,仍保留赛道、车辆和弯道等行动线索
图 2|压缩不是保存每个像素,而是尽量留下与行动有关的结构。教学重绘;依据 Car Racing Experiment。
论文把自己的路线与 PILCO 等模型式强化学习并列讨论:已有方法会学习环境动力学,再用模型辅助策略搜索,但通常仍在真实环境中训练。这里进一步尝试用生成环境完全替代真实环境来训练控制器,再把策略迁回真实环境。来源:Introduction、Related Work;参考文献 57
画面进入视觉模块得到压缩状态,记忆模块更新历史,控制器输出动作并影响下一画面
图 3|V–M–C 的信息流。教学重绘;控制器读取的是当前 z 和 h。
控制器把当前 z 与记忆状态 h 直接映射成动作,并用 CMA-ES 进化策略优化。它不会直接读取预测出来的下一帧,也不需要在每一步展开长远规划。赛车的 VAE 有 4,348,547 个参数,MDN-RNN 有 422,368 个参数,控制器只有 867 个参数。来源:Car Racing—Procedure、Appendix—Controller
模型漏洞让控制器走捷径;增加不确定性后,控制器必须学更稳健的躲避方式
图 4|“更难的梦”是一种稳健化手段,不是现实保真度证明。教学重绘。
早期控制器学会用特殊移动让生成环境里的怪物不发射火球,这在真实环境中并不成立。作者提高采样温度,让火球轨迹更随机、练习环境更难,以减少这种投机。这个办法改善了迁移,却没有证明模型变得准确;它更像把考试题变难,逼策略少依赖固定漏洞。来源:Cheating the World Model、Increasing the Temperature
真实行动、收集新经验、更新模型、内部练习和再部署形成循环,未知区域是持续风险
图 5|复杂任务需要持续补数据,不能只靠最初的随机轨迹。教学重绘。
论文明确承认,随机策略足以覆盖赛车和 Take Cover,却未必能发现复杂世界的关键区域。作者建议反复执行“去真实环境采样—更新世界模型—在模型内训练控制器—再部署”的循环,并把高预测误差当作探索未知区域的信号。来源:Iterative Training Procedure
研究附录
官方源标题: World Models
作者: David Ha、Jürgen Schmidhuber
时间: 2018 年 3 月 27 日(arXiv 首次提交)
论文: arXiv:1803.10122 | 作者交互版全文
核心结论
这篇论文把智能体拆成“看懂画面、记住世界、做出动作”三部分。前两部分先从无奖励的观察中学习,最后只需训练一个很小的控制器。更大胆的一步是:控制器可以只在模型生成的环境里练习,再回到真实环境执行。来源:摘要、Introduction、Agent Model
记住这三点
- 先学世界,再学任务。 视觉模型压缩画面,记忆模型预测接下来可能发生什么;两者训练时不需要奖励。
- 行动策略可以很小。 在赛车实验中,控制器只有 867 个参数,却能利用视觉状态和记忆状态驾驶。
- 想象可以训练策略,但也会骗人。 Doom 控制器能在生成环境里学会躲避并迁移回真实游戏;它也会主动寻找模型漏洞。
问题
一张画面不告诉你下一秒会怎样
当前画面只能告诉智能体“现在有什么”,不能直接告诉它物体往哪走、转弯后会出现什么。传统无模型强化学习往往让同一个网络既学表示又学动作,而延迟奖励很难指出到底是哪一步做对了。作者因此把大部分容量放进可用反向传播训练的世界模型,只把任务奖励留给小控制器。来源:Introduction
过去的方法通常仍要回到真实环境训练
论文把自己的路线与 PILCO 等模型式强化学习并列讨论:已有方法会学习环境动力学,再用模型辅助策略搜索,但通常仍在真实环境中训练。这里进一步尝试用生成环境完全替代真实环境来训练控制器,再把策略迁回真实环境。来源:Introduction、Related Work;参考文献 57
方法
视觉 V:把 64×64 画面压成短向量
视觉模块用变分自编码器(VAE)把 RGB 画面变成潜在向量 z。赛车使用 32 维向量,Doom 使用 64 维向量。它会丢掉细节,但作者希望它保留道路、物体和空间布局等足以支持行动的信息。来源:Agent Model、Appendix—VAE
记忆 M:预测“下一种可能”,而不是唯一答案
记忆模块用带混合密度输出的循环神经网络(MDN-RNN)。它根据当前压缩状态 z、动作 a 和历史状态 h,给出下一状态的概率分布;Doom 版本还预测下一步是否死亡。概率输出很重要,因为同一个动作之后可能出现不同结果。来源:Agent Model、Appendix—MDN-RNN
控制器 C:只读取压缩状态和记忆
控制器把当前 z 与记忆状态 h 直接映射成动作,并用 CMA-ES 进化策略优化。它不会直接读取预测出来的下一帧,也不需要在每一步展开长远规划。赛车的 VAE 有 4,348,547 个参数,MDN-RNN 有 422,368 个参数,控制器只有 867 个参数。来源:Car Racing—Procedure、Appendix—Controller
证据与局限
赛车:记忆状态让驾驶明显更稳定
作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1
| 方法 | 100 条随机赛道平均分 |
|---|---|
| A3C(连续动作) | 591 ± 45 |
| A3C(离散动作) | 652 ± 10 |
| 当时排行榜最佳已报告方案 | 838 ± 11 |
仅视觉状态 z | 632 ± 251 |
z + 隐藏层 | 788 ± 141 |
完整世界模型 z + h | 906 ± 21 |
Doom:只在“梦里”训练,也能回到真实环境
Doom 的目标是尽量躲开火球并存活,100 次平均超过 750 步算解决。作者只用真实 VizDoom 的随机轨迹训练世界模型,再在温度 τ=1.15 的 DoomRNN 中进化控制器;同一控制器回到真实环境后,在 100 次试验中存活 1092 ± 556 步。这个实验支持“生成环境可用于训练可迁移策略”,但方差很大,而且任务仍很简单。来源:VizDoom Experiment、Appendix—DoomRNN
最大漏洞:控制器会利用模型的错误
早期控制器学会用特殊移动让生成环境里的怪物不发射火球,这在真实环境中并不成立。作者提高采样温度,让火球轨迹更随机、练习环境更难,以减少这种投机。这个办法改善了迁移,却没有证明模型变得准确;它更像把考试题变难,逼策略少依赖固定漏洞。来源:Cheating the World Model、Increasing the Temperature
实际意义
真正可复用的是训练分工
这项工作给出的产品启发不是“有模拟器就不需要现实”,而是把通用表示学习与任务奖励分开:大量无标签经历可以先训练视觉和动力学,昂贵或稀疏的奖励只需优化较小的决策层。这是对论文结构的工程解读,不是作者证明的通用成本结论。
更难的环境需要边行动边修正模型
论文明确承认,随机策略足以覆盖赛车和 Take Cover,却未必能发现复杂世界的关键区域。作者建议反复执行“去真实环境采样—更新世界模型—在模型内训练控制器—再部署”的循环,并把高预测误差当作探索未知区域的信号。来源:Iterative Training Procedure
读完后应保留的判断
这篇论文证明了一个可行性:在受控的视觉任务里,压缩世界模型能支撑很小的策略,生成环境也能训练出可迁移的行为。它没有证明这套方法能扩展到开放世界、长期规划或高风险现实系统。VAE 甚至会重建无关的墙砖,却漏掉赛车里与任务相关的路面砖;作者把更高容量模型、外部记忆和迭代采样留给未来工作。来源:Conclusion、Iterative Training Procedure
研究附录:怎样核对关键说法
- 标题与版本: arXiv 记录的标题为 World Models,编号 1803.10122;NeurIPS 版本题为 Recurrent World Models Facilitate Policy Evolution。
- 最强结果: 核对交互版的 Car Racing Results、VizDoom Experiment 和 Appendix—DoomRNN。
- 关键机制: 核对 Agent Model 与 Appendix 中 VAE、MDN-RNN、Controller 三节。
- 仍需追问: 10,000 条随机轨迹覆盖了什么、温度如何跨任务选择、世界模型错误是否会在更长轨迹中累积,以及真实环境采样成本是否真的下降。
关于这篇论文的三个关键问题
世界模型 解决了什么问题?
当前画面只能告诉智能体“现在有什么”,不能直接告诉它物体往哪走、转弯后会出现什么。传统无模型强化学习往往让同一个网络既学表示又学动作,而延迟奖励很难指出到底是哪一步做对了。作者因此把大部分容量放进可用反向传播训练的世界模型,只把任务奖励留给小控制器。来源:Introduction
世界模型 的核心结论有哪些证据?
作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1
阅读 世界模型 时最需要注意什么局限?
作者先用随机策略收集 10,000 条轨迹,再分别训练 V 和 M,最后进化 C。完整模型在 100 条随机赛道上得到 906 ± 21,超过任务规定的 900 分解决线;只给控制器 z 时为 632 ± 251,加入一个隐藏层后为 788 ± 141。这是论文最直接的消融证据:记忆状态 h 与更高、更稳定的表现同时出现。来源:Car Racing Experiment Results;Table 1