返回报告库

AI / Technology

用离散世界模型掌握 Atari

关于这篇论文的三个关键问题

用离散世界模型掌握 Atari 解决了什么问题?

直接预测未来画面很昂贵,也容易让误差一步步放大。更麻烦的是,画面里的大量像素对动作并不重要,模型却仍要花容量重建它们。潜空间世界模型的思路,是把画面压成较小的内部状态,只预测行动真正需要的变化;这样既能减少预测负担,也能在一张 GPU 上同时展开很多轨迹。论文 §1、§2.1

用离散世界模型掌握 Atari 的核心结论有哪些证据?

实验采用 55 个 Atari 游戏、粘滞动作、动作重复 4、每局最多 108,000 步、单任务训练和单环境实例。论文把预算写作 2 亿环境步或帧;动作重复后,智能体实际接收 5000 万次画面输入。训练期间,世界模型又提供了 4680 亿个想象状态,约为真实输入数的 10,000 倍。论文 §3,实验设置

阅读 用离散世界模型掌握 Atari 时最需要注意什么局限?

图 6|三条边界:55 个游戏分别训练;单个 2 亿步实验用一张 V100 不到 10 天;重建目标可能忽略仅占一个像素的关键物体。依据论文 §3、§3.1 与附录 C。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro