返回报告库

AI / Technology

用深度强化学习玩 Atari

关于这篇论文的三个关键问题

用深度强化学习玩 Atari 解决了什么问题?

监督学习常拿到固定标签,而游戏智能体只收到一个可能稀疏、嘈杂、延迟很久的标量奖励;一个动作的后果甚至可能几千步后才出现。连续画面又高度相关,同时智能体行为不断改变它将看到的数据,所以训练分布也在移动。单张画面还可能无法显示速度和方向,使不同真实状态看起来相同。来源:引言与第 2 节,第 1–2 页

用深度强化学习玩 Atari 的核心结论有哪些证据?

下表是论文表 1 的平均总回报,评测采用 ε=0.05 的策略跑固定步数。DQN 在 7 款游戏中均高于 Sarsa 和 Contingency;相对论文的人类专家中位数,它在 Breakout、Enduro、Pong 上更高,在 Beam Rider 接近,但在 Qbert、Seaquest、Space Invaders 上差距很大。来源:第 5.3 节与表 1,第 7–8 页

阅读 用深度强化学习玩 Atari 时最需要注意什么局限?

实验覆盖 Beam Rider、Breakout、Enduro、Pong、Qbert、Seaquest 和 Space Invaders。训练统一使用大小为 32 的 minibatch、容量为 100 万帧的回放池和总计 1000 万帧;ε 在前 100 万帧从 1 线性降至 0.1。架构、学习算法和主要超参数保持一致,但 Space Invaders 的跳帧数从 4 改为 3,以免闪烁的激光不可见,因此“完全不调参”并非字面上的零例外。来源:实验设置,第 6 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro