返回报告库

AI / Technology

用深度强化学习玩 Atari

DQN 的交互与学习闭环

图 1|读图重点:环境交互是连续的,训练样本却被经验回放重新打散。图为教学性重绘,不是论文原图。依据:算法 1 与第 4 节,第 4–5 页。

这篇论文证明了一件当时并不显然的事:卷积神经网络可以把原始像素变成动作价值,再与 Q-learning 和经验回放结合,学出复杂游戏控制策略。 论文所称“首个”与结果范围均以作者在 2013 年稿件中的陈述为准。来源:摘要与引言,第 1–2 页

传统路线先做人工特征工程,再估计价值;本文把原始像素直接交给卷积 Q 网络。

图 2|变化不只是“网络更深”,而是把原本分开的视觉特征设计和控制学习接成一条端到端路线。依据:第 3–4 节,第 3–4 页。

当时 Atari 强化学习的主流对比方法依赖手工视觉特征,例如背景相减、把 128 种颜色分成独立通道,再配上线性价值函数。与本文最接近的 Neural Fitted Q-learning 也先用自编码器学低维表示,再做强化学习;本文则让视觉表示与动作价值端到端一起学。来源:相关工作,第 3–4 页;主评测,第 7 页

论文使用的 DQN 处理结构

图 3|网络输出的不是“下一步必胜动作”,而是每个动作未来折扣回报的估计值。依据:第 4.1 节,第 5–6 页。

原始 Atari 画面是 210×160;预处理先转灰度、缩放到 110×84,再裁成 84×84,并叠放最近 4 帧形成 84×84×4 输入。网络依次使用 16 个 8×8 卷积核(步幅 4)、32 个 4×4 卷积核(步幅 2)、256 个全连接隐藏单元,最后为每个合法动作输出一个 Q 值。这样一次前向计算就能同时比较所有动作;不同游戏的合法动作数为 4–18。来源:第 4.1 节,第 5–6 页

研究附录

原始标题: Playing Atari with Deep Reinforcement Learning
作者: Volodymyr Mnih、Koray Kavukcuoglu、David Silver、Alex Graves、Ioannis Antonoglou、Daan Wierstra、Martin Riedmiller
发表信息: 2013 年 12 月 19 日提交,NIPS Deep Learning Workshop 2013
主来源: arXiv:1312.5602 · 论文 PDF

核心结论

三句话读懂

  1. 输入变了: 智能体不再依赖人为标注物体或手工设计视觉特征,而是直接从游戏画面学习该做什么。
  2. 训练变稳了: 它把过去的交互存进“经验回放”池,再随机抽取旧经验训练,打散连续画面的强相关性,也缓和策略变化带来的数据分布漂移。
  3. 证据有力但边界清楚: 同一套核心架构在 7 款 Atari 游戏上训练,DQN 的平均分在全部 7 款游戏中高于论文列出的其他学习方法,并在 Breakout、Enduro、Pong 三款游戏上超过论文中的人类专家分数;但它仍需要 1000 万帧训练,且在需要长期规划的游戏中远落后于人类。

一句话主线

这篇论文证明了一件当时并不显然的事:卷积神经网络可以把原始像素变成动作价值,再与 Q-learning 和经验回放结合,学出复杂游戏控制策略。 论文所称“首个”与结果范围均以作者在 2013 年稿件中的陈述为准。来源:摘要与引言,第 1–2 页

问题

为什么“看屏幕学动作”很难

监督学习常拿到固定标签,而游戏智能体只收到一个可能稀疏、嘈杂、延迟很久的标量奖励;一个动作的后果甚至可能几千步后才出现。连续画面又高度相关,同时智能体行为不断改变它将看到的数据,所以训练分布也在移动。单张画面还可能无法显示速度和方向,使不同真实状态看起来相同。来源:引言与第 2 节,第 1–2 页

过去的方法卡在哪里

当时 Atari 强化学习的主流对比方法依赖手工视觉特征,例如背景相减、把 128 种颜色分成独立通道,再配上线性价值函数。与本文最接近的 Neural Fitted Q-learning 也先用自编码器学低维表示,再做强化学习;本文则让视觉表示与动作价值端到端一起学。来源:相关工作,第 3–4 页;主评测,第 7 页

方法

从四帧画面到全部动作的价值

原始 Atari 画面是 210×160;预处理先转灰度、缩放到 110×84,再裁成 84×84,并叠放最近 4 帧形成 84×84×4 输入。网络依次使用 16 个 8×8 卷积核(步幅 4)、32 个 4×4 卷积核(步幅 2)、256 个全连接隐藏单元,最后为每个合法动作输出一个 Q 值。这样一次前向计算就能同时比较所有动作;不同游戏的合法动作数为 4–18。来源:第 4.1 节,第 5–6 页

Q-learning 如何给网络出题

智能体用 ε-greedy 策略行动:多数时候选择当前 Q 值最大的动作,少数时候随机探索。每条经验记为“状态、动作、奖励、下一状态”;训练目标把即时奖励与下一状态中最大的预测 Q 值结合起来,网络通过缩小目标值与当前预测之间的平方误差来更新。通俗地说,它不断问:刚才这个动作,事后看来值不值? 来源:第 2 节公式 1–3 与算法 1,第 2–5 页

经验回放为何关键

每一步经验先进入容量有限的回放池,训练时均匀随机抽取小批量样本。这样一条经验可被重复利用,连续样本被打散,训练分布也混合了多个旧策略时期的行为。作者认为这有助于减少更新方差、抑制反馈回路和振荡;这是论文给出的机制解释,不等于理论收敛证明。来源:第 4 节与算法 1,第 4–5 页

证据与局限

七款游戏的统一测试

实验覆盖 Beam Rider、Breakout、Enduro、Pong、Q*bert、Seaquest 和 Space Invaders。训练统一使用大小为 32 的 minibatch、容量为 100 万帧的回放池和总计 1000 万帧;ε 在前 100 万帧从 1 线性降至 0.1。架构、学习算法和主要超参数保持一致,但 Space Invaders 的跳帧数从 4 改为 3,以免闪烁的激光不可见,因此“完全不调参”并非字面上的零例外。来源:实验设置,第 6 页

训练期间正奖励被裁成 +1、负奖励裁成 −1、零奖励不变,方便跨游戏共用学习率;作者也明确指出,这会让智能体无法区分不同幅度的奖励,可能影响表现。来源:第 5 节,第 6 页

结果到底有多强

下表是论文表 1 的平均总回报,评测采用 ε=0.05 的策略跑固定步数。DQN 在 7 款游戏中均高于 Sarsa 和 Contingency;相对论文的人类专家中位数,它在 Breakout、Enduro、Pong 上更高,在 Beam Rider 接近,但在 Q*bert、Seaquest、Space Invaders 上差距很大。来源:第 5.3 节与表 1,第 7–8 页

游戏SarsaContingencyDQN人类专家
Beam Rider9961,7434,0927,456
Breakout5.2616831
Enduro129159470368
Pong−19−1720−3
Q*bert6149601,95218,900
Seaquest6657231,70528,010
Space Invaders2712685813,690

这里需要谨慎读:论文摘要说“在 6 款游戏上超过此前所有方法”,主表中 DQN 则高于其中列出的 Sarsa 与 Contingency 共 7 款;两句话的比较集合并不完全相同。人类分数来自专家约两小时游戏后的中位回报,也不是“所有人类”的统一上限。来源:摘要;第 5.3 节,第 7 页

论文没有证明什么

  • 没有理论收敛保证。 作者报告 7 个实验中未遇到发散,预测 Q 值也较平滑,但明确说方法缺乏理论收敛保证。
  • 没有证明长期规划已解决。 作者把 Q*bert、Seaquest、Space Invaders 的明显差距归因于这些游戏需要跨更长时间尺度的策略。
  • 经验回放仍很粗糙。 固定容量会覆盖旧经验,均匀采样也不区分“更值得学习”的转移;作者提出更聪明的采样可能有帮助。
  • 不是现实世界泛化测试。 证据来自 Atari 模拟器中的 7 款游戏,不能直接推出机器人、自动驾驶或其他真实环境同样有效。

来源:第 4 节局限、第 5.1 节稳定性、第 5.3 节结果讨论,第 5–8 页

实际意义

真正可迁移的设计思想

这项工作的长期价值,不只是一组 Atari 分数,而是三种可以迁移到其他序列决策系统的设计:让表征围绕最终控制目标端到端学习;用回放缓冲区复用昂贵交互并打散时间相关性;让一个共享模型一次输出全部候选动作的价值。这里是对论文机制的工程解释,不是作者对所有产品场景的保证。

落地前应先问的四个问题

  1. 奖励是否真的代表目标,还是会诱导系统钻空子?
  2. 关键反馈延迟多久,四帧短历史是否足够表达状态?
  3. 采集 1000 万帧级别的交互是否安全、合规且负担得起?
  4. 离线指标、预测 Q 值与真实任务成功率是否一致?

如果这四问没有答案,复制网络结构并不会自动复制论文结果。更准确的读法是:这篇论文提供了一个有说服力的可行性证明——高维感知与强化学习可以在同一条训练链路里工作;它没有给出一套无需环境设计、数据成本或安全约束的通用智能配方。

关于这篇论文的三个关键问题

用深度强化学习玩 Atari 解决了什么问题?

监督学习常拿到固定标签,而游戏智能体只收到一个可能稀疏、嘈杂、延迟很久的标量奖励;一个动作的后果甚至可能几千步后才出现。连续画面又高度相关,同时智能体行为不断改变它将看到的数据,所以训练分布也在移动。单张画面还可能无法显示速度和方向,使不同真实状态看起来相同。来源:引言与第 2 节,第 1–2 页

用深度强化学习玩 Atari 的核心结论有哪些证据?

下表是论文表 1 的平均总回报,评测采用 ε=0.05 的策略跑固定步数。DQN 在 7 款游戏中均高于 Sarsa 和 Contingency;相对论文的人类专家中位数,它在 Breakout、Enduro、Pong 上更高,在 Beam Rider 接近,但在 Qbert、Seaquest、Space Invaders 上差距很大。来源:第 5.3 节与表 1,第 7–8 页

阅读 用深度强化学习玩 Atari 时最需要注意什么局限?

实验覆盖 Beam Rider、Breakout、Enduro、Pong、Qbert、Seaquest 和 Space Invaders。训练统一使用大小为 32 的 minibatch、容量为 100 万帧的回放池和总计 1000 万帧;ε 在前 100 万帧从 1 线性降至 0.1。架构、学习算法和主要超参数保持一致,但 Space Invaders 的跳帧数从 4 改为 3,以免闪烁的激光不可见,因此“完全不调参”并非字面上的零例外。来源:实验设置,第 6 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro