AI / Technology
用深度强化学习玩 Atari
DQN 的交互与学习闭环
图 1|读图重点:环境交互是连续的,训练样本却被经验回放重新打散。图为教学性重绘,不是论文原图。依据:算法 1 与第 4 节,第 4–5 页。
这篇论文证明了一件当时并不显然的事:卷积神经网络可以把原始像素变成动作价值,再与 Q-learning 和经验回放结合,学出复杂游戏控制策略。 论文所称“首个”与结果范围均以作者在 2013 年稿件中的陈述为准。来源:摘要与引言,第 1–2 页
传统路线先做人工特征工程,再估计价值;本文把原始像素直接交给卷积 Q 网络。
图 2|变化不只是“网络更深”,而是把原本分开的视觉特征设计和控制学习接成一条端到端路线。依据:第 3–4 节,第 3–4 页。
当时 Atari 强化学习的主流对比方法依赖手工视觉特征,例如背景相减、把 128 种颜色分成独立通道,再配上线性价值函数。与本文最接近的 Neural Fitted Q-learning 也先用自编码器学低维表示,再做强化学习;本文则让视觉表示与动作价值端到端一起学。来源:相关工作,第 3–4 页;主评测,第 7 页
论文使用的 DQN 处理结构
图 3|网络输出的不是“下一步必胜动作”,而是每个动作未来折扣回报的估计值。依据:第 4.1 节,第 5–6 页。
原始 Atari 画面是 210×160;预处理先转灰度、缩放到 110×84,再裁成 84×84,并叠放最近 4 帧形成 84×84×4 输入。网络依次使用 16 个 8×8 卷积核(步幅 4)、32 个 4×4 卷积核(步幅 2)、256 个全连接隐藏单元,最后为每个合法动作输出一个 Q 值。这样一次前向计算就能同时比较所有动作;不同游戏的合法动作数为 4–18。来源:第 4.1 节,第 5–6 页
研究附录
原始标题: Playing Atari with Deep Reinforcement Learning
作者: Volodymyr Mnih、Koray Kavukcuoglu、David Silver、Alex Graves、Ioannis Antonoglou、Daan Wierstra、Martin Riedmiller
发表信息: 2013 年 12 月 19 日提交,NIPS Deep Learning Workshop 2013
主来源: arXiv:1312.5602 · 论文 PDF
核心结论
三句话读懂
- 输入变了: 智能体不再依赖人为标注物体或手工设计视觉特征,而是直接从游戏画面学习该做什么。
- 训练变稳了: 它把过去的交互存进“经验回放”池,再随机抽取旧经验训练,打散连续画面的强相关性,也缓和策略变化带来的数据分布漂移。
- 证据有力但边界清楚: 同一套核心架构在 7 款 Atari 游戏上训练,DQN 的平均分在全部 7 款游戏中高于论文列出的其他学习方法,并在 Breakout、Enduro、Pong 三款游戏上超过论文中的人类专家分数;但它仍需要 1000 万帧训练,且在需要长期规划的游戏中远落后于人类。
一句话主线
这篇论文证明了一件当时并不显然的事:卷积神经网络可以把原始像素变成动作价值,再与 Q-learning 和经验回放结合,学出复杂游戏控制策略。 论文所称“首个”与结果范围均以作者在 2013 年稿件中的陈述为准。来源:摘要与引言,第 1–2 页
问题
为什么“看屏幕学动作”很难
监督学习常拿到固定标签,而游戏智能体只收到一个可能稀疏、嘈杂、延迟很久的标量奖励;一个动作的后果甚至可能几千步后才出现。连续画面又高度相关,同时智能体行为不断改变它将看到的数据,所以训练分布也在移动。单张画面还可能无法显示速度和方向,使不同真实状态看起来相同。来源:引言与第 2 节,第 1–2 页
过去的方法卡在哪里
当时 Atari 强化学习的主流对比方法依赖手工视觉特征,例如背景相减、把 128 种颜色分成独立通道,再配上线性价值函数。与本文最接近的 Neural Fitted Q-learning 也先用自编码器学低维表示,再做强化学习;本文则让视觉表示与动作价值端到端一起学。来源:相关工作,第 3–4 页;主评测,第 7 页
方法
从四帧画面到全部动作的价值
原始 Atari 画面是 210×160;预处理先转灰度、缩放到 110×84,再裁成 84×84,并叠放最近 4 帧形成 84×84×4 输入。网络依次使用 16 个 8×8 卷积核(步幅 4)、32 个 4×4 卷积核(步幅 2)、256 个全连接隐藏单元,最后为每个合法动作输出一个 Q 值。这样一次前向计算就能同时比较所有动作;不同游戏的合法动作数为 4–18。来源:第 4.1 节,第 5–6 页
Q-learning 如何给网络出题
智能体用 ε-greedy 策略行动:多数时候选择当前 Q 值最大的动作,少数时候随机探索。每条经验记为“状态、动作、奖励、下一状态”;训练目标把即时奖励与下一状态中最大的预测 Q 值结合起来,网络通过缩小目标值与当前预测之间的平方误差来更新。通俗地说,它不断问:刚才这个动作,事后看来值不值? 来源:第 2 节公式 1–3 与算法 1,第 2–5 页
经验回放为何关键
每一步经验先进入容量有限的回放池,训练时均匀随机抽取小批量样本。这样一条经验可被重复利用,连续样本被打散,训练分布也混合了多个旧策略时期的行为。作者认为这有助于减少更新方差、抑制反馈回路和振荡;这是论文给出的机制解释,不等于理论收敛证明。来源:第 4 节与算法 1,第 4–5 页
证据与局限
七款游戏的统一测试
实验覆盖 Beam Rider、Breakout、Enduro、Pong、Q*bert、Seaquest 和 Space Invaders。训练统一使用大小为 32 的 minibatch、容量为 100 万帧的回放池和总计 1000 万帧;ε 在前 100 万帧从 1 线性降至 0.1。架构、学习算法和主要超参数保持一致,但 Space Invaders 的跳帧数从 4 改为 3,以免闪烁的激光不可见,因此“完全不调参”并非字面上的零例外。来源:实验设置,第 6 页
训练期间正奖励被裁成 +1、负奖励裁成 −1、零奖励不变,方便跨游戏共用学习率;作者也明确指出,这会让智能体无法区分不同幅度的奖励,可能影响表现。来源:第 5 节,第 6 页
结果到底有多强
下表是论文表 1 的平均总回报,评测采用 ε=0.05 的策略跑固定步数。DQN 在 7 款游戏中均高于 Sarsa 和 Contingency;相对论文的人类专家中位数,它在 Breakout、Enduro、Pong 上更高,在 Beam Rider 接近,但在 Q*bert、Seaquest、Space Invaders 上差距很大。来源:第 5.3 节与表 1,第 7–8 页
| 游戏 | Sarsa | Contingency | DQN | 人类专家 |
|---|---|---|---|---|
| Beam Rider | 996 | 1,743 | 4,092 | 7,456 |
| Breakout | 5.2 | 6 | 168 | 31 |
| Enduro | 129 | 159 | 470 | 368 |
| Pong | −19 | −17 | 20 | −3 |
| Q*bert | 614 | 960 | 1,952 | 18,900 |
| Seaquest | 665 | 723 | 1,705 | 28,010 |
| Space Invaders | 271 | 268 | 581 | 3,690 |
这里需要谨慎读:论文摘要说“在 6 款游戏上超过此前所有方法”,主表中 DQN 则高于其中列出的 Sarsa 与 Contingency 共 7 款;两句话的比较集合并不完全相同。人类分数来自专家约两小时游戏后的中位回报,也不是“所有人类”的统一上限。来源:摘要;第 5.3 节,第 7 页
论文没有证明什么
- 没有理论收敛保证。 作者报告 7 个实验中未遇到发散,预测 Q 值也较平滑,但明确说方法缺乏理论收敛保证。
- 没有证明长期规划已解决。 作者把 Q*bert、Seaquest、Space Invaders 的明显差距归因于这些游戏需要跨更长时间尺度的策略。
- 经验回放仍很粗糙。 固定容量会覆盖旧经验,均匀采样也不区分“更值得学习”的转移;作者提出更聪明的采样可能有帮助。
- 不是现实世界泛化测试。 证据来自 Atari 模拟器中的 7 款游戏,不能直接推出机器人、自动驾驶或其他真实环境同样有效。
来源:第 4 节局限、第 5.1 节稳定性、第 5.3 节结果讨论,第 5–8 页
实际意义
真正可迁移的设计思想
这项工作的长期价值,不只是一组 Atari 分数,而是三种可以迁移到其他序列决策系统的设计:让表征围绕最终控制目标端到端学习;用回放缓冲区复用昂贵交互并打散时间相关性;让一个共享模型一次输出全部候选动作的价值。这里是对论文机制的工程解释,不是作者对所有产品场景的保证。
落地前应先问的四个问题
- 奖励是否真的代表目标,还是会诱导系统钻空子?
- 关键反馈延迟多久,四帧短历史是否足够表达状态?
- 采集 1000 万帧级别的交互是否安全、合规且负担得起?
- 离线指标、预测 Q 值与真实任务成功率是否一致?
如果这四问没有答案,复制网络结构并不会自动复制论文结果。更准确的读法是:这篇论文提供了一个有说服力的可行性证明——高维感知与强化学习可以在同一条训练链路里工作;它没有给出一套无需环境设计、数据成本或安全约束的通用智能配方。
关于这篇论文的三个关键问题
用深度强化学习玩 Atari 解决了什么问题?
监督学习常拿到固定标签,而游戏智能体只收到一个可能稀疏、嘈杂、延迟很久的标量奖励;一个动作的后果甚至可能几千步后才出现。连续画面又高度相关,同时智能体行为不断改变它将看到的数据,所以训练分布也在移动。单张画面还可能无法显示速度和方向,使不同真实状态看起来相同。来源:引言与第 2 节,第 1–2 页
用深度强化学习玩 Atari 的核心结论有哪些证据?
下表是论文表 1 的平均总回报,评测采用 ε=0.05 的策略跑固定步数。DQN 在 7 款游戏中均高于 Sarsa 和 Contingency;相对论文的人类专家中位数,它在 Breakout、Enduro、Pong 上更高,在 Beam Rider 接近,但在 Qbert、Seaquest、Space Invaders 上差距很大。来源:第 5.3 节与表 1,第 7–8 页
阅读 用深度强化学习玩 Atari 时最需要注意什么局限?
实验覆盖 Beam Rider、Breakout、Enduro、Pong、Qbert、Seaquest 和 Space Invaders。训练统一使用大小为 32 的 minibatch、容量为 100 万帧的回放池和总计 1000 万帧;ε 在前 100 万帧从 1 线性降至 0.1。架构、学习算法和主要超参数保持一致,但 Space Invaders 的跳帧数从 4 改为 3,以免闪烁的激光不可见,因此“完全不调参”并非字面上的零例外。来源:实验设置,第 6 页