返回报告库

AI / Technology

AlphaZero用通用强化学习算法通过自我对弈掌握国际象棋与将棋

传统棋类程序依赖专家特征与广泛搜索

图 1|两种建造棋手的路径。它强调知识从哪里来,不代表两边计算量相同。原创教学图,依据论文第 1–3、9–11 页整理。

2017 年前后的顶级国际象棋和将棋程序,通常把人类长期积累的棋类知识写进评估特征、走法排序、剪枝、开局库和残局库,再配合高速 alpha-beta 搜索。它们很强,但换一种棋,许多知识与工程技巧就要重做。论文要回答的是:能否只保留基本规则,用同一套学习算法在多个复杂棋类里从随机水平练到超人水平?来源:论文第 1–2、9–10 页

神经网络输出策略与价值,MCTS 用它们选棋,自我对弈产生赛果,再更新同一网络。

图 2|学习闭环。箭头表达训练时的信息流;部署对弈时只运行“神经网络 → MCTS → 走法”的部分。原创教学图,依据论文第 2–3 页整理。

系统从随机参数开始,双方都用当前网络辅助的 MCTS 下完整盘。终局规则给出输 1-1、和 00、赢 +1+1。训练随后同时让网络的价值预测贴近真实赛果,让策略输出贴近 MCTS 的访问分布。更新后的同一个网络继续生成新棋局,不需要在每轮后挑选一个“历史最佳版本”。来源:论文第 2–3 页

同一棋局下,宽而浅的搜索树与由神经网络引导的窄而深搜索树形成直觉对比。

图 3|“少搜但更聚焦”的概念图,不是数据图,也不按节点比例绘制。精确速度见上文。原创教学图,依据论文第 4、11 页整理。

论文报告,国际象棋中 AlphaZero 每秒搜索约 8 万 个局面,Stockfish 约 7000 万;将棋中分别约 4 万3500 万。作者的解释是,神经网络让搜索集中到更有希望的变化上。这个结果支持“搜索质量可以抵消搜索数量”,但不能单凭节点数断言两种硬件或一次局面评估的成本等价。来源:论文第 4 页

研究附录

官方原题: Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
作者: David Silver、Thomas Hubert、Julian Schrittwieser 等|DeepMind|2017
主源: arXiv:1712.01815论文 PDF

核心结论

三件值得记住的事

  1. 变化不只是“机器自己下棋”。 AlphaZero 把“下一步该走什么”和“这个局面最终会怎样”交给同一个神经网络学习,再用蒙特卡洛树搜索(MCTS)把判断变成更强的走法。
  2. 一套学习框架跨过了三种棋。 国际象棋、将棋和围棋分别训练独立网络,但主要算法、网络结构和超参数基本相同;输入仍按各自规则编码。来源:论文第 3 页、补充材料第 11–13 页
  3. 强结果伴随高成本和有限的比较范围。 论文报告 AlphaZero 在规定赛制下击败 Stockfish 8、Elmo 和训练 3 天的 AlphaGo Zero;但训练动用了数千块 TPU,对手版本、硬件和比赛设置也限定了结论能外推到哪里。来源:论文第 3–4、14 页

一句话说,这篇论文展示的不是一个背下人类棋谱的棋手,而是一套从规则出发、靠自我对弈不断改进“判断 + 搜索”的学习闭环。

问题

传统强棋力为何难以迁移

2017 年前后的顶级国际象棋和将棋程序,通常把人类长期积累的棋类知识写进评估特征、走法排序、剪枝、开局库和残局库,再配合高速 alpha-beta 搜索。它们很强,但换一种棋,许多知识与工程技巧就要重做。论文要回答的是:能否只保留基本规则,用同一套学习算法在多个复杂棋类里从随机水平练到超人水平?来源:论文第 1–2、9–10 页

“从零开始”不等于没有先验

论文中的 tabula rasa 更准确的含义是:不读人类棋谱,不使用手工评估函数、开局库或残局库。但系统知道完整规则,并用棋盘网格、棋子类型、王车易位、重复局面、升变和将棋“打入”等规则设计输入与动作表示;典型合法走法数还用于调节探索噪声。因此,它减少的是人类策略知识,不是抹去所有任务结构。来源:补充材料第 11–13 页

方法

一个网络同时给出方向与判断

给定局面,神经网络输出两样东西:策略 (p),表示各合法走法看起来多值得尝试;价值 (v),估计从当前局面出发最终结果。前者给搜索指路,后者帮助判断搜索到的局面。国际象棋还可能和棋,所以 AlphaZero 学的是期望结果,而不只是胜负概率。来源:论文第 2 页

搜索把直觉变成更好的行动

每一步棋前,MCTS 反复模拟:优先探索访问较少、网络先验较高、估值较好的分支;根节点各走法的访问次数最终形成更强的搜索策略 π\pi。训练时每次搜索使用 800 次模拟;非法走法会被屏蔽。来源:论文第 2 页、补充材料第 13 页

自我对弈形成闭环

系统从随机参数开始,双方都用当前网络辅助的 MCTS 下完整盘。终局规则给出输 1-1、和 00、赢 +1+1。训练随后同时让网络的价值预测贴近真实赛果,让策略输出贴近 MCTS 的访问分布。更新后的同一个网络继续生成新棋局,不需要在每轮后挑选一个“历史最佳版本”。来源:论文第 2–3 页

证据与局限

最硬的证据:固定赛制下的正面对局

完全训练后的系统在每步思考 1 分钟的 100 局比赛中接受评估。按 AlphaZero 视角汇总:国际象棋对 Stockfish 8 为 28 胜、72 和、0 负;将棋对 Elmo 为 90 胜、2 和、8 负;围棋对训练 3 天的 AlphaGo Zero 为 60 胜、40 负。国际象棋和将棋对手均使用 64 个 CPU 线程和 1GB 哈希表;AlphaZero 每次 MCTS 在一台含 4 块 TPU 的机器上运行。来源:论文表 1,第 4 页;补充材料第 14 页

训练曲线给出另一个视角:AlphaZero 在国际象棋约 4 小时后超过 Stockfish,在将棋不到 2 小时后超过 Elmo,在围棋约 8 小时后超过 AlphaGo Lee。摘要所说的“24 小时内”是概括性说法;补充表 S3 列出的完整训练时长分别为国际象棋 9 小时、将棋 12 小时、围棋 34 小时,对应约 4400 万、2400 万、2100 万 盘自我对弈。来源:论文第 3 页;表 S3,第 14 页

少搜很多,仍然更强

论文报告,国际象棋中 AlphaZero 每秒搜索约 8 万 个局面,Stockfish 约 7000 万;将棋中分别约 4 万3500 万。作者的解释是,神经网络让搜索集中到更有希望的变化上。这个结果支持“搜索质量可以抵消搜索数量”,但不能单凭节点数断言两种硬件或一次局面评估的成本等价。来源:论文第 4 页

结论边界在哪里

  • 这是棋类环境中的结果:规则完整、状态可观察、动作离散、赛果清楚,不能直接证明同样方法能处理开放世界任务。
  • “通用”指三种棋使用基本相同的学习与搜索框架,不是一个网络同时下三种棋;论文为每种棋分别训练实例。来源:论文第 3 页
  • 比赛比较受版本与设置约束:基线是 Stockfish 8、WCSC27 Elmo 和特定 AlphaGo 版本;论文没有证明对所有更新版本、硬件预算或时间控制都占优。来源:补充材料第 14 页
  • 训练并不便宜:自我对弈使用 5000 块第一代 TPU,网络训练使用 64 块第二代 TPU。论文展示了样本生成与算力换取人工知识的可行性,而不是低成本复现。来源:论文第 3 页
  • 论文主要给出整体系统结果,没有用完整消融实验分别量化网络结构、MCTS、连续更新和表示设计各自贡献多少。

实际意义

对产品与研究的真正启发

这项工作的价值,不是“所有问题都应该扔掉人类知识”,而是展示了一种可复用设计:当环境能可靠模拟、规则能判定结果、失败成本可控时,可以让搜索产生更好的训练目标,再让学习到的模型反过来缩小搜索空间。换句话说,模型与规划不是二选一,它们可以互相抬升。

什么时候值得借鉴

更适合借鉴的场景通常具备四个条件:有可信模拟器;动作后果可计算;目标能稳定评分;允许大量试错。若真实反馈昂贵、规则会变、奖励容易被钻空子,直接复制自我对弈闭环反而可能把错误放大。这里是基于论文机制的实践解读,不是作者在论文中验证过的产品结论。

术语与复核清单

  • 策略(policy):各走法的优先级分布,不等同于最终落子。
  • 价值(value):当前局面的预期赛果。
  • MCTS:用多次树搜索把网络的粗判断变成更可靠的走法分布。
  • 强化学习:这里的奖励来自最终胜、和、负,不需要人为给每一步标注“好棋”。
  • 仍值得追问:在统一总算力而非统一每步时间时结果如何?对更新引擎是否仍成立?去掉搜索或缩小网络后性能下降多少?迁移到不完美模拟器时会怎样?

读完后最稳妥的结论是:AlphaZero 证明了在规则封闭的复杂棋类中,通用的“自我对弈 + 学习 + 搜索”闭环能以极少的人类策略知识达到顶尖水平;它没有证明算力不重要,也没有证明所有现实问题都能照搬这条路线。

关于这篇论文的三个关键问题

AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 解决了什么问题?

2017 年前后的顶级国际象棋和将棋程序,通常把人类长期积累的棋类知识写进评估特征、走法排序、剪枝、开局库和残局库,再配合高速 alpha-beta 搜索。它们很强,但换一种棋,许多知识与工程技巧就要重做。论文要回答的是:能否只保留基本规则,用同一套学习算法在多个复杂棋类里从随机水平练到超人水平?来源:论文第 1–2、9–10 页

AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 的核心结论有哪些证据?

训练曲线给出另一个视角:AlphaZero 在国际象棋约 4 小时后超过 Stockfish,在将棋不到 2 小时后超过 Elmo,在围棋约 8 小时后超过 AlphaGo Lee。摘要所说的“24 小时内”是概括性说法;补充表 S3 列出的完整训练时长分别为国际象棋 9 小时、将棋 12 小时、围棋 34 小时,对应约 4400 万、2400 万、2100 万 盘自我对弈。来源:论文第 3 页;表 S3,第 14 页

阅读 AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 时最需要注意什么局限?

论文报告,国际象棋中 AlphaZero 每秒搜索约 8 万 个局面,Stockfish 约 7000 万;将棋中分别约 4 万 和 3500 万。作者的解释是,神经网络让搜索集中到更有希望的变化上。这个结果支持“搜索质量可以抵消搜索数量”,但不能单凭节点数断言两种硬件或一次局面评估的成本等价。来源:论文第 4 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro