返回报告库

AI / Technology

AlphaZero用通用强化学习算法通过自我对弈掌握国际象棋与将棋

关于这篇论文的三个关键问题

AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 解决了什么问题?

2017 年前后的顶级国际象棋和将棋程序,通常把人类长期积累的棋类知识写进评估特征、走法排序、剪枝、开局库和残局库,再配合高速 alpha-beta 搜索。它们很强,但换一种棋,许多知识与工程技巧就要重做。论文要回答的是:能否只保留基本规则,用同一套学习算法在多个复杂棋类里从随机水平练到超人水平?来源:论文第 1–2、9–10 页

AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 的核心结论有哪些证据?

训练曲线给出另一个视角:AlphaZero 在国际象棋约 4 小时后超过 Stockfish,在将棋不到 2 小时后超过 Elmo,在围棋约 8 小时后超过 AlphaGo Lee。摘要所说的“24 小时内”是概括性说法;补充表 S3 列出的完整训练时长分别为国际象棋 9 小时、将棋 12 小时、围棋 34 小时,对应约 4400 万、2400 万、2100 万 盘自我对弈。来源:论文第 3 页;表 S3,第 14 页

阅读 AlphaZero:用通用强化学习算法通过自我对弈掌握国际象棋与将棋 时最需要注意什么局限?

论文报告,国际象棋中 AlphaZero 每秒搜索约 8 万 个局面,Stockfish 约 7000 万;将棋中分别约 4 万 和 3500 万。作者的解释是,神经网络让搜索集中到更有希望的变化上。这个结果支持“搜索质量可以抵消搜索数量”,但不能单凭节点数断言两种硬件或一次局面评估的成本等价。来源:论文第 4 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro