返回报告库

AI / Technology

DeepSeek-R1用强化学习激发大语言模型的推理能力

关于这篇论文的三个关键问题

DeepSeek-R1:用强化学习激发大语言模型的推理能力 解决了什么问题?

传统做法常先收集大量“题目—逐步推理—答案”示范,再让模型模仿。它能快速教会格式和常见套路,但人工轨迹费时,而且模型容易沿着既有写法学习。论文想问得更直接:如果只告诉模型最终结果是否正确,它能不能自己探索出有效的推理方式?来源:§1;§2.1

DeepSeek-R1:用强化学习激发大语言模型的推理能力 的核心结论有哪些证据?

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

阅读 DeepSeek-R1:用强化学习激发大语言模型的推理能力 时最需要注意什么局限?

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro