返回报告库

AI / Technology

DeepSeek-R1用强化学习激发大语言模型的推理能力

纯模仿与规则奖励反馈回路的对比

DeepSeek-R1 这篇论文最值得记住的,不是又做出了一个更大的模型,而是验证了一条训练路线:面对答案能被程序或规则检查的题目,不先给基础模型大量人工解题过程,只奖励“最后答对”和“格式合规”,也能让它逐渐学会多想几步、回头检查、改换路线。纯强化学习得到的 R1-Zero 已经很强,但难读、会混语言;真正面向使用的 R1 又加入少量冷启动样本、两轮监督微调和两轮强化学习。来源:摘要;§1;§2.2–2.3

只检查终点是否正确的迷宫类比

这条路线依赖可验证任务。数学题可以按确定答案打分,代码题可以交给编译器和测试用例;如果“好不好”本身含糊,简单规则就给不出可靠训练信号。可以把它想成走迷宫:裁判只检查是否走到出口,不逐步教你左转还是右转;学习者靠反复尝试发现更好的路线。来源:§2.2.2

GRPO:同题多答、组内比较并在约束下更新策略

训练从 DeepSeek-V3-Base 开始。每个问题采样一组答案,规则给每个答案打分,再根据它相对组内平均水平的高低更新模型;这叫组相对策略优化(GRPO)。它省掉了传统强化学习里常见、且通常和策略模型一样大的 critic 模型,同时用 KL 约束避免新策略离参考模型太远。来源:§2.2.1;参考文献 Shao et al., 2024

DeepSeek-R1 的四阶段训练与蒸馏分支

R1 先用数千条可读的长推理样本做冷启动,再做面向数学、代码、科学和逻辑的强化学习。接着从模型输出中筛选约 60 万条正确、可读的推理样本,加上约 20 万条写作、事实问答、翻译等通用样本,用合计约 80 万条数据训练两个 epoch;最后再做一次覆盖通用场景的强化学习,对齐有用性与无害性。来源:§2.3.1–2.3.4

训练中从短推理到回看与换路的行为变化

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

DeepSeek-R1 的能力来源与实际限制

更长的测试时推理能提高难题表现,也会增加延迟和算力。多数投票还能继续抬高 AIME 分数,却要一次生成很多答案。对于小模型,论文的结果更支持先蒸馏强模型产出的高质量轨迹;让小模型独自用大规模强化学习探索,成本更高,效果还可能更差。来源:§2.2.4;§4.1

研究附录

官方英文标题: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
作者: DeepSeek-AI | 论文: arXiv:2501.12948 | 版本: v2(2026-01-04)

核心结论

DeepSeek-R1 这篇论文最值得记住的,不是又做出了一个更大的模型,而是验证了一条训练路线:面对答案能被程序或规则检查的题目,不先给基础模型大量人工解题过程,只奖励“最后答对”和“格式合规”,也能让它逐渐学会多想几步、回头检查、改换路线。纯强化学习得到的 R1-Zero 已经很强,但难读、会混语言;真正面向使用的 R1 又加入少量冷启动样本、两轮监督微调和两轮强化学习。来源:摘要;§1;§2.2–2.3

三点带走:

  1. 推理行为可以被奖励“激发”。 R1-Zero 没有先用监督微调教解题轨迹,AIME 2024 的 pass@1 在训练中从 15.6% 升到 71.0%。
  2. 能答对不等于好用。 纯强化学习会出现语言混杂和表达混乱,所以 R1 把人工先验和通用能力训练补回来。
  3. 大模型发现方法,小模型复制方法。 用 R1 生成的数据直接微调 32B 小模型,比让同一规模基础模型独自跑超过 10K 步强化学习更有效。来源:§2.2.4,图2;§2.3;§4.1,表6

问题

过去通常先给模型看人类解题过程

传统做法常先收集大量“题目—逐步推理—答案”示范,再让模型模仿。它能快速教会格式和常见套路,但人工轨迹费时,而且模型容易沿着既有写法学习。论文想问得更直接:如果只告诉模型最终结果是否正确,它能不能自己探索出有效的推理方式?来源:§1;§2.1

关键条件是:答案必须容易判定

这条路线依赖可验证任务。数学题可以按确定答案打分,代码题可以交给编译器和测试用例;如果“好不好”本身含糊,简单规则就给不出可靠训练信号。可以把它想成走迷宫:裁判只检查是否走到出口,不逐步教你左转还是右转;学习者靠反复尝试发现更好的路线。来源:§2.2.2

方法

R1-Zero:同一道题多答几次,组内比较谁更好

训练从 DeepSeek-V3-Base 开始。每个问题采样一组答案,规则给每个答案打分,再根据它相对组内平均水平的高低更新模型;这叫组相对策略优化(GRPO)。它省掉了传统强化学习里常见、且通常和策略模型一样大的 critic 模型,同时用 KL 约束避免新策略离参考模型太远。来源:§2.2.1;参考文献 Shao et al., 2024

奖励只有两类:答案是否正确,以及推理和答案是否放进指定标签。作者没有要求模型必须反思或必须采用某种解法,也没有使用神经网络过程奖励模型;他们报告的理由是,大规模训练中神经奖励模型可能被钻空子,重训也会增加成本和复杂度。来源:§2.2.2–2.2.3

R1:四个阶段解决“强但不好用”

R1 先用数千条可读的长推理样本做冷启动,再做面向数学、代码、科学和逻辑的强化学习。接着从模型输出中筛选约 60 万条正确、可读的推理样本,加上约 20 万条写作、事实问答、翻译等通用样本,用合计约 80 万条数据训练两个 epoch;最后再做一次覆盖通用场景的强化学习,对齐有用性与无害性。来源:§2.3.1–2.3.4

蒸馏:把大模型生成的解题经验交给小模型

作者还用这约 80 万条样本直接监督微调 Qwen 和 Llama 系列的 1.5B、7B、8B、14B、32B、70B 模型,没有再给蒸馏模型加强化学习。这里的“蒸馏”很朴素:让小模型学习 R1 已经筛选出的回答,而不是让它从零支付同样的探索成本。来源:§2.4

证据与局限

最直接的证据来自 R1-Zero 的训练曲线

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

R1 在一组基准上接近 o1-1217

论文表4报告:R1 在 AIME 2024 得到 79.8%,MATH-500 为 97.3%,LiveCodeBench 为 65.9%,Codeforces rating 为 2029;对应的 o1-1217 报告值分别是 79.2%、96.4%、63.4% 和 2061。R1 并非处处领先:GPQA Diamond 是 71.5% 对 75.7%,Aider-Polyglot 是 53.3% 对 61.7%。来源:§3.1,表4

基准DeepSeek-R1OpenAI o1-1217读法
AIME 2024(pass@1)79.8%79.2%数学竞赛题,R1 略高
MATH-500(pass@1)97.3%96.4%数学题,接近
LiveCodeBench(pass@1-CoT)65.9%63.4%代码算法题,R1 略高
Codeforces(rating)20292061编程竞赛,o1 略高
Aider-Polyglot(准确率)53.3%61.7%工程改码,R1 较低

小模型更适合先学大模型,而不是从零探索

表6是蒸馏最有说服力的对照。同为 Qwen 32B 路线,R1-Distill-Qwen-32B 在 AIME 2024、MATH-500、GPQA Diamond、LiveCodeBench 上分别得到 72.6%、94.3%、62.1%、57.2%;从基础模型独立跑超过 10K 步强化学习的 R1-Zero-Qwen-32B 则是 47.0%、91.6%、55.0%、40.2%。这支持“复制已发现的推理轨迹更省力”,但不能证明所有规模、所有任务都如此。来源:§4.1,表6

最大的不确定性不是分数,而是训练细节和覆盖范围

论文没有披露完整训练算力、数据构成与冷启动样本细节,因此外部团队难以仅凭论文复现整条路线。o1-1217 的结果来自官方报告,而非作者在同一接口下重测;不同模型的可访问性和评测条件也不完全对称。论文还明确说,R1 在函数调用、多轮对话、复杂角色扮演和 JSON 输出上不如 DeepSeek-V3;中文事实问答、安全拒答、非中英文语言混杂、提示敏感和软件工程训练不足也仍是问题。来源:§3 基线与评测设置;§3.1;§5

实际意义

对做模型的人:先找“能可靠验收”的任务

这篇论文给出的工程启示是:强化学习最容易在反馈便宜、明确、难钻空子的场景扩大规模。数学答案、单元测试、编译结果都适合;写作质量、事实完整性和复杂偏好则需要更谨慎的评审机制。这是基于论文方法的实践解读,不是作者对所有产品场景的普遍证明。来源:§2.2.2;§2.3.4

对用模型的人:多想一会儿有价值,但不是免费午餐

更长的测试时推理能提高难题表现,也会增加延迟和算力。多数投票还能继续抬高 AIME 分数,却要一次生成很多答案。对于小模型,论文的结果更支持先蒸馏强模型产出的高质量轨迹;让小模型独自用大规模强化学习探索,成本更高,效果还可能更差。来源:§2.2.4;§4.1

研究者接下来该验证什么

  • 只保留答案奖励、格式奖励或语言一致性奖励时,各自贡献有多大?论文只说明语言一致性奖励会让性能略降,没有给出完整消融数字。
  • 相同算力、相同数据、相同解码条件下,纯强化学习、过程监督和蒸馏的收益曲线如何变化?
  • 强化学习得到的回看和换路,是真正提升了解题搜索,还是部分来自更长输出和更多采样?
  • 在无法用规则判定的开放任务上,怎样避免奖励模型被钻空子?论文报告过程奖励模型在其大规模实验里收益不抵额外开销,但没有否定它在其他设置中的可能性。来源:§2.3.2;§4.1–4.2

术语与核查入口

  • SFT(监督微调):给模型看高质量输入与目标输出,让它模仿。
  • RL(强化学习):模型尝试输出,根据奖励调整策略。
  • GRPO:同题采样一组答案,以组内相对得分估计学习信号,不另训同等规模的 critic。
  • pass@1:按论文的采样评测设置,一次回答正确的平均概率估计;不是多数投票结果。
  • cons@64:采样 64 次后按多数答案汇总。
  • 主来源arXiv 摘要页论文全文;重点核查 §2.2–2.4、表2、表4–6、§5。

关于这篇论文的三个关键问题

DeepSeek-R1:用强化学习激发大语言模型的推理能力 解决了什么问题?

传统做法常先收集大量“题目—逐步推理—答案”示范,再让模型模仿。它能快速教会格式和常见套路,但人工轨迹费时,而且模型容易沿着既有写法学习。论文想问得更直接:如果只告诉模型最终结果是否正确,它能不能自己探索出有效的推理方式?来源:§1;§2.1

DeepSeek-R1:用强化学习激发大语言模型的推理能力 的核心结论有哪些证据?

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

阅读 DeepSeek-R1:用强化学习激发大语言模型的推理能力 时最需要注意什么局限?

R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro