AI / Technology
DeepSeek-R1用强化学习激发大语言模型的推理能力
纯模仿与规则奖励反馈回路的对比
DeepSeek-R1 这篇论文最值得记住的,不是又做出了一个更大的模型,而是验证了一条训练路线:面对答案能被程序或规则检查的题目,不先给基础模型大量人工解题过程,只奖励“最后答对”和“格式合规”,也能让它逐渐学会多想几步、回头检查、改换路线。纯强化学习得到的 R1-Zero 已经很强,但难读、会混语言;真正面向使用的 R1 又加入少量冷启动样本、两轮监督微调和两轮强化学习。来源:摘要;§1;§2.2–2.3
只检查终点是否正确的迷宫类比
这条路线依赖可验证任务。数学题可以按确定答案打分,代码题可以交给编译器和测试用例;如果“好不好”本身含糊,简单规则就给不出可靠训练信号。可以把它想成走迷宫:裁判只检查是否走到出口,不逐步教你左转还是右转;学习者靠反复尝试发现更好的路线。来源:§2.2.2
GRPO:同题多答、组内比较并在约束下更新策略
训练从 DeepSeek-V3-Base 开始。每个问题采样一组答案,规则给每个答案打分,再根据它相对组内平均水平的高低更新模型;这叫组相对策略优化(GRPO)。它省掉了传统强化学习里常见、且通常和策略模型一样大的 critic 模型,同时用 KL 约束避免新策略离参考模型太远。来源:§2.2.1;参考文献 Shao et al., 2024
DeepSeek-R1 的四阶段训练与蒸馏分支
R1 先用数千条可读的长推理样本做冷启动,再做面向数学、代码、科学和逻辑的强化学习。接着从模型输出中筛选约 60 万条正确、可读的推理样本,加上约 20 万条写作、事实问答、翻译等通用样本,用合计约 80 万条数据训练两个 epoch;最后再做一次覆盖通用场景的强化学习,对齐有用性与无害性。来源:§2.3.1–2.3.4
训练中从短推理到回看与换路的行为变化
R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3
DeepSeek-R1 的能力来源与实际限制
更长的测试时推理能提高难题表现,也会增加延迟和算力。多数投票还能继续抬高 AIME 分数,却要一次生成很多答案。对于小模型,论文的结果更支持先蒸馏强模型产出的高质量轨迹;让小模型独自用大规模强化学习探索,成本更高,效果还可能更差。来源:§2.2.4;§4.1
研究附录
官方英文标题: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
作者: DeepSeek-AI | 论文: arXiv:2501.12948 | 版本: v2(2026-01-04)
核心结论
DeepSeek-R1 这篇论文最值得记住的,不是又做出了一个更大的模型,而是验证了一条训练路线:面对答案能被程序或规则检查的题目,不先给基础模型大量人工解题过程,只奖励“最后答对”和“格式合规”,也能让它逐渐学会多想几步、回头检查、改换路线。纯强化学习得到的 R1-Zero 已经很强,但难读、会混语言;真正面向使用的 R1 又加入少量冷启动样本、两轮监督微调和两轮强化学习。来源:摘要;§1;§2.2–2.3
三点带走:
- 推理行为可以被奖励“激发”。 R1-Zero 没有先用监督微调教解题轨迹,AIME 2024 的 pass@1 在训练中从 15.6% 升到 71.0%。
- 能答对不等于好用。 纯强化学习会出现语言混杂和表达混乱,所以 R1 把人工先验和通用能力训练补回来。
- 大模型发现方法,小模型复制方法。 用 R1 生成的数据直接微调 32B 小模型,比让同一规模基础模型独自跑超过 10K 步强化学习更有效。来源:§2.2.4,图2;§2.3;§4.1,表6
问题
过去通常先给模型看人类解题过程
传统做法常先收集大量“题目—逐步推理—答案”示范,再让模型模仿。它能快速教会格式和常见套路,但人工轨迹费时,而且模型容易沿着既有写法学习。论文想问得更直接:如果只告诉模型最终结果是否正确,它能不能自己探索出有效的推理方式?来源:§1;§2.1
关键条件是:答案必须容易判定
这条路线依赖可验证任务。数学题可以按确定答案打分,代码题可以交给编译器和测试用例;如果“好不好”本身含糊,简单规则就给不出可靠训练信号。可以把它想成走迷宫:裁判只检查是否走到出口,不逐步教你左转还是右转;学习者靠反复尝试发现更好的路线。来源:§2.2.2
方法
R1-Zero:同一道题多答几次,组内比较谁更好
训练从 DeepSeek-V3-Base 开始。每个问题采样一组答案,规则给每个答案打分,再根据它相对组内平均水平的高低更新模型;这叫组相对策略优化(GRPO)。它省掉了传统强化学习里常见、且通常和策略模型一样大的 critic 模型,同时用 KL 约束避免新策略离参考模型太远。来源:§2.2.1;参考文献 Shao et al., 2024
奖励只有两类:答案是否正确,以及推理和答案是否放进指定标签。作者没有要求模型必须反思或必须采用某种解法,也没有使用神经网络过程奖励模型;他们报告的理由是,大规模训练中神经奖励模型可能被钻空子,重训也会增加成本和复杂度。来源:§2.2.2–2.2.3
R1:四个阶段解决“强但不好用”
R1 先用数千条可读的长推理样本做冷启动,再做面向数学、代码、科学和逻辑的强化学习。接着从模型输出中筛选约 60 万条正确、可读的推理样本,加上约 20 万条写作、事实问答、翻译等通用样本,用合计约 80 万条数据训练两个 epoch;最后再做一次覆盖通用场景的强化学习,对齐有用性与无害性。来源:§2.3.1–2.3.4
蒸馏:把大模型生成的解题经验交给小模型
作者还用这约 80 万条样本直接监督微调 Qwen 和 Llama 系列的 1.5B、7B、8B、14B、32B、70B 模型,没有再给蒸馏模型加强化学习。这里的“蒸馏”很朴素:让小模型学习 R1 已经筛选出的回答,而不是让它从零支付同样的探索成本。来源:§2.4
证据与局限
最直接的证据来自 R1-Zero 的训练曲线
R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3
R1 在一组基准上接近 o1-1217
论文表4报告:R1 在 AIME 2024 得到 79.8%,MATH-500 为 97.3%,LiveCodeBench 为 65.9%,Codeforces rating 为 2029;对应的 o1-1217 报告值分别是 79.2%、96.4%、63.4% 和 2061。R1 并非处处领先:GPQA Diamond 是 71.5% 对 75.7%,Aider-Polyglot 是 53.3% 对 61.7%。来源:§3.1,表4
| 基准 | DeepSeek-R1 | OpenAI o1-1217 | 读法 |
|---|---|---|---|
| AIME 2024(pass@1) | 79.8% | 79.2% | 数学竞赛题,R1 略高 |
| MATH-500(pass@1) | 97.3% | 96.4% | 数学题,接近 |
| LiveCodeBench(pass@1-CoT) | 65.9% | 63.4% | 代码算法题,R1 略高 |
| Codeforces(rating) | 2029 | 2061 | 编程竞赛,o1 略高 |
| Aider-Polyglot(准确率) | 53.3% | 61.7% | 工程改码,R1 较低 |
小模型更适合先学大模型,而不是从零探索
表6是蒸馏最有说服力的对照。同为 Qwen 32B 路线,R1-Distill-Qwen-32B 在 AIME 2024、MATH-500、GPQA Diamond、LiveCodeBench 上分别得到 72.6%、94.3%、62.1%、57.2%;从基础模型独立跑超过 10K 步强化学习的 R1-Zero-Qwen-32B 则是 47.0%、91.6%、55.0%、40.2%。这支持“复制已发现的推理轨迹更省力”,但不能证明所有规模、所有任务都如此。来源:§4.1,表6
最大的不确定性不是分数,而是训练细节和覆盖范围
论文没有披露完整训练算力、数据构成与冷启动样本细节,因此外部团队难以仅凭论文复现整条路线。o1-1217 的结果来自官方报告,而非作者在同一接口下重测;不同模型的可访问性和评测条件也不完全对称。论文还明确说,R1 在函数调用、多轮对话、复杂角色扮演和 JSON 输出上不如 DeepSeek-V3;中文事实问答、安全拒答、非中英文语言混杂、提示敏感和软件工程训练不足也仍是问题。来源:§3 基线与评测设置;§3.1;§5
实际意义
对做模型的人:先找“能可靠验收”的任务
这篇论文给出的工程启示是:强化学习最容易在反馈便宜、明确、难钻空子的场景扩大规模。数学答案、单元测试、编译结果都适合;写作质量、事实完整性和复杂偏好则需要更谨慎的评审机制。这是基于论文方法的实践解读,不是作者对所有产品场景的普遍证明。来源:§2.2.2;§2.3.4
对用模型的人:多想一会儿有价值,但不是免费午餐
更长的测试时推理能提高难题表现,也会增加延迟和算力。多数投票还能继续抬高 AIME 分数,却要一次生成很多答案。对于小模型,论文的结果更支持先蒸馏强模型产出的高质量轨迹;让小模型独自用大规模强化学习探索,成本更高,效果还可能更差。来源:§2.2.4;§4.1
研究者接下来该验证什么
- 只保留答案奖励、格式奖励或语言一致性奖励时,各自贡献有多大?论文只说明语言一致性奖励会让性能略降,没有给出完整消融数字。
- 相同算力、相同数据、相同解码条件下,纯强化学习、过程监督和蒸馏的收益曲线如何变化?
- 强化学习得到的回看和换路,是真正提升了解题搜索,还是部分来自更长输出和更多采样?
- 在无法用规则判定的开放任务上,怎样避免奖励模型被钻空子?论文报告过程奖励模型在其大规模实验里收益不抵额外开销,但没有否定它在其他设置中的可能性。来源:§2.3.2;§4.1–4.2
术语与核查入口
关于这篇论文的三个关键问题
DeepSeek-R1:用强化学习激发大语言模型的推理能力 解决了什么问题?
传统做法常先收集大量“题目—逐步推理—答案”示范,再让模型模仿。它能快速教会格式和常见套路,但人工轨迹费时,而且模型容易沿着既有写法学习。论文想问得更直接:如果只告诉模型最终结果是否正确,它能不能自己探索出有效的推理方式?来源:§1;§2.1
DeepSeek-R1:用强化学习激发大语言模型的推理能力 的核心结论有哪些证据?
R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3
阅读 DeepSeek-R1:用强化学习激发大语言模型的推理能力 时最需要注意什么局限?
R1-Zero 在 AIME 2024 上的平均 pass@1 从 15.6% 升到 71.0%;对 64 个采样答案做多数投票后达到 86.7%。训练过程中,作者还观察到输出从数百个推理 token 增长到数千个,并出现回看前面步骤、尝试替代方案的文本行为。这里能确认的是行为和分数一起变化,不能据此断言模型拥有人的意识或理解。来源:§1;§2.2.4,图2–3、表2–3