返回报告库

AI / Technology

DeepSeekMath把开放数学推理模型推向新上限

DeepSeekMath 从网页数据到数学回答的训练链

DeepSeekMath 的关键不只是“多喂数学题”,而是把四件事连成一条训练链:从公开网页里反复淘出数学内容,以代码模型为底座,再用示范答案和强化学习调整答题习惯。最终,7B 模型不用外部工具或投票,在竞赛级 MATH 基准上得到 51.7%;同一道题采样 64 次再做自洽投票时达到 60.9%。来源:摘要、§1、表 5

从种子网页到人工补种的四轮数据挖掘

第一轮先取 OpenWebMath 中 50 万条作为正例,再从 Common Crawl 取 50 万网页作为负例,训练 fastText 分类器。分类器召回高分网页后,团队按域名检查漏掉的数学来源,把人工确认的新页面补回种子集。四轮后得到 3550 万个数学网页、约 120B tokens;第四轮发现约 98% 的内容第三轮已经找到,于是停止。来源:§2.1

PPO 与 GRPO 的结构差异

PPO 通常另训一个“评论家模型”估计每份回答相对基线好多少。GRPO 不再保留这个模型:它让策略模型对同一道题生成一组答案,用奖励模型打分,再用组内均值和标准差把每份答案转成相对奖励。高于同组平均的答案被加强,低于平均的答案被压低;同时用 KL 约束避免策略偏离参考模型太远。来源:§4.1.1–4.1.3

GRPO 的同题多答与组内相对奖励

PPO 通常另训一个“评论家模型”估计每份回答相对基线好多少。GRPO 不再保留这个模型:它让策略模型对同一道题生成一组答案,用奖励模型打分,再用组内均值和标准差把每份答案转成相对奖励。高于同组平均的答案被加强,低于平均的答案被压低;同时用 KL 约束避免策略偏离参考模型太远。来源:§4.1.1–4.1.3

强化学习前后,正确答案出现概率的变化

作者比较了两种指标:Pass@K 问“采样 K 次,至少一次答对吗”,Maj@K 问“多数票最后答对吗”。强化学习提高了 Maj@K,却没有提高 Pass@K。最稳妥的读法是:模型原本偶尔能产出的正确路线,被推到了更高概率;论文没有证明它获得了全新的解题能力。来源:§5.2.2、图 7

研究附录

官方标题: DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
作者: Zhihong Shao 等|版本: arXiv v3,2024-04-27|论文: arXiv:2402.03300

核心结论

DeepSeekMath 的关键不只是“多喂数学题”,而是把四件事连成一条训练链:从公开网页里反复淘出数学内容,以代码模型为底座,再用示范答案和强化学习调整答题习惯。最终,7B 模型不用外部工具或投票,在竞赛级 MATH 基准上得到 51.7%;同一道题采样 64 次再做自洽投票时达到 60.9%。来源:摘要、§1、表 5

读完最值得记住三点:

  1. 数据质量可以抵消一部分参数差距。 DeepSeekMath-Base 7B 在 MATH 上为 36.2%,高于论文所列 Minerva 540B 的 33.6%,但这只是特定评测条件下的比较,不等于全面胜过大模型。
  2. GRPO 用“同题多答、组内比较”替代 PPO 的评论家模型。 这样少维护一个与策略模型同规模的网络,训练显存压力更低。
  3. 强化学习主要让正确答案更常出现。 论文发现 Maj@K 提升、Pass@K 没有提升,因此它没有证明模型突然学会了更多此前不会的题型。来源:表 2、§4.1、§5.2.2

问题

数学答案不是只看最后一句是否流畅。模型要把条件、符号和多步推导一直保持一致;一步走偏,后面即使写得像样也会错。论文写作时,GPT-4 和 Gemini-Ultra 等闭源模型在数学基准上领先,而可获取的开放模型仍有明显差距。来源:§1

瓶颈不只在模型大小,也在训练材料

公开网络里有大量数学内容,但它们混在普通网页、低质量页面和重复内容中。以往数学语料规模较小或偏英语:论文列出的 OpenWebMath 为 13.6B tokens,Proof-Pile-2 为 51.9B,而 DeepSeekMath Corpus 约为 120B。真正的问题因此变成:怎样从海量网页里持续找出高质量、覆盖多语言的数学材料。来源:§2.2、表 1

只学论文文本并不一定会更会解题

作者单独用两类 arXiv 语料继续训练 1.3B 和 7B 模型,在本文采用的数学基准上没有看到稳定改善,部分结果还下降。不过,这个结论只覆盖论文测试的模型规模、数据配方与任务;作者没有检验更大模型、混合数据或定理“形式转自然语言”等任务。来源:§5.1.2、表 8–9

方法

四轮循环把数学网页从 Common Crawl 里捞出来

第一轮先取 OpenWebMath 中 50 万条作为正例,再从 Common Crawl 取 50 万网页作为负例,训练 fastText 分类器。分类器召回高分网页后,团队按域名检查漏掉的数学来源,把人工确认的新页面补回种子集。四轮后得到 3550 万个数学网页、约 120B tokens;第四轮发现约 98% 的内容第三轮已经找到,于是停止。来源:§2.1

为减少评测题泄漏,作者删除与 GSM8K、MATH、CMATH、AGIEval 等基准出现精确 10-gram 重合的文本;不足 10-gram、但至少 3-gram 的短文本则做精确匹配过滤。这能降低明显复制,却不能保证识别所有改写或语义重复。来源:§2.1

先站在代码模型肩上,再学数学与解题示范

DeepSeekMath-Base 从 DeepSeek-Coder-Base-v1.5 7B 继续训练 500B tokens。配方是 56% DeepSeekMath Corpus、4% AlgebraicStack、10% arXiv、20% GitHub 代码和 10% 中英自然语言。随后,模型用 77.6 万条中英文数学样本学习文字推导、程序推导和工具协同解题,得到 DeepSeekMath-Instruct。来源:§2.3、§3.1

论文的小规模对照实验支持“代码预训练有助于数学推理”,尤其是需要 Python 的题;但混合代码与数学一次训练,会改善工具解题和保留代码能力,却可能损害不用工具的数学成绩。作者猜测这可能与 1.3B 模型容量有限有关,因此不能直接推广到所有规模和配方。来源:§5.1.1、表 6–7

GRPO 让同一道题的答案彼此当参照

PPO 通常另训一个“评论家模型”估计每份回答相对基线好多少。GRPO 不再保留这个模型:它让策略模型对同一道题生成一组答案,用奖励模型打分,再用组内均值和标准差把每份答案转成相对奖励。高于同组平均的答案被加强,低于平均的答案被压低;同时用 KL 约束避免策略偏离参考模型太远。来源:§4.1.1–4.1.3

证据与局限

最强结果来自 MATH,但要看清评测口径

在不用外部工具和投票的单次生成评测中,DeepSeekMath-RL 7B 在 GSM8K 和 MATH 上分别得到 88.2% 与 51.7%;对应的 Instruct 模型是 82.9% 与 46.8%。论文还报告,64 次采样的自洽投票把 MATH 提到 60.9%,但这需要明显更多推理计算。来源:摘要、§1、§4.2、表 5

模型阶段GSM8K(文字推导)MATH(文字推导)
DeepSeekMath-Base 7B64.2%36.2%
DeepSeekMath-Instruct 7B82.9%46.8%
DeepSeekMath-RL 7B88.2%51.7%

表中数字来自论文表 2 与表 5。阶段之间不仅训练目标不同,所用数据也不同,因此它展示的是整条训练链的累积效果,不是对单一因素的严格因果拆分。

强化学习更像重排概率,不像扩张能力边界

作者比较了两种指标:Pass@K 问“采样 K 次,至少一次答对吗”,Maj@K 问“多数票最后答对吗”。强化学习提高了 Maj@K,却没有提高 Pass@K。最稳妥的读法是:模型原本偶尔能产出的正确路线,被推到了更高概率;论文没有证明它获得了全新的解题能力。来源:§5.2.2、图 7

几何、定理证明与奖励可靠性仍是短板

作者明确写到,模型在几何和定理证明上弱于闭源模型,试跑时处理不好三角形和椭圆题,可能反映训练数据偏差。7B 模型的少样本学习也弱于 GPT-4。另一方面,GRPO 依赖奖励模型判断答案;当奖励有噪声或遇到分布外题目时,它可能把错误偏好放大。来源:§5.2.3、§6

研究细节与复核问题

  • 训练数据: RL 只用约 14.4 万道来自 GSM8K、MATH 的文字推导题;其他评测被作者视为分布外任务。§4.2
  • 多语言证据: 语料以英语和中文为主;CMATH 从 Instruct 的 84.6% 升到 RL 的 88.8%,但这不代表覆盖所有语言。§2.2.2、§1
  • 待复核: 网页去污染能否挡住改写题?评论家模型被移除后,端到端显存与吞吐到底节省多少?这些问题在论文中没有给出完整量化答案。

实际意义

做垂直模型时,先把数据飞轮做起来

这篇论文最可迁移的部分,是“高质量种子 → 轻量分类器召回 → 域级人工检查 → 新种子再训练”的循环。它把专家判断放在最能扩大覆盖面的节点上,而不是让人逐页清洗整个互联网。对代码、法律或科研等垂直领域,这是一条值得测试的数据工程路线;是否同样有效,仍要用该领域自己的下游任务验证。来源:§2.1;后半句为基于方法的应用解读

选择 GRPO 前,先确认任务适合“同题比较”

当一道题能生成多份候选答案,而且奖励模型能稳定比较好坏时,GRPO 很有吸引力:它省掉评论家模型,并让训练样本来自当前策略的实时探索。若答案难以自动核验、奖励噪声大,组内排名也可能稳定地奖励错误模式。实际落地应同时监控单次正确率、Pass@K、Maj@K 和奖励模型在分布外样本上的误判率。来源:§4.1、§5.2;最后一句为工程建议

最终判断

DeepSeekMath 证明了一个实用方向:开放的 7B 模型可以靠更好的网页数学数据、代码底座和更省资源的强化学习,显著逼近当时闭源模型的数学基准成绩。它没有证明数学推理已经解决;相反,Pass@K、几何短板和奖励噪声共同提醒我们,榜单提升与能力边界扩大不是一回事。

关于这篇论文的三个关键问题

DeepSeekMath:把开放数学推理模型推向新上限 解决了什么问题?

数学答案不是只看最后一句是否流畅。模型要把条件、符号和多步推导一直保持一致;一步走偏,后面即使写得像样也会错。论文写作时,GPT-4 和 Gemini-Ultra 等闭源模型在数学基准上领先,而可获取的开放模型仍有明显差距。来源:§1

DeepSeekMath:把开放数学推理模型推向新上限 的核心结论有哪些证据?

在不用外部工具和投票的单次生成评测中,DeepSeekMath-RL 7B 在 GSM8K 和 MATH 上分别得到 88.2% 与 51.7%;对应的 Instruct 模型是 82.9% 与 46.8%。论文还报告,64 次采样的自洽投票把 MATH 提到 60.9%,但这需要明显更多推理计算。来源:摘要、§1、§4.2、表 5

阅读 DeepSeekMath:把开放数学推理模型推向新上限 时最需要注意什么局限?

在不用外部工具和投票的单次生成评测中,DeepSeekMath-RL 7B 在 GSM8K 和 MATH 上分别得到 88.2% 与 51.7%;对应的 Instruct 模型是 82.9% 与 46.8%。论文还报告,64 次采样的自洽投票把 MATH 提到 60.9%,但这需要明显更多推理计算。来源:摘要、§1、§4.2、表 5

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro