返回报告库

AI / Technology

DeepSeek-Prover-V2用子目标分解与强化学习推进形式化数学推理

关于这篇论文的三个关键问题

DeepSeek-Prover-V2:把数学直觉变成 Lean 可验证证明 解决了什么问题?

这篇论文要解决的不是“怎样让模型算出更多数学答案”,而是更严格的问题:怎样让模型把数学直觉翻译成一份 Lean 4 能逐行检查的证明。DeepSeek-Prover-V2 的关键做法,是让 DeepSeek-V3 先搭证明骨架,再让较小的 7B 证明器递归填完子目标。成功的形式证明与原来的自然语言思路重新配对,成为大模型学习形式推理的冷启动数据。

DeepSeek-Prover-V2:把数学直觉变成 Lean 可验证证明 的核心结论有哪些证据?

在 MiniF2F-test 上,671B 模型平均输出长度从 non-CoT 的 761.8 token 增加到 CoT 的 6751.9 token,约为 8.9 倍;7B 模型也从 442.6 增加到 4488.5。长输出不是“解释性装饰”,它为分解、检查和改写证明提供了更多推理空间,但会直接增加延迟和计算成本。来源:论文表 3,第 9 页

阅读 DeepSeek-Prover-V2:把数学直觉变成 Lean 可验证证明 时最需要注意什么局限?

7B 版本由 DeepSeek-Prover-V1.5-Base-7B 扩展而来,上下文从 4096 增加到 32768 token,并使用 671B 强化学习阶段的 rollout 数据蒸馏。它提供更便宜的部署选择,但论文中的最高成绩属于 671B 模型加大采样预算,不能直接转移到 7B 单次生成。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro