返回报告库

AI / Technology

DeepSeekMath把开放数学推理模型推向新上限

关于这篇论文的三个关键问题

DeepSeekMath:把开放数学推理模型推向新上限 解决了什么问题?

数学答案不是只看最后一句是否流畅。模型要把条件、符号和多步推导一直保持一致;一步走偏,后面即使写得像样也会错。论文写作时,GPT-4 和 Gemini-Ultra 等闭源模型在数学基准上领先,而可获取的开放模型仍有明显差距。来源:§1

DeepSeekMath:把开放数学推理模型推向新上限 的核心结论有哪些证据?

在不用外部工具和投票的单次生成评测中,DeepSeekMath-RL 7B 在 GSM8K 和 MATH 上分别得到 88.2% 与 51.7%;对应的 Instruct 模型是 82.9% 与 46.8%。论文还报告,64 次采样的自洽投票把 MATH 提到 60.9%,但这需要明显更多推理计算。来源:摘要、§1、§4.2、表 5

阅读 DeepSeekMath:把开放数学推理模型推向新上限 时最需要注意什么局限?

在不用外部工具和投票的单次生成评测中,DeepSeekMath-RL 7B 在 GSM8K 和 MATH 上分别得到 88.2% 与 51.7%;对应的 Instruct 模型是 82.9% 与 46.8%。论文还报告,64 次采样的自洽投票把 MATH 提到 60.9%,但这需要明显更多推理计算。来源:摘要、§1、§4.2、表 5

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro