返回报告库

AI / Technology

DeepSeek LLM以长期主义扩展开源语言模型

从小规模实验到完整模型的研究路径

图 1|本文的主线:小实验拟合规律,规律指导算力分配,最后训练并评测 7B/67B。教学示意图,不是论文原图。来源:摘要与第 1、3 节

  1. 规模不是唯一旋钮。 固定算力下,模型大小、训练数据量、批大小和学习率要一起选;论文用小模型实验拟合这些关系。
  2. 数据会改变“最佳配方”。 三套数据得到的模型/数据扩展指数不同。作者观察到,数据质量越高,新增算力越适合多分给模型,但这只是三套数据上的经验结果。
  3. 67B 的强项集中在代码、数学、推理和中文。 它在多项基准上超过 LLaMA 2 70B,但并非每项都赢;聊天模型的开放式结果还依赖自动裁判与评测设置。

数据质量变化时,同一算力预算在模型与数据之间重新分配

图 2|作者的经验观察:三套数据中,质量越高,拟合结果越偏向扩大模型。箭头只表示预算分配,不表示已经证明的普遍因果。来源:第 3.3 节

可以把训练算力看成一笔固定预算:一部分用于更大的模型,一部分用于让模型读更多数据。论文在早期内部数据、当前内部数据和 OpenWebText2 上分别拟合曲线;模型扩展指数依次为 0.450、0.524、0.578,数据扩展指数为 0.550、0.476、0.422。这说明配方会随数据集变化,不能把某一条缩放律当成自然常数。来源:第 3.3 节,表 4

从双语数据到 Base,再经 SFT 与 DPO 得到 Chat

图 3|训练路径示意:预训练产生 Base,SFT 教它按指令回答,DPO 再根据成对偏好调整开放式回复。来源:第 2、4 节

7B 与 67B 都训练 2 万亿 token,上下文长度为 4096。结构大体沿用 LLaMA:Pre-Norm、RMSNorm、SwiGLU 和旋转位置编码;67B 采用 GQA,并以 95 层 偏深结构控制推理与流水线切分。随后,作者用超过 100 万条 样本做监督微调(SFT),再用帮助性与无害性偏好数据做一轮 DPO。来源:第 2.2、4 节与表 2

DeepSeek 67B 与 LLaMA 2 70B 的强项和混合结果

图 4|方向性总结,不是数值图:DeepSeek 67B 的主要优势集中在数学、代码、推理与中英双语任务,其他任务结果混合。精确值见上表。来源:第 5.1.1 节

观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5

知识时效、幻觉、语言覆盖与数据依赖四类边界

图 5|四条使用边界:知识会过时、输出会幻觉、语言覆盖不均、缩放结论依赖数据。来源:第 3.3、5.4、6 节

模型知识不会在预训练后自动更新,也可能给出不实信息或产生幻觉。首版中文数据并不完整,其他语言又不是主要训练来源,因此跨语言能力要谨慎使用。安全评测把“安全回答”和“拒答”都算作安全,不能单凭高分判断回答是否有用。来源:第 5.4、6 节

研究附录

官方原题: DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
作者: DeepSeek-AI(Xiao Bi 等) · 提交日期: 2024-01-05 · 论文: arXiv:2401.02954
一句话定位: 先用小规模实验估算怎样分配训练算力,再据此训练 7B 与 67B 中英双语模型。

核心结论

三个值得记住的结论

  1. 规模不是唯一旋钮。 固定算力下,模型大小、训练数据量、批大小和学习率要一起选;论文用小模型实验拟合这些关系。
  2. 数据会改变“最佳配方”。 三套数据得到的模型/数据扩展指数不同。作者观察到,数据质量越高,新增算力越适合多分给模型,但这只是三套数据上的经验结果。
  3. 67B 的强项集中在代码、数学、推理和中文。 它在多项基准上超过 LLaMA 2 70B,但并非每项都赢;聊天模型的开放式结果还依赖自动裁判与评测设置。

这篇论文最重要的变化,是把“训练一个更大的模型”改成“先预测怎样训练更划算”。作者报告,小规模实验拟合出的曲线能够预测 7B 和 67B 的验证损失;论文称预测跨到了约 1000 倍算力规模。这给完整训练提供了方向,但一次成功外推还不能证明规律能跨团队、跨数据长期成立。来源:第 3.2 节,图 4–5

问题

早期缩放研究为什么会给出不同答案?

Kaplan 等人的早期缩放研究与 Chinchilla 给出的最优模型/数据增长比例不同。本文认为,一个关键原因可能是训练数据不同;它也指出,用参数量近似模型计算规模会漏掉注意力开销,尤其在小模型上,误差可达 50%。因此,作者改用“每 token 的非词嵌入 FLOPs”表示模型规模。来源:第 1、3.2–3.3 节与表 3–4

固定算力不是固定配方

可以把训练算力看成一笔固定预算:一部分用于更大的模型,一部分用于让模型读更多数据。论文在早期内部数据、当前内部数据和 OpenWebText2 上分别拟合曲线;模型扩展指数依次为 0.450、0.524、0.578,数据扩展指数为 0.550、0.476、0.422。这说明配方会随数据集变化,不能把某一条缩放律当成自然常数。来源:第 3.3 节,表 4

方法

第一步:从小模型找“够好用”的训练区间

作者先在 1e17 FLOPs 预算下网格搜索批大小与学习率,再复用多阶段学习率训练,覆盖 1e17 到 2e19 FLOPs。只要验证误差比最佳值高不超过 0.25%,就算“近似最优”。拟合结果显示:算力增加时,合适的批大小上升,学习率下降,而且可用区间并不窄。来源:第 3.1 节

第二步:清洗并重组 2 万亿 token

预训练数据以中文和英文为主,共 2 万亿 token。数据流程包含去重、过滤和重新配比。跨 91 个 Common Crawl dump 去重时,论文报告移除了 89.8% 的文档;单个 dump 去重的比例是 22.2%。这两个数字说明去重范围影响很大,但高删除率本身不等于高数据质量。来源:第 2.1 节,表 1

第三步:从 Base 走到 Chat

7B 与 67B 都训练 2 万亿 token,上下文长度为 4096。结构大体沿用 LLaMA:Pre-Norm、RMSNorm、SwiGLU 和旋转位置编码;67B 采用 GQA,并以 95 层 偏深结构控制推理与流水线切分。随后,作者用超过 100 万条 样本做监督微调(SFT),再用帮助性与无害性偏好数据做一轮 DPO。来源:第 2.2、4 节与表 2

多阶段学习率是一个面向持续训练的工程选择:处理完 80% token 后,学习率降到峰值的 31.6%;处理完 90% 后降到 10%。论文称它最终性能与余弦退火接近,却能复用前一阶段的训练状态,方便以后继续加数据。来源:第 2.3 节,图 1

证据与局限

最硬的证据来自可复算基准

下面只列论文表 5 中最能体现强项的 67B 对 70B 结果。除 Pile-test 外均为准确率;数值来自作者的内部评测框架。

基准DeepSeek 67BLLaMA 2 70B差值
HumanEval(代码)42.728.7+14.0
MBPP(代码)57.445.6+11.8
GSM8K(数学)63.458.4+5.0
MATH(数学)18.713.5+5.2
BBH(推理)68.762.9+5.8
MMLU(综合)71.369.0+2.3
RACE-High(阅读)50.754.3−3.6
TriviaQA(知识)78.979.5−0.6

观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5

开放式对话结果要谨慎读

中文 AlignBench 中,DeepSeek-67B-Chat-DPO 总分 6.69,高于论文列出的 GPT-3.5 Turbo 6.08,但低于两个 GPT-4 版本。该榜单由 GPT-4-0613 打分,DeepSeek 两项还是作者自行运行官方仓库所得。它支持“在这套裁判和题集下胜过 GPT-3.5”,不支持“整体能力超过 GPT-3.5”。来源:第 5.2.1 节,表 7

对齐也有取舍。SFT 后部分完形与续写任务下降;DPO 前后,MATH 从 32.6 降到 30.2,HumanEval 从 73.8 降到 71.3,GSM8K 则从 84.1 升到 85.2。作者据此判断 DPO 对基础能力总体影响不大,但表格也提醒我们,平均稳定不等于每项稳定。来源:第 5.1.2 节与附录 A.5,表 6、17

论文明确留下了哪些边界?

模型知识不会在预训练后自动更新,也可能给出不实信息或产生幻觉。首版中文数据并不完整,其他语言又不是主要训练来源,因此跨语言能力要谨慎使用。安全评测把“安全回答”和“拒答”都算作安全,不能单凭高分判断回答是否有用。来源:第 5.4、6 节

实际意义

对训练团队,最有价值的是“先试算”

在昂贵训练前,先用小模型拟合批大小、学习率、模型大小和数据量,可以减少盲目试错。更重要的是,每次数据清洗或配比明显变化后都应重新拟合;本文自己已经证明,不同数据会改变答案。这是对论文结果的工程化解读,不是作者验证过的跨组织收益。

对产品团队,别把榜单当成上线许可

如果产品依赖代码、数学、中文问答,67B 的结果值得进入候选;真正上线前仍要用自己的流量重测事实性、拒答边界、时效性和长尾语言。开放式自动评分可以做筛选,不能代替真人验收。

复核清单与术语

  • 可复现性: 论文没有公开完整训练数据,缩放曲线对数据分布又敏感;复现时应报告自己的数据版本与拟合结果。
  • 比较公平性: 核对每个基准的 shots、提示格式与评测框架;聊天模型和基础模型的设置并不总相同。
  • Scaling law(缩放律): 用小实验拟合算力、模型、数据与误差之间的经验关系。
  • SFT: 用“问题—理想回答”样本教模型按指令作答。
  • DPO: 用成对偏好直接推动模型更偏向较好的回答,不先单独训练奖励模型。
  • 最大未解风险: 数据一变,最佳算力分配也可能变;论文尚未证明这套比例能跨数据、跨机构稳定迁移。

关于这篇论文的三个关键问题

DeepSeek LLM:以长期主义扩展开源语言模型 解决了什么问题?

Kaplan 等人的早期缩放研究与 Chinchilla 给出的最优模型/数据增长比例不同。本文认为,一个关键原因可能是训练数据不同;它也指出,用参数量近似模型计算规模会漏掉注意力开销,尤其在小模型上,误差可达 50%。因此,作者改用“每 token 的非词嵌入 FLOPs”表示模型规模。来源:第 1、3.2–3.3 节与表 3–4

DeepSeek LLM:以长期主义扩展开源语言模型 的核心结论有哪些证据?

观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5

阅读 DeepSeek LLM:以长期主义扩展开源语言模型 时最需要注意什么局限?

观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro