AI / Technology
DeepSeek LLM以长期主义扩展开源语言模型
从小规模实验到完整模型的研究路径
图 1|本文的主线:小实验拟合规律,规律指导算力分配,最后训练并评测 7B/67B。教学示意图,不是论文原图。来源:摘要与第 1、3 节。
- 规模不是唯一旋钮。 固定算力下,模型大小、训练数据量、批大小和学习率要一起选;论文用小模型实验拟合这些关系。
- 数据会改变“最佳配方”。 三套数据得到的模型/数据扩展指数不同。作者观察到,数据质量越高,新增算力越适合多分给模型,但这只是三套数据上的经验结果。
- 67B 的强项集中在代码、数学、推理和中文。 它在多项基准上超过 LLaMA 2 70B,但并非每项都赢;聊天模型的开放式结果还依赖自动裁判与评测设置。
数据质量变化时,同一算力预算在模型与数据之间重新分配
图 2|作者的经验观察:三套数据中,质量越高,拟合结果越偏向扩大模型。箭头只表示预算分配,不表示已经证明的普遍因果。来源:第 3.3 节。
可以把训练算力看成一笔固定预算:一部分用于更大的模型,一部分用于让模型读更多数据。论文在早期内部数据、当前内部数据和 OpenWebText2 上分别拟合曲线;模型扩展指数依次为 0.450、0.524、0.578,数据扩展指数为 0.550、0.476、0.422。这说明配方会随数据集变化,不能把某一条缩放律当成自然常数。来源:第 3.3 节,表 4
从双语数据到 Base,再经 SFT 与 DPO 得到 Chat
图 3|训练路径示意:预训练产生 Base,SFT 教它按指令回答,DPO 再根据成对偏好调整开放式回复。来源:第 2、4 节。
7B 与 67B 都训练 2 万亿 token,上下文长度为 4096。结构大体沿用 LLaMA:Pre-Norm、RMSNorm、SwiGLU 和旋转位置编码;67B 采用 GQA,并以 95 层 偏深结构控制推理与流水线切分。随后,作者用超过 100 万条 样本做监督微调(SFT),再用帮助性与无害性偏好数据做一轮 DPO。来源:第 2.2、4 节与表 2
DeepSeek 67B 与 LLaMA 2 70B 的强项和混合结果
图 4|方向性总结,不是数值图:DeepSeek 67B 的主要优势集中在数学、代码、推理与中英双语任务,其他任务结果混合。精确值见上表。来源:第 5.1.1 节。
观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5
知识时效、幻觉、语言覆盖与数据依赖四类边界
图 5|四条使用边界:知识会过时、输出会幻觉、语言覆盖不均、缩放结论依赖数据。来源:第 3.3、5.4、6 节。
模型知识不会在预训练后自动更新,也可能给出不实信息或产生幻觉。首版中文数据并不完整,其他语言又不是主要训练来源,因此跨语言能力要谨慎使用。安全评测把“安全回答”和“拒答”都算作安全,不能单凭高分判断回答是否有用。来源:第 5.4、6 节
研究附录
官方原题: DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
作者: DeepSeek-AI(Xiao Bi 等) · 提交日期: 2024-01-05 · 论文: arXiv:2401.02954
一句话定位: 先用小规模实验估算怎样分配训练算力,再据此训练 7B 与 67B 中英双语模型。
核心结论
三个值得记住的结论
- 规模不是唯一旋钮。 固定算力下,模型大小、训练数据量、批大小和学习率要一起选;论文用小模型实验拟合这些关系。
- 数据会改变“最佳配方”。 三套数据得到的模型/数据扩展指数不同。作者观察到,数据质量越高,新增算力越适合多分给模型,但这只是三套数据上的经验结果。
- 67B 的强项集中在代码、数学、推理和中文。 它在多项基准上超过 LLaMA 2 70B,但并非每项都赢;聊天模型的开放式结果还依赖自动裁判与评测设置。
这篇论文最重要的变化,是把“训练一个更大的模型”改成“先预测怎样训练更划算”。作者报告,小规模实验拟合出的曲线能够预测 7B 和 67B 的验证损失;论文称预测跨到了约 1000 倍算力规模。这给完整训练提供了方向,但一次成功外推还不能证明规律能跨团队、跨数据长期成立。来源:第 3.2 节,图 4–5
问题
早期缩放研究为什么会给出不同答案?
Kaplan 等人的早期缩放研究与 Chinchilla 给出的最优模型/数据增长比例不同。本文认为,一个关键原因可能是训练数据不同;它也指出,用参数量近似模型计算规模会漏掉注意力开销,尤其在小模型上,误差可达 50%。因此,作者改用“每 token 的非词嵌入 FLOPs”表示模型规模。来源:第 1、3.2–3.3 节与表 3–4
固定算力不是固定配方
可以把训练算力看成一笔固定预算:一部分用于更大的模型,一部分用于让模型读更多数据。论文在早期内部数据、当前内部数据和 OpenWebText2 上分别拟合曲线;模型扩展指数依次为 0.450、0.524、0.578,数据扩展指数为 0.550、0.476、0.422。这说明配方会随数据集变化,不能把某一条缩放律当成自然常数。来源:第 3.3 节,表 4
方法
第一步:从小模型找“够好用”的训练区间
作者先在 1e17 FLOPs 预算下网格搜索批大小与学习率,再复用多阶段学习率训练,覆盖 1e17 到 2e19 FLOPs。只要验证误差比最佳值高不超过 0.25%,就算“近似最优”。拟合结果显示:算力增加时,合适的批大小上升,学习率下降,而且可用区间并不窄。来源:第 3.1 节
第二步:清洗并重组 2 万亿 token
预训练数据以中文和英文为主,共 2 万亿 token。数据流程包含去重、过滤和重新配比。跨 91 个 Common Crawl dump 去重时,论文报告移除了 89.8% 的文档;单个 dump 去重的比例是 22.2%。这两个数字说明去重范围影响很大,但高删除率本身不等于高数据质量。来源:第 2.1 节,表 1
第三步:从 Base 走到 Chat
7B 与 67B 都训练 2 万亿 token,上下文长度为 4096。结构大体沿用 LLaMA:Pre-Norm、RMSNorm、SwiGLU 和旋转位置编码;67B 采用 GQA,并以 95 层 偏深结构控制推理与流水线切分。随后,作者用超过 100 万条 样本做监督微调(SFT),再用帮助性与无害性偏好数据做一轮 DPO。来源:第 2.2、4 节与表 2
多阶段学习率是一个面向持续训练的工程选择:处理完 80% token 后,学习率降到峰值的 31.6%;处理完 90% 后降到 10%。论文称它最终性能与余弦退火接近,却能复用前一阶段的训练状态,方便以后继续加数据。来源:第 2.3 节,图 1
证据与局限
最硬的证据来自可复算基准
下面只列论文表 5 中最能体现强项的 67B 对 70B 结果。除 Pile-test 外均为准确率;数值来自作者的内部评测框架。
| 基准 | DeepSeek 67B | LLaMA 2 70B | 差值 |
|---|---|---|---|
| HumanEval(代码) | 42.7 | 28.7 | +14.0 |
| MBPP(代码) | 57.4 | 45.6 | +11.8 |
| GSM8K(数学) | 63.4 | 58.4 | +5.0 |
| MATH(数学) | 18.7 | 13.5 | +5.2 |
| BBH(推理) | 68.7 | 62.9 | +5.8 |
| MMLU(综合) | 71.3 | 69.0 | +2.3 |
| RACE-High(阅读) | 50.7 | 54.3 | −3.6 |
| TriviaQA(知识) | 78.9 | 79.5 | −0.6 |
观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5
开放式对话结果要谨慎读
中文 AlignBench 中,DeepSeek-67B-Chat-DPO 总分 6.69,高于论文列出的 GPT-3.5 Turbo 6.08,但低于两个 GPT-4 版本。该榜单由 GPT-4-0613 打分,DeepSeek 两项还是作者自行运行官方仓库所得。它支持“在这套裁判和题集下胜过 GPT-3.5”,不支持“整体能力超过 GPT-3.5”。来源:第 5.2.1 节,表 7
对齐也有取舍。SFT 后部分完形与续写任务下降;DPO 前后,MATH 从 32.6 降到 30.2,HumanEval 从 73.8 降到 71.3,GSM8K 则从 84.1 升到 85.2。作者据此判断 DPO 对基础能力总体影响不大,但表格也提醒我们,平均稳定不等于每项稳定。来源:第 5.1.2 节与附录 A.5,表 6、17
论文明确留下了哪些边界?
模型知识不会在预训练后自动更新,也可能给出不实信息或产生幻觉。首版中文数据并不完整,其他语言又不是主要训练来源,因此跨语言能力要谨慎使用。安全评测把“安全回答”和“拒答”都算作安全,不能单凭高分判断回答是否有用。来源:第 5.4、6 节
实际意义
对训练团队,最有价值的是“先试算”
在昂贵训练前,先用小模型拟合批大小、学习率、模型大小和数据量,可以减少盲目试错。更重要的是,每次数据清洗或配比明显变化后都应重新拟合;本文自己已经证明,不同数据会改变答案。这是对论文结果的工程化解读,不是作者验证过的跨组织收益。
对产品团队,别把榜单当成上线许可
如果产品依赖代码、数学、中文问答,67B 的结果值得进入候选;真正上线前仍要用自己的流量重测事实性、拒答边界、时效性和长尾语言。开放式自动评分可以做筛选,不能代替真人验收。
复核清单与术语
- 可复现性: 论文没有公开完整训练数据,缩放曲线对数据分布又敏感;复现时应报告自己的数据版本与拟合结果。
- 比较公平性: 核对每个基准的 shots、提示格式与评测框架;聊天模型和基础模型的设置并不总相同。
- Scaling law(缩放律): 用小实验拟合算力、模型、数据与误差之间的经验关系。
- SFT: 用“问题—理想回答”样本教模型按指令作答。
- DPO: 用成对偏好直接推动模型更偏向较好的回答,不先单独训练奖励模型。
- 最大未解风险: 数据一变,最佳算力分配也可能变;论文尚未证明这套比例能跨数据、跨机构稳定迁移。
关于这篇论文的三个关键问题
DeepSeek LLM:以长期主义扩展开源语言模型 解决了什么问题?
Kaplan 等人的早期缩放研究与 Chinchilla 给出的最优模型/数据增长比例不同。本文认为,一个关键原因可能是训练数据不同;它也指出,用参数量近似模型计算规模会漏掉注意力开销,尤其在小模型上,误差可达 50%。因此,作者改用“每 token 的非词嵌入 FLOPs”表示模型规模。来源:第 1、3.2–3.3 节与表 3–4
DeepSeek LLM:以长期主义扩展开源语言模型 的核心结论有哪些证据?
观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5
阅读 DeepSeek LLM:以长期主义扩展开源语言模型 时最需要注意什么局限?
观察上,DeepSeek 67B 在代码、数学、推理和中文任务优势明显;RACE-High、TriviaQA、WinoGrande 等任务则没有领先。由此能说“强项突出”,不能说“所有能力都更强”。来源:第 5.1.1 节,表 5