返回报告库

AI / Technology

语言模型的“规模定律”把训练当成一项可预测的预算工程

论文:Jared Kaplan 等,Scaling Laws for Neural Language Models(2020)
原文:arXiv 摘要页 · PDF
阅读提示:这是一项关于 Transformer 语言模型交叉熵损失 的经验研究,不是对通用能力、安全性或产品价值的直接证明。

先记住三点

  1. 在论文覆盖的实验范围内,测试损失随模型参数、数据量和训练计算量增加而平滑下降,近似服从幂律;模型“多深、多宽”通常只是次要因素。
  2. 固定训练计算预算时,论文给出的高效策略是:把更多预算投向更大的模型,用相对有限的数据训练,并在完全收敛前停止。
  3. 这些规律是 2020 年特定数据、模型和损失指标上的经验拟合;曲线很整齐,不等于外推永远有效,也不等于真实任务能力会同步提升。

1. 一句话结论

这篇论文把“模型要做多大、数据要用多少、训练要跑多久”从经验试错变成了一个可拟合的预算问题:在其他瓶颈没有先卡住时,扩大参数量 NN、数据量 DD 或计算量 CC,测试交叉熵损失 LL 都会按近似幂律下降;而固定 CC 时,作者发现扩大模型、少跑一些串行训练步骤 比把较小模型一直训到收敛更省计算。[来源:论文摘要、§1.1–1.2、§6]

图 1|教学重绘。三只“旋钮”不是可以无限单独拧动:参数固定会遇到容量瓶颈,数据固定会过拟合,计算不足则训练不到目标损失。来源依据:论文 Fig. 1、Eq. 1.1–1.5;图像为新生成,不复刻原论文图。

2. 问题:为什么训练规划总像在猜?

语言模型的结果可能受很多因素影响:参数总量、训练文本、计算预算、网络深宽、注意力头数、上下文长度、批量大小和优化器。若每个因素都独立重要,团队只能靠昂贵的网格搜索找配方。论文因此问了一个更可操作的问题:能否用少数稳定关系,预测规模扩大后损失会怎样变化?

作者主要研究 decoder-only Transformer,在 WebText2 上用 1024-token 上下文做自回归训练,以测试集交叉熵(单位为 nats)作为主指标。实验覆盖 768 到 15 亿个非嵌入参数2200 万到 230 亿个 token,并改变深度、宽度、注意力头、批量大小等因素。[来源:论文 §2、§3 开头]

一个关键处理是把词嵌入参数排除在“模型规模”之外。这样,不同深度模型的结果更接近同一条趋势线;在作者考察的合理形状范围内,宽深比相差约 40 倍,损失仍只变化几个百分点。[来源:论文 §2.1、Fig. 5–6]

3. 方法:先找单变量规律,再拼成预算规则

第一步:隔离三个瓶颈。 作者分别观察参数受限、数据受限和计算受限的训练。当另外两个因素足够充裕时,损失可写成 L(X)XαL(X)\propto X^{-\alpha},其中 XX 可以是 NNDD 或经批量效率校正后的 CC。这是经验拟合,不是从理论推导出的自然定律。[来源:论文 Eq. 1.1–1.3、Appendix C]

第二步:把参数与数据放进同一张地图。 固定数据继续增大模型,收益会变小并出现过拟合;固定模型继续喂数据也会遇到容量上限。论文用一个联合函数拟合早停后的 L(N,D)L(N,D),并发现为了控制过拟合,数据不必与参数等比例增长:模型扩大 8 倍时,数据约扩大 5 倍即可维持相近的过拟合水平。[来源:论文 §4、Fig. 9、Eq. 4.1–4.4]

第三步:在固定计算量下求最优点。 训练计算近似由“参数量 × 处理过的 token 数”决定。作者还用临界批量大小修正并行训练效率,然后在每个预算上寻找损失最低的模型规模与训练步数。经验结果是:计算预算每增加 10 倍,最优模型规模约增加 5 倍,处理的数据样本约增加 2 倍,串行优化步数只缓慢增加。[来源:论文 §5.1、§6.1、Fig. 13–14]

图 2|教学重绘。下方表达论文的计算效率结论,不表示大模型在部署、延迟或总生命周期成本上一定更优。来源依据:论文 §1.1、§6、Appendix B.3–B.4。

4. 证据与边界:最强的是跨度,最弱的是外推

最强证据是规律跨越了很宽的实验尺度:作者报告相关关系覆盖约 8 个数量级的计算量、6 个数量级的参数量,以及超过 2 个数量级的数据量;在这一范围内,多组训练曲线能被简单幂律共同描述。跨数据分布测试也显示,Books Corpus、Common Crawl、英文 Wikipedia 等集合上的损失会随 WebText2 验证损失近似同步改善,通常表现为一个偏移量。[来源:论文 §1.2、§3.2.2]

但“预测损失”与“证明能力”是两回事。论文自己明确提出:仍需研究损失持续下降是否会转化为相关语言任务的改善;聚合指标的平滑变化可能掩盖质变,也可能无法告诉我们具体出现了什么能力。[来源:论文 §8]

更具体的限制包括:缩放律缺少坚实理论;最小数据区间拟合较差;正则化与数据增强没有被系统优化;计算估算省略了某些与上下文长度相关的项;部分超参数可能未调到最佳;远离已测损失范围时,临界批量的外推也不可靠。[来源:论文 Appendix C] 此外,作者指出幂律最终必须变平,因为自然语言存在非零熵;论文内部的数据需求关系在远外推时也会互相矛盾。[来源:论文 §6.3]

图 3|教学重绘。虚线代表假设性外推,不是论文测得的数据;三块警示分别对应论文讨论的数据约束、非零熵下限和“损失不等于任务能力”。来源依据:论文 §6.3、§8、Appendix C。

5. 实际意义:把它当预算罗盘,不要当永久定律

对训练负责人,这篇论文最有用的不是某个固定指数,而是一套决策顺序:先明确目标损失与计算预算;用小规模试验拟合当前模型族和数据配方的曲线;检查究竟是模型、数据还是计算在形成瓶颈;最后比较扩大模型、增加 token 和延长训练各自的边际回报。产品层面的解释是:缩放律可以减少无方向的训练试验,但不能替代任务评测、数据质量检查、安全评估和推理成本核算。

今天回看,还应把这篇论文的结论限定为“Kaplan 等人在其设置下观察到的规律”。它回答的是训练损失如何随规模变化,不直接回答哪种现代架构最佳、数据是否应重复使用、推理预算如何分配,也不证明扩大规模一定带来更可靠、更安全或更有商业价值的系统。最稳妥的用法,是把它当作可被新实验推翻或重估的先验

研究附录:证据台账、术语与核验问题

证据台账

条目论文中的证据可说到什么程度不确定性
实验对象WebText2;主要为 decoder-only Transformer;1024-token 上下文说明该设置中的缩放规律不能自动推广到所有架构、数据或目标函数
规模范围768–1.5B 非嵌入参数;22M–23B token说明实验覆盖范围很宽超出范围属于外推
主指标测试交叉熵,单位 nats衡量下一 token 概率预测质量不是任务成功率、事实性或安全性
形状影响固定非嵌入参数时,合理宽深范围内影响较弱;Fig. 5 报告宽深比约 40 倍仍只差几个百分点“规模比形状更主导”极端形状、小于两层等会偏离趋势
过拟合关系模型增大 8×,数据约增大 5×可维持相近过拟合水平数据需求相对参数可次线性增长最小数据区间拟合差,正则化未充分搜索
计算分配计算增大 10×时,最优模型约 5×、处理样本约 2×解释“更大模型、较早停止”的论文结论依赖临界批量校正、硬件并行条件与论文拟合区间
高效训练对比Appendix B.3 估计:达到同一损失可少 7.7× 参数更新、用 2.7× 参数,并少 65% 训练计算展示模型给出的量级差异是拟合模型下的比较,不是通用工程保证

术语

  • 交叉熵损失(cross-entropy loss):模型给真实下一个 token 分配的概率越高,平均损失越低。
  • 幂律(power law):规模按倍数增长时,指标按相对稳定的比例改善;在双对数坐标上近似直线。
  • 非嵌入参数(non-embedding parameters):作者计算模型规模时排除了词表和位置嵌入,以得到更整齐的缩放趋势。
  • 临界批量(critical batch size):继续增大 batch 后,并行速度收益开始明显递减的位置;论文用它校正时间效率与计算效率的权衡。
  • 收敛前停止:并非随便少训,而是在固定总计算量下,把预算转给更大的模型后,于拟合出的计算效率最优点停止。

复核这篇论文时值得追问

  1. 同样的指数能否在新的 tokenizer、数据混合、上下文长度和架构上复现?
  2. 如果目标从测试损失换成事实性、推理能力或下游任务成功率,趋势是否仍平滑?
  3. 把推理成本、显存、通信、能耗和数据获取成本纳入后,“更大模型、较早停止”是否仍是总成本最优?
  4. 在论文范围之外,哪一个瓶颈最先让幂律弯折:高质量数据、优化、硬件,还是不可约损失?

来源定位

  • 论文元数据与摘要:arXiv:2001.08361
  • 实验设置与范围:PDF §2、§3
  • 基本缩放律与联合拟合:PDF §3–§4
  • 训练时间、临界批量与计算最优分配:PDF §5–§6
  • 作者讨论与限制:PDF §8、Appendix C

关于这篇论文的三个关键问题

语言模型的“规模定律”:把训练当成一项可预测的预算工程 解决了什么问题?

语言模型的结果可能受很多因素影响:参数总量、训练文本、计算预算、网络深宽、注意力头数、上下文长度、批量大小和优化器。若每个因素都独立重要,团队只能靠昂贵的网格搜索找配方。论文因此问了一个更可操作的问题:能否用少数稳定关系,预测规模扩大后损失会怎样变化?

语言模型的“规模定律”:把训练当成一项可预测的预算工程 的核心结论有哪些证据?

图 3|教学重绘。虚线代表假设性外推,不是论文测得的数据;三块警示分别对应论文讨论的数据约束、非零熵下限和“损失不等于任务能力”。来源依据:论文 §6.3、§8、Appendix C。

阅读 语言模型的“规模定律”:把训练当成一项可预测的预算工程 时最需要注意什么局限?

更具体的限制包括:缩放律缺少坚实理论;最小数据区间拟合较差;正则化与数据增强没有被系统优化;计算估算省略了某些与上下文长度相关的项;部分超参数可能未调到最佳;远离已测损失范围时,临界批量的外推也不可靠。[来源:论文 Appendix C] 此外,作者指出幂律最终必须变平,因为自然语言存在非零熵;论文内部的数据需求关系在远外推时也会互相矛盾。[来源:论文 §6.3]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro