返回报告库

AI / Technology

Chinchilla在固定算力下,模型不一定越大越好

关于这篇论文的三个关键问题

Chinchilla:在固定算力下,模型不一定越大越好 解决了什么问题?

当时许多大模型主要扩大参数量,训练数据却停留在约 300B tokens:GPT-3 是 175B 参数/300B tokens,Gopher 是 280B/300B,MT-NLG 是 530B/270B。论文认为它们相对于各自算力预算“过大而训练不足”。这里的“训练不足”不是说训练没有完成,而是说:如果把同样算力挪一些给更多 token,最终损失可能更低。[来源:论文第 1–3 页,表 1]

Chinchilla:在固定算力下,模型不一定越大越好 的核心结论有哪些证据?

结果方面,Chinchilla 在 MMLU 的 57 个任务上取得 67.6% 的五样本平均准确率,Gopher 为 60.0%;它在 51/57 个单项上更好、2 项相同、4 项更差。BIG-bench 的 62 项平均准确率是 65.1% 对 54.4%。在 The Pile 的所有评测子集上,Chinchilla 的语言建模表现也优于 Gopher。[来源:论文第 10–12 页,表 6、图 5–7]

阅读 Chinchilla:在固定算力下,模型不一定越大越好 时最需要注意什么局限?

最有说服力的检验是同算力正面对照。Gopher 有 280B 参数、训练约 300B tokens;Chinchilla 有 70B 参数、训练 1.4T tokens。两者训练 FLOPs 相同,Chinchilla 的参数量是四分之一,数据量约为四倍。[来源:论文第 2、8 页,表 1]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro