返回报告库

AI / Technology

ZeRO 真正在做什么:长期分开存,计算时临时拼齐

用分布式系统的话说,ZeRO 把训练从“每张 GPU 都复制完整状态”,改成“状态分片保存,需要计算当前层时再临时物化”。它解决的是状态管理问题,不是让模型换一种学习方法。

关于这篇论文的三个关键问题

ZeRO 真正在做什么:长期分开存,计算时临时拼齐 解决了什么问题?

先只看“训练结束一小步后,必须继续留在显存里的东西”:模型参数、梯度,以及 Adam 保存的历史记录。把它们合称为训练状态,再假设整套状态只有 A、B、C、D 四块。

ZeRO 真正在做什么:长期分开存,计算时临时拼齐 的核心结论有哪些证据?

7.5B 模型在 64 路数据并行下,论文估算标准 DP 每卡需 120GB;依次分摊优化器状态、梯度和参数后,降为 31.4GB、16.6GB、1.9GB。 论文第 4 节(内存分片)与第 5 节(通信分析)

阅读 ZeRO 真正在做什么:长期分开存,计算时临时拼齐 时最需要注意什么局限?

图中的 A、B、C、D 是为了讲机制而构造的小例子,不代表论文真实模型只有四块。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro