返回报告库

AI / Technology

改进的去噪扩散概率模型

论文核心权衡:质量、速度与覆盖

这篇论文没有换掉扩散模型的基本框架,而是调整三个关键部位:让模型学习每一步该保留多少随机性;用更平缓的方式加噪;训练时兼顾图片质量与概率似然。结果是,模型既能更快生成图片,也更少遗漏数据中的不同类型。[来源:摘要;第 3、4、5 节]

从图片逐步加噪,再学习反向去噪

先把一张真实图片逐步加噪,直到只剩随机噪点;模型再学习把这个过程倒放。生成时,它从纯噪声出发,一步步猜回清晰图片。原始 DDPM 已能生成高质量样本,但一次生成通常要走很多次网络计算。[来源:第 1、2 节]

三项改动共同进入同一个去噪模型

完整采样路径与稀疏采样路径

模型仍用 4000 个扩散步训练,但生成时只取一组均匀分布的时间点。因为学到的方差会按新间隔重新缩放,少走很多步时,质量下降比固定方差模型小。完整训练的 L_hybrid 模型用 100 步已达到接近最优的 FID,生成时间从数分钟降到数秒量级,而且不需要微调。[来源:第 4 节,图 8]

精度关注落点是否准确,召回关注覆盖是否广

可以把 precision 理解为“生成的东西有多少落在真实数据附近”,把 recall 理解为“真实数据的不同区域有多少被生成器碰到”。在分类条件 ImageNet 64×64、5 万张生成样本的比较中,Improved Diffusion 大模型的 FID 为 2.92、precision 为 0.82、recall 为 0.71;BigGAN-deep 分别是 4.06、0.86、0.59。扩散模型在这个设置中覆盖更广,但 GAN 的 precision 略高。[来源:第 5 节表 4]

哪些结果已验证,哪些场景需要重新测试

如果采样太慢,先比较固定方差与学习方差在稀疏时间步下的退化速度。如果训练前段过快丢失信息,再检查噪声日程,而不是只增加总步数。如果 NLL 与画质互相拉扯,就分别报告 NLL、FID 与覆盖指标,不要用一个分数代替全部目标。这是从论文结果提炼出的工程解释,不是作者对所有任务的保证。

研究附录

原文标题: Improved Denoising Diffusion Probabilistic Models
作者: Alex Nichol、Prafulla Dhariwal
发表: ICML 2021(PMLR 139)
论文: arXiv:2102.09672 · PMLR 正文

核心结论

这篇论文没有换掉扩散模型的基本框架,而是调整三个关键部位:让模型学习每一步该保留多少随机性;用更平缓的方式加噪;训练时兼顾图片质量与概率似然。结果是,模型既能更快生成图片,也更少遗漏数据中的不同类型。[来源:摘要;第 3、4、5 节]

三句话记住这篇论文

  1. 方差不再写死。 模型自己决定每一步反向去噪的不确定性,跳过大量中间步时更稳。[来源:第 3.1、4 节]
  2. 噪声不再加得过急。 余弦日程让图像信息在中段保留得更久;混合目标则避免只追似然时训练过于嘈杂。[来源:第 3.2、3.3 节]
  3. 证据同时指向速度与覆盖。 训练用 4000 步的模型,在完整训练后用 100 个采样步已接近最佳 FID;在分类条件 ImageNet 64×64 实验里,大模型的 recall 为 0.71,高于 BigGAN-deep 的 0.59。[来源:第 4 节图 8;第 5 节表 4]

问题

扩散模型到底怎样生成图片?

先把一张真实图片逐步加噪,直到只剩随机噪点;模型再学习把这个过程倒放。生成时,它从纯噪声出发,一步步猜回清晰图片。原始 DDPM 已能生成高质量样本,但一次生成通常要走很多次网络计算。[来源:第 1、2 节]

原方法卡在哪里?

原始 DDPM 的反向方差由人工固定,训练常用偏向视觉质量的简化损失。它在 ImageNet 64×64 上训练 20 万次时,NLL 为 3.99 bits/dim;把扩散步数从 1000 增到 4000 后,NLL 改善到 3.77,却也让完整采样更慢。论文称,4000 步模型在当时的现代 GPU 上生成一张图要数分钟。[来源:第 3 节,第 4 节开头]

这里有两个不同问题。NLL 反映模型给真实数据分配概率的能力,数值越低越好;FID 更接近样本整体质量与分布差距,也通常越低越好。只优化其中一个,另一个可能变差。[来源:第 3.4 节表 1、2]

方法

改动一:每一步的方差由模型选择

反向去噪不是只猜“更干净的图片长什么样”,还要决定这一步保留多少随机性。论文不让网络任意输出方差,而是让它在两个有理论依据的边界之间插值。这个受约束的选择更容易学习,也会随稀疏采样的新步长自动缩放。[来源:第 3.1 节,式 14;第 4 节,式 18]

改动二:余弦日程让信息慢一点消失

原来的线性日程在低分辨率图像上过早破坏信息:论文发现,跳过反向过程最前面的 20%,FID 几乎没有恶化,说明那一段学到的有效工作不多。余弦日程让信号在中段更均匀地衰减,并在两端变化更缓;作者也明确说,选 cos² 只是为了合适的形状,其他相似形状可能同样有效。[来源:第 3.2 节,图 3—5]

改动三:混合目标先守住画质,再改善似然

直接优化变分下界(L_vlb)本应最利于 NLL,却在多样的 ImageNet 64×64 上产生更大的梯度噪声。论文因此把简化的噪声预测损失与一小部分变分下界合并为 L_hybrid。若坚持直接优化 L_vlb,则按各时间步近期损失的平方均值做重要性采样,减少训练抖动。[来源:第 3.1、3.3 节,图 6—7,式 15、17]

快速采样:训练走全程,生成只走稀疏节点

模型仍用 4000 个扩散步训练,但生成时只取一组均匀分布的时间点。因为学到的方差会按新间隔重新缩放,少走很多步时,质量下降比固定方差模型小。完整训练的 L_hybrid 模型用 100 步已达到接近最优的 FID,生成时间从数分钟降到数秒量级,而且不需要微调。[来源:第 4 节,图 8]

证据与局限

消融实验显示了什么?

在 ImageNet 64×64、20 万次训练的对照中,基线是 1000 步、线性日程、L_simple:NLL 3.99、FID 32.5。换成 4000 步、余弦日程和 L_hybrid 后,NLL 为 3.62、FID 为 28.0。训练到 150 万次后,该组合达到 NLL 3.57、FID 19.2。直接优化重采样后的 L_vlb 可把 NLL 推到 3.53,但 FID 变差到 40.1,清楚展示了似然与样本质量的取舍。[来源:第 3.4 节表 1]

ImageNet 64×64 设置训练次数NLL ↓(bits/dim)FID ↓
基线:1000 步、线性、L_simple200K3.9932.5
4000 步、余弦、L_hybrid200K3.6228.0
4000 步、余弦、L_hybrid1.5M3.5719.2
4000 步、余弦、重采样 L_vlb1.5M3.5340.1

“覆盖更广”是怎样测出来的?

可以把 precision 理解为“生成的东西有多少落在真实数据附近”,把 recall 理解为“真实数据的不同区域有多少被生成器碰到”。在分类条件 ImageNet 64×64、5 万张生成样本的比较中,Improved Diffusion 大模型的 FID 为 2.92、precision 为 0.82、recall 为 0.71;BigGAN-deep 分别是 4.06、0.86、0.59。扩散模型在这个设置中覆盖更广,但 GAN 的 precision 略高。[来源:第 5 节表 4]

模型FID ↓Precision ↑Recall ↑
BigGAN-deep4.060.860.59
Improved Diffusion(大)2.920.820.71

最大的不确定性在哪里?

这些结果主要来自 CIFAR-10 和 64×64 ImageNet;GAN 对比还是分类条件生成,并非今天常见的文本条件高分辨率系统。100 步“接近最佳”来自论文当时的模型与 FID 曲线,不等于所有扩散模型都能安全缩到 100 步。论文的 scaling 结果也被作者称为初步结果:FID 随算力的趋势比 NLL 更规整,NLL 的改善可能受不可约损失或过拟合影响。[来源:第 4—6 节,图 8、10]

实际意义

做扩散系统时,先复测这三个旋钮

如果采样太慢,先比较固定方差与学习方差在稀疏时间步下的退化速度。如果训练前段过快丢失信息,再检查噪声日程,而不是只增加总步数。如果 NLL 与画质互相拉扯,就分别报告 NLL、FID 与覆盖指标,不要用一个分数代替全部目标。这是从论文结果提炼出的工程解释,不是作者对所有任务的保证。

阅读指标时,别把“更好”压成一个词

这篇论文最有价值的地方,不是宣称扩散模型全面胜过 GAN,而是把三个目标拆开测:图片是否像真的、数据类型是否覆盖得全、生成要走多少步。实际选型也应保留这三个维度;某个产品可能更在意单张质量,另一个产品可能更怕漏掉长尾样本。

研究脉络

  • Sohl-Dickstein 等人在 2015 年提出扩散概率模型;本文沿用“逐步加噪,再学习逆过程”的基本框架。[来源:第 1 节;参考文献 Sohl-Dickstein et al., 2015]
  • Ho、Jain 与 Abbeel 的 DDPM 是本文直接改进的基线;本文保留其噪声预测方式,并修改方差、日程与训练目标。[来源:第 1—3 节;参考文献 Ho et al., 2020]
  • 本文采用 Kynkäänniemi 等人的 improved precision and recall 指标比较扩散模型与 GAN 的分布覆盖。[来源:第 5 节;参考文献 Kynkäänniemi et al., 2019]
  • Song 与 Ermon 的去噪分数匹配工作解释了简化噪声预测目标的联系;本文经由 DDPM 延续这条训练思路。[来源:第 1、2.2 节;参考文献 Song & Ermon, 2019, 2020]

术语与核验问题

  • NLL(负对数似然):越低越好,衡量模型给真实数据分配概率的能力。
  • FID:越低越好,比较真实与生成特征分布;它不单独告诉你遗漏了哪些模式。
  • Precision / Recall:前者偏向样本逼真程度,后者偏向数据分布覆盖。
  • 建议核验:换成更高分辨率或文本条件任务后,100 步是否仍接近最佳?学习方差的收益来自更好的概率建模,还是主要来自更耐跳步?更高 recall 是否伴随用户可感知的质量变化?

来源

关于这篇论文的三个关键问题

改进的去噪扩散概率模型 解决了什么问题?

先把一张真实图片逐步加噪,直到只剩随机噪点;模型再学习把这个过程倒放。生成时,它从纯噪声出发,一步步猜回清晰图片。原始 DDPM 已能生成高质量样本,但一次生成通常要走很多次网络计算。[来源:第 1、2 节]

改进的去噪扩散概率模型 的核心结论有哪些证据?

在 ImageNet 64×64、20 万次训练的对照中,基线是 1000 步、线性日程、Lsimple:NLL 3.99、FID 32.5。换成 4000 步、余弦日程和 Lhybrid 后,NLL 为 3.62、FID 为 28.0。训练到 150 万次后,该组合达到 NLL 3.57、FID 19.2。直接优化重采样后的 Lvlb 可把 NLL 推到 3.53,但 FID 变差到 40.1,清楚展示了似然与样本质量的取舍。[来源:第 3.4 节表 1]

阅读 改进的去噪扩散概率模型 时最需要注意什么局限?

这些结果主要来自 CIFAR-10 和 64×64 ImageNet;GAN 对比还是分类条件生成,并非今天常见的文本条件高分辨率系统。100 步“接近最佳”来自论文当时的模型与 FID 曲线,不等于所有扩散模型都能安全缩到 100 步。论文的 scaling 结果也被作者称为初步结果:FID 随算力的趋势比 NLL 更规整,NLL 的改善可能受不可约损失或过拟合影响。[来源:第 4—6 节,图 8、10]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro