返回报告库

AI / Technology

改进的去噪扩散概率模型

关于这篇论文的三个关键问题

改进的去噪扩散概率模型 解决了什么问题?

先把一张真实图片逐步加噪,直到只剩随机噪点;模型再学习把这个过程倒放。生成时,它从纯噪声出发,一步步猜回清晰图片。原始 DDPM 已能生成高质量样本,但一次生成通常要走很多次网络计算。[来源:第 1、2 节]

改进的去噪扩散概率模型 的核心结论有哪些证据?

在 ImageNet 64×64、20 万次训练的对照中,基线是 1000 步、线性日程、Lsimple:NLL 3.99、FID 32.5。换成 4000 步、余弦日程和 Lhybrid 后,NLL 为 3.62、FID 为 28.0。训练到 150 万次后,该组合达到 NLL 3.57、FID 19.2。直接优化重采样后的 Lvlb 可把 NLL 推到 3.53,但 FID 变差到 40.1,清楚展示了似然与样本质量的取舍。[来源:第 3.4 节表 1]

阅读 改进的去噪扩散概率模型 时最需要注意什么局限?

这些结果主要来自 CIFAR-10 和 64×64 ImageNet;GAN 对比还是分类条件生成,并非今天常见的文本条件高分辨率系统。100 步“接近最佳”来自论文当时的模型与 FID 曲线,不等于所有扩散模型都能安全缩到 100 步。论文的 scaling 结果也被作者称为初步结果:FID 随算力的趋势比 NLL 更规整,NLL 的改善可能受不可约损失或过拟合影响。[来源:第 4—6 节,图 8、10]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro