返回报告库

AI / Technology

扩散模型如何在图像生成上击败 GAN

关于这篇论文的三个关键问题

扩散模型如何在图像生成上击败 GAN 解决了什么问题?

2021 年前后,BigGAN、StyleGAN 等模型在高保真图像上很强,但 GAN 的训练依赖生成器与判别器的动态平衡,可能出现训练不稳或“模式坍塌”:几张图很好看,却没有覆盖真实数据里的全部变化。论文因此不只看 FID,还同时报告 precision(样本有多逼真)与 recall(覆盖得有多广)。论文 §1、§5

扩散模型如何在图像生成上击败 GAN 的核心结论有哪些证据?

最有说服力的是 256×256 对比:ADM-G 的 FID 为 4.59,低于 BigGAN 的 6.95;precision 略低,但 recall 从 0.28 提高到 0.52,说明它不是只靠少数“标准答案”刷出好成绩。即使只用 25 次去噪网络前向计算,ADM-G 的 FID 也达到 5.44,仍优于 BigGAN,同时 recall 为 0.49。论文 §5.1、表5

阅读 扩散模型如何在图像生成上击败 GAN 时最需要注意什么局限?

FID 越低越好;precision 和 recall 越高越好。粗略地说,precision 问“生成结果像不像真的”,recall 问“真实世界的变化有没有被覆盖”。同一行的加粗只突出该组对比里的优势,不表示这些指标完美等同于人类判断。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro