返回报告库

AI / Technology

一致性模型一步生成,也保留多步改进的余地

扩散模型的多次去噪,与一致性模型的一步映射

图 1|扩散模型沿途多次计算;一致性模型学习一条直达干净结果的映射。这是教学示意,不代表真实图像质量。

  • 它把“逐步去噪”改成了“从轨迹上的任一点直接找回起点”。 因此,随机噪声可以只经过一次网络计算就变成图像。
  • 一步不是唯一模式。 用户仍可增加采样步数,用更多计算换更好的样本,也能做上色、超分辨率和图像补全等编辑。
  • 强结果来自蒸馏版,独立训练版更像方向证明。 在论文的基准上,蒸馏版一两步就明显胜过渐进蒸馏;但独立训练版仍不及强 GAN 和高计算量扩散模型。[来源:摘要;§3;表 1–2]

同一轨迹上的不同状态映射到同一个起点

图 2|蓝色箭头表示:轨迹上的每个状态都被要求还原到同一个起点。

先想象一张清晰图片被逐渐加噪:轻微模糊、严重模糊和几乎纯噪声,都是同一张图在不同时间的状态。论文训练一个函数,让这些状态都返回同一个接近干净图像的起点。这条要求叫“自一致性”。生成时,把纯噪声连同它所在的时间交给模型,一次前向计算就能得到样本。[来源:§3,定义与采样]

一致性蒸馏与独立一致性训练

图 3|上路依赖扩散模型老师;下路可独立训练。图中“相邻状态”是训练对,不是完整采样链。

一致性蒸馏(CD) 先使用预训练扩散模型和数值 ODE 求解器,构造轨迹上相邻的两个状态,再让一致性模型对两者给出接近的输出。一致性训练(CT) 不需要预训练扩散模型;它从真实图像加不同强度的高斯噪声,直接学习相邻噪声层级之间的一致输出。两条路线都使用一个缓慢更新的目标网络来稳定对齐,也都不要求对抗训练。[来源:§4–5;算法 2–3]

一步更快,多步用更多计算换质量

图 4|多步路径不是普通扩散去噪,而是交替加噪与一致性映射。

一步采样追求速度。多步采样则把当前结果重新加到较低噪声水平,再调用模型还原,重复几次以改善质量。论文用贪心搜索挑选这些时间点,并假设下一个时间点对应的 FID 曲线近似单峰;作者明确把更好的选点策略留给未来研究。[来源:§3,算法 1]

一个一致性模型支持多种零样本编辑

图 5|编辑能力来自多步采样中的约束替换;示意图不代表论文原始样例。

论文用同一个在 LSUN Bedroom 上蒸馏的模型展示了灰度上色、32×32 到 256×256 超分辨率和笔触引导生成;附录还展示补全、插值与去噪。这里的“零样本”只表示没有为这些任务单独训练,并不表示任意图片、任意分辨率都能稳定编辑。[来源:§6.3;图 6;附录 D]

研究附录

官方标题: Consistency Models
作者: Yang Song、Prafulla Dhariwal、Mark Chen、Ilya Sutskever
发表: ICML 2023 · arXiv:2303.01469 · 论文正文(PMLR)

核心结论

三句话记住这篇论文

  • 它把“逐步去噪”改成了“从轨迹上的任一点直接找回起点”。 因此,随机噪声可以只经过一次网络计算就变成图像。
  • 一步不是唯一模式。 用户仍可增加采样步数,用更多计算换更好的样本,也能做上色、超分辨率和图像补全等编辑。
  • 强结果来自蒸馏版,独立训练版更像方向证明。 在论文的基准上,蒸馏版一两步就明显胜过渐进蒸馏;但独立训练版仍不及强 GAN 和高计算量扩散模型。[来源:摘要;§3;表 1–2]

问题

扩散模型画得好,但等待来自反复计算

扩散模型从随机噪声出发,一次次去掉噪声。多跑几步通常能提高质量,也让图像编辑变得灵活;代价是生成时要反复调用网络。论文估计,这类迭代生成通常比 GAN、VAE 或归一化流等单步模型多用 10–2000 倍 计算,因此难以服务实时场景。[来源:§1,第 1 页]

旧的加速办法仍有明显代价

更快的 ODE 求解器在论文所述设置下,通常仍需 10 次以上 网络计算才有竞争力。一些蒸馏办法还要先让原扩散模型生成大量合成样本,准备训练数据本身就很贵。渐进蒸馏(PD)避开了这批合成数据,所以论文把它当作最直接的对照。[来源:§2;§6.2]

方法

同一条去噪轨迹上的状态,都应该认出同一个终点

先想象一张清晰图片被逐渐加噪:轻微模糊、严重模糊和几乎纯噪声,都是同一张图在不同时间的状态。论文训练一个函数,让这些状态都返回同一个接近干净图像的起点。这条要求叫“自一致性”。生成时,把纯噪声连同它所在的时间交给模型,一次前向计算就能得到样本。[来源:§3,定义与采样]

两种训练路线:跟老师学,或只看真实数据学

一致性蒸馏(CD) 先使用预训练扩散模型和数值 ODE 求解器,构造轨迹上相邻的两个状态,再让一致性模型对两者给出接近的输出。一致性训练(CT) 不需要预训练扩散模型;它从真实图像加不同强度的高斯噪声,直接学习相邻噪声层级之间的一致输出。两条路线都使用一个缓慢更新的目标网络来稳定对齐,也都不要求对抗训练。[来源:§4–5;算法 2–3]

多走几步时,模型会在“加一点噪声—再还原”之间循环

一步采样追求速度。多步采样则把当前结果重新加到较低噪声水平,再调用模型还原,重复几次以改善质量。论文用贪心搜索挑选这些时间点,并假设下一个时间点对应的 FID 曲线近似单峰;作者明确把更好的选点策略留给未来研究。[来源:§3,算法 1]

证据与局限

一、二步蒸馏结果是最有说服力的证据

FID 越低越好,NFE 是网络计算次数。下表只摘录论文中最直接的同类比较;这些数字来自作者在指定数据集、分辨率和训练设置下的实验,不能直接外推到今天的大型文生图系统。[来源:§6.2,表 1–2]

数据集方法NFEFID
CIFAR-10渐进蒸馏(PD)18.34
CIFAR-10一致性蒸馏(CD)13.55
CIFAR-10渐进蒸馏(PD)25.58
CIFAR-10一致性蒸馏(CD)22.93
ImageNet 64×64渐进蒸馏(PD)115.39
ImageNet 64×64一致性蒸馏(CD)16.20
ImageNet 64×64渐进蒸馏(PD)28.95
ImageNet 64×64一致性蒸馏(CD)24.70

独立训练证明“可以不用老师”,但还没有赢下所有基线

在 CIFAR-10 上,独立训练的 CT 一步 FID 为 8.70、两步为 5.83;它超过论文列出的 VAE、归一化流等单步非对抗模型,却落后于 StyleGAN2-ADA 的 2.92、StyleGAN-XL 的 1.85,也落后于 35 次计算的 EDM 2.04。ImageNet 64×64 上,CT 一步 FID 为 13.0,同样弱于一步 BigGAN-deep 的 4.06。所以更稳妥的结论是:论文建立了一个可独立训练的生成模型家族,而不是证明一步生成全面优于已有方法。[来源:§6.2,表 1–2]

读实验时要带上的四个限制

第一,主实验是 CIFAR-10、ImageNet 64×64 与 LSUN 256×256,不包含高分辨率文生图。第二,最佳蒸馏结果依赖预训练 EDM,质量上限与老师和求解器有关。第三,CT 对离散时间层数和目标网络更新速度敏感,论文分别按分辨率调度超参数。第四,多步时间点靠验证 FID 搜索,作者没有给出通用最优策略。[来源:§6.1;§6.2;§3]

研究依据与核对问题

方法建立在连续时间扩散模型的概率流 ODE 上,并沿用 EDM 的噪声与网络参数化设置;蒸馏实验直接对比渐进蒸馏。复核时最值得追问三件事:换老师模型后优势是否保持?更高分辨率和条件生成是否仍能一步工作?独立训练对超参数的敏感性是否会随规模放大?[来源:§1–2;§3 参数化;§6]

实际意义

它把生成体验从“固定等待”改成了可选择的延迟

对产品最直接的价值是把速度—质量变成档位:预览可以一步出图,最终结果可以多走几步。这个判断是产品解释,不是论文实测的端到端延迟承诺;真实速度还取决于模型大小、硬件、批量和工程优化。

同一个模型还可以承担多种编辑入口

论文用同一个在 LSUN Bedroom 上蒸馏的模型展示了灰度上色、32×32 到 256×256 超分辨率和笔触引导生成;附录还展示补全、插值与去噪。这里的“零样本”只表示没有为这些任务单独训练,并不表示任意图片、任意分辨率都能稳定编辑。[来源:§6.3;图 6;附录 D]

最适合把它看成一种采样范式,而不是质量捷径

一致性模型最重要的改变,是让生成模型原生支持“一步直达”,同时保留多步修正和编辑。它没有消灭速度、质量与训练成本之间的取舍,而是把这个取舍搬到更灵活的位置:训练阶段学会跨越整条轨迹,推理阶段再决定要走一步还是多步。

关于这篇论文的三个关键问题

一致性模型:一步生成,也保留多步改进的余地 解决了什么问题?

扩散模型从随机噪声出发,一次次去掉噪声。多跑几步通常能提高质量,也让图像编辑变得灵活;代价是生成时要反复调用网络。论文估计,这类迭代生成通常比 GAN、VAE 或归一化流等单步模型多用 10–2000 倍 计算,因此难以服务实时场景。[来源:§1,第 1 页]

一致性模型:一步生成,也保留多步改进的余地 的核心结论有哪些证据?

在 CIFAR-10 上,独立训练的 CT 一步 FID 为 8.70、两步为 5.83;它超过论文列出的 VAE、归一化流等单步非对抗模型,却落后于 StyleGAN2-ADA 的 2.92、StyleGAN-XL 的 1.85,也落后于 35 次计算的 EDM 2.04。ImageNet 64×64 上,CT 一步 FID 为 13.0,同样弱于一步 BigGAN-deep 的 4.06。所以更稳妥的结论是:论文建立了一个可独立训练的生成模型家族,而不是证明一步生成全面优于已有方法。[来源:§6.2,表 1–2]

阅读 一致性模型:一步生成,也保留多步改进的余地 时最需要注意什么局限?

FID 越低越好,NFE 是网络计算次数。下表只摘录论文中最直接的同类比较;这些数字来自作者在指定数据集、分辨率和训练设置下的实验,不能直接外推到今天的大型文生图系统。[来源:§6.2,表 1–2]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro