AI / Technology
GLIDE迈向由文字引导扩散模型生成与编辑照片级图像
文字提示经过随机噪声和多步去噪,逐渐形成目标图像
图 1|阅读这篇论文的最短路径:文字不是在最后筛图,而是在去噪过程中持续影响图像。教学示意,并非论文原图。来源:论文第 1、2.1、4.1 节。
- GLIDE 把“逐步去噪”变成了听得懂文字的画图过程。 模型从随机噪声出发,每一步都参考文本,最后得到与描述相符的图像。
- 让同一个模型同时判断“有文字”和“没文字”更有效。 论文中的人类评测偏好无分类器引导,而不是依赖另一套 CLIP 模型来带路。
- 它不只会从零画图,也能按文字补图。 用户可以遮住局部,再让模型补入新内容;但复杂反常物体、速度、偏见和伪造风险仍没有解决。
外部 CLIP 引导与无分类器引导的结构对比
图 2|左侧需要一套独立的图文判断器;右侧由同一个扩散模型给出“有提示”和“空提示”两条方向,再把差值放大。教学示意,并非论文原图。来源:论文第 2.3、2.4 节。
引导越强,图像通常越贴近提示,但样本也可能更单一,甚至迎合评分模型的漏洞。论文把这个矛盾写成“保真度与多样性的权衡”,并直接比较两种带路方式:让外部 CLIP 模型给方向,或让生成模型自己比较有文字和没文字时的去噪方向。来源:论文第 2.2–2.4、5.2 节
从随机颗粒逐渐收拢成清晰茶壶的去噪直觉
图 3|每一步只修正一部分噪声,许多小修正最终形成完整图像;蓝色轨迹表示文字持续提供方向。概念类比,并非对内部张量的精确可视化。来源:论文第 2.1 节。
训练时,系统给真实图像逐步加高斯噪声,并让模型预测加入了什么噪声。生成时则反过来:从纯噪声开始,多次去掉预测噪声。可以把它想成一团散乱颗粒慢慢收拢成物体;文字决定颗粒应朝哪个合理画面收拢。这类方法的正式名称是扩散模型。来源:论文第 2.1 节
客厅图像经过遮罩后补入一幅画
图 4|原图、待补区域、文字控制的补图结果。教学示意,并非 GLIDE 的实际输出或论文原图。来源:论文第 4.3 节。
为了编辑图片,作者随机擦除训练图像的一块区域,再把未擦除的 RGB 图像和遮罩作为额外输入。这样,模型在补空缺时能同时看见完整上下文,而不是只看被加噪的周围区域。论文示例显示,它能补入新物体,并匹配原图的风格、光线、阴影和反射;这些是展示结果,不代表每次编辑都能成功。来源:论文第 4.3、5.1 节及图 2–4
自动评分与人类判断可能出现分歧
图 5|自动指标变好,不等于人看起来更真实、更符合描述。教学示意,不呈现具体实验数值。来源:论文第 5.2 节。
在 MS-COCO 验证提示上,最佳设置的人类评测 Elo 分数如下。无分类器引导在“像照片”和“符合描述”两项都高于 CLIP 引导。与此同时,CLIP 引导反而能得到更高的 CLIP 自动分数。作者据此怀疑,CLIP 引导可能在迎合评测模型,而不是真的更符合人类判断;这是有实验支持的解释,但论文没有直接证明对抗样本机制。来源:论文第 5.2 节、表 1
异常物体、慢速采样以及伪造与偏见风险
图 6|三类不能被漂亮样例遮住的问题:复杂反常结构、计算延迟、社会风险。教学示意,并非论文原图。来源:论文第 6、7 节。
模型会在不寻常场景中失败,例如八条腿的猫或三角轮汽车。未经优化的版本在单张 A100 GPU 上生成一张图约需 15 秒,明显慢于一次前向计算就能出图的 GAN。论文还发现,过滤后的公开小模型仍会保留甚至放大数据偏见;逼真的生成和补图也降低了制造虚假信息与深度伪造的门槛。来源:论文第 6、7 节及图 8
研究附录
官方题名: GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
作者: Alex Nichol、Prafulla Dhariwal、Aditya Ramesh、Pranav Shyam、Pamela Mishkin、Bob McGrew、Ilya Sutskever、Mark Chen
来源: arXiv:2112.10741,v3,2022-03-08
领域: 文本生成图像、扩散模型、图像编辑
核心结论
三个值得记住的结论
- GLIDE 把“逐步去噪”变成了听得懂文字的画图过程。 模型从随机噪声出发,每一步都参考文本,最后得到与描述相符的图像。
- 让同一个模型同时判断“有文字”和“没文字”更有效。 论文中的人类评测偏好无分类器引导,而不是依赖另一套 CLIP 模型来带路。
- 它不只会从零画图,也能按文字补图。 用户可以遮住局部,再让模型补入新内容;但复杂反常物体、速度、偏见和伪造风险仍没有解决。
问题
会听描述的模型,当时还不够像真的
2021 年前后的文字生成图像模型已经能把不相关的物体组合起来,却经常漏掉描述细节,也难以稳定生成照片般自然的光影和纹理。另一边,无条件图像模型已经很逼真,但用户没法用自由文字精确指定内容。GLIDE 的问题因此很具体:能不能把扩散模型的逼真度,与自然语言的开放控制放进同一套系统?来源:论文第 1 节
“像描述”与“像照片”并不是同一个目标
引导越强,图像通常越贴近提示,但样本也可能更单一,甚至迎合评分模型的漏洞。论文把这个矛盾写成“保真度与多样性的权衡”,并直接比较两种带路方式:让外部 CLIP 模型给方向,或让生成模型自己比较有文字和没文字时的去噪方向。来源:论文第 2.2–2.4、5.2 节
方法
先学会把噪声一点点擦掉
训练时,系统给真实图像逐步加高斯噪声,并让模型预测加入了什么噪声。生成时则反过来:从纯噪声开始,多次去掉预测噪声。可以把它想成一团散乱颗粒慢慢收拢成物体;文字决定颗粒应朝哪个合理画面收拢。这类方法的正式名称是扩散模型。来源:论文第 2.1 节
文字既进入网络,也决定去噪方向
GLIDE 先用 Transformer 把提示词编码成一串特征。最后一个文本特征替代原 ADM 架构中的类别特征;整串词特征还会送入网络各层的注意力模块。主模型有 35 亿参数,先生成低分辨率图像,再由一个 15 亿参数的扩散上采样模型放大。论文报告基础模型训练 250 万次迭代、批量 2048,上采样模型训练 160 万次迭代、批量 512。来源:论文第 4.1 节
微调时,作者把 20% 的文字替换为空序列,让同一个模型既学会“按描述去噪”,也学会“没有描述时去噪”。采样时,系统比较两次预测,并沿着有文字的方向继续推远。这个办法叫无分类器引导。它不需要另训一个分类器,也避免把全部控制交给外部 CLIP 打分器。来源:论文第 2.3、4.2 节
补图把已有画面也交给模型看
为了编辑图片,作者随机擦除训练图像的一块区域,再把未擦除的 RGB 图像和遮罩作为额外输入。这样,模型在补空缺时能同时看见完整上下文,而不是只看被加噪的周围区域。论文示例显示,它能补入新物体,并匹配原图的风格、光线、阴影和反射;这些是展示结果,不代表每次编辑都能成功。来源:论文第 4.3、5.1 节及图 2–4
证据与局限
人类评测支持无分类器引导
在 MS-COCO 验证提示上,最佳设置的人类评测 Elo 分数如下。无分类器引导在“像照片”和“符合描述”两项都高于 CLIP 引导。与此同时,CLIP 引导反而能得到更高的 CLIP 自动分数。作者据此怀疑,CLIP 引导可能在迎合评测模型,而不是真的更符合人类判断;这是有实验支持的解释,但论文没有直接证明对抗样本机制。来源:论文第 5.2 节、表 1
| 引导方式 | 照片真实感 Elo | 描述匹配 Elo |
|---|---|---|
| 不引导 | -88.6 | -106.2 |
| CLIP 引导 | -73.2 | 29.3 |
| 无分类器引导 | 82.7 | 110.9 |
与 DALL·E 的对比很亮眼,但边界要说清
在给 DALL·E 使用 CLIP 重排的设置下,GLIDE 被人类评审判为更真实的概率是 87%,更符合描述的概率是 69%。论文也报告 GLIDE 为 35 亿参数,DALL·E 为 120 亿参数,两者训练计算量大致相当;GLIDE 不需要从 256 个候选中用 CLIP 重排。这个结果支持“该评测设置下 GLIDE 更受偏好”,却不能自动外推到所有提示、所有用户或后来的模型。来源:论文第 1、5.2 节及表 3
零样本 MS-COCO 的 FID 为 12.24;去掉与训练图像相似的验证样本后,FID 变为 12.89。作者指出,过滤使验证集缩小 21%,分数变化可能部分来自小参考集带来的 FID 偏差。因此,这组数字更适合看作稳健性检查,不宜解读成模型记住了或完全没有记住训练集。来源:论文第 5.2 节、表 2
速度、反常组合和安全问题仍是硬限制
模型会在不寻常场景中失败,例如八条腿的猫或三角轮汽车。未经优化的版本在单张 A100 GPU 上生成一张图约需 15 秒,明显慢于一次前向计算就能出图的 GAN。论文还发现,过滤后的公开小模型仍会保留甚至放大数据偏见;逼真的生成和补图也降低了制造虚假信息与深度伪造的门槛。来源:论文第 6、7 节及图 8
实际意义
它把一次出图变成了可以来回修改的过程
对创作者而言,GLIDE 最有启发的地方不只是“输入一句话,得到一张图”,而是先生成大致场景,再用遮罩和新提示反复补图。论文图 3 展示了这种迭代:从客厅开始,依次加入墙画、茶几和花瓶。这说明生成与编辑可以共享一套模型,也为后来更可控的视觉创作工具打开了产品路径。来源:论文第 1、5.1 节及图 3
采用这类系统前,应先问五个问题
- 你的真实目标是“自动指标高”,还是“人觉得符合需求”?两者可能冲突。
- 用户需要一次出图,还是需要遮罩、重试和局部编辑?复杂需求通常依赖后者。
- 15 秒级单图延迟和多次采样成本,是否符合交互场景?
- 对人物、文化符号和性别等内容,是否有单独的偏见测试?
- 即使过滤训练数据,补图能力与外部模型组合后会不会重新带来滥用路径?
这些问题是基于论文结果给产品与研究团队的检查清单,不是作者验证过的部署方案。
研究脉络与复核入口
GLIDE 直接采用或扩展了多项前序工作:Gaussian 扩散模型、Improved DDPM 的学习方差与上采样方法、ADM 架构、无分类器引导,以及 SDEdit 的草图控制思路。详细关系见 relationships.json;其中只保留论文正文或参考文献明确支持的连接。
复核时最值得继续问:人类评测用了多少评审与多少配对?不同语言和长提示是否保持优势?无分类器引导为何放大某些偏见?补图在真实照片上的失败率如何?这些信息在主结果中没有完整回答,应视为后续验证项。
关于这篇论文的三个关键问题
GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 解决了什么问题?
引导越强,图像通常越贴近提示,但样本也可能更单一,甚至迎合评分模型的漏洞。论文把这个矛盾写成“保真度与多样性的权衡”,并直接比较两种带路方式:让外部 CLIP 模型给方向,或让生成模型自己比较有文字和没文字时的去噪方向。来源:论文第 2.2–2.4、5.2 节
GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 的核心结论有哪些证据?
在给 DALL·E 使用 CLIP 重排的设置下,GLIDE 被人类评审判为更真实的概率是 87%,更符合描述的概率是 69%。论文也报告 GLIDE 为 35 亿参数,DALL·E 为 120 亿参数,两者训练计算量大致相当;GLIDE 不需要从 256 个候选中用 CLIP 重排。这个结果支持“该评测设置下 GLIDE 更受偏好”,却不能自动外推到所有提示、所有用户或后来的模型。来源:论文第 1、5.2 节及表 3
阅读 GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 时最需要注意什么局限?
图 5|自动指标变好,不等于人看起来更真实、更符合描述。教学示意,不呈现具体实验数值。来源:论文第 5.2 节。