返回报告库

AI / Technology

GLIDE迈向由文字引导扩散模型生成与编辑照片级图像

关于这篇论文的三个关键问题

GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 解决了什么问题?

引导越强,图像通常越贴近提示,但样本也可能更单一,甚至迎合评分模型的漏洞。论文把这个矛盾写成“保真度与多样性的权衡”,并直接比较两种带路方式:让外部 CLIP 模型给方向,或让生成模型自己比较有文字和没文字时的去噪方向。来源:论文第 2.2–2.4、5.2 节

GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 的核心结论有哪些证据?

在给 DALL·E 使用 CLIP 重排的设置下,GLIDE 被人类评审判为更真实的概率是 87%,更符合描述的概率是 69%。论文也报告 GLIDE 为 35 亿参数,DALL·E 为 120 亿参数,两者训练计算量大致相当;GLIDE 不需要从 256 个候选中用 CLIP 重排。这个结果支持“该评测设置下 GLIDE 更受偏好”,却不能自动外推到所有提示、所有用户或后来的模型。来源:论文第 1、5.2 节及表 3

阅读 GLIDE:迈向由文字引导扩散模型生成与编辑照片级图像 时最需要注意什么局限?

图 5|自动指标变好,不等于人看起来更真实、更符合描述。教学示意,不呈现具体实验数值。来源:论文第 5.2 节。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro