返回报告库

AI / Technology

GAN让“造假者”和“鉴别者”一起学会生成

GAN 的输入、生成、判别与反馈回路

图 1|原创教学图。黑色路径表示样本流,蓝色回路表示判别器的梯度如何帮助生成器调整;它不是论文原图。依据:论文 §3 与算法 1。

  1. 两张网络互相训练。 G 负责生成,D 负责鉴别;G 的目标是让 D 犯错。
  2. 生成时一步前向传播即可。 论文所研究的多层感知机版本不需要马尔可夫链,也不需要在生成时做近似推断。[来源:论文摘要、§1]
  3. 漂亮的平衡点不等于容易训练。 理论在无限容量、判别器每步充分优化等理想条件下成立;有限网络的实际优化没有同等保证。[来源:论文 §4、§6]

判别器与生成器交替更新

图 2|原创教学图。先让 D 学会区分,再固定 D、用其反馈更新 G,然后重复;天平强调两方需要保持同步。依据:论文 §3、算法 1、§6。

实际更新。 论文没有在每一轮把 D 训练到完全最优,因为这既昂贵,也可能在有限数据上过拟合;实验采用交替更新,算法 1 中判别器步数超参数取 k=1k=1。论文还指出,训练早期若直接最小化 log(1D(G(z)))\log(1-D(G(z))),梯度可能太弱,因此实际可改为最大化 logD(G(z))\log D(G(z)):固定点相同,但早期梯度更强。[来源:论文 §3、算法 1]

从可区分到分布重合的概念过程

图 3|原创概念图,不是实验曲线。它只表达论文的理论平衡:两分布重合时,D 无法优于随机猜测。依据:论文 §4.1。

理论证据。 对固定生成器,最优判别器为 D(x)=pdata(x)/(pdata(x)+pg(x))D^*(x)=p_{data}(x)/(p_{data}(x)+p_g(x))。代回目标后,优化等价于缩小真实分布与生成分布之间的 Jensen–Shannon 散度;其全局最优点是 pg=pdatap_g=p_{data},此时判别器处处输出 1/21/2。[来源:论文命题 1、定理 1、公式 2–6]

研究附录

论文:Ian J. Goodfellow 等,Generative Adversarial Nets(2014)
原文:arXiv:1406.2661

一、结论先行

这篇论文最重要的改变,是不再要求生成模型直接写出一套容易计算的概率公式,而是把学习变成一场比赛:生成器 G 把随机噪声变成样本,判别器 D 判断样本来自真实数据还是 G;D 的判断再反过来给 G 提供改进方向。[来源:论文摘要、§1、§3]

读完只需记住三点:

  1. 两张网络互相训练。 G 负责生成,D 负责鉴别;G 的目标是让 D 犯错。
  2. 生成时一步前向传播即可。 论文所研究的多层感知机版本不需要马尔可夫链,也不需要在生成时做近似推断。[来源:论文摘要、§1]
  3. 漂亮的平衡点不等于容易训练。 理论在无限容量、判别器每步充分优化等理想条件下成立;有限网络的实际优化没有同等保证。[来源:论文 §4、§6]

二、它要解决什么问题

2014 年前后的深度生成模型常遇到一个尴尬:模型想学习复杂数据分布,但最大似然训练里的一些概率计算难以精确完成;无向模型往往依赖 MCMC,链的混合又可能很慢。另一些方法需要近似推断网络,或要求概率密度至少能写到一个归一化常数。[来源:论文 §1–§2]

GAN 换了问题:与其直接问“这个样本的概率到底是多少”,不如训练一个可学习的评委,让它持续区分真实样本和模型样本。评委越会挑错,生成器获得的学习信号就越有针对性。论文用“造假者与警察”的类比解释这种竞争。[来源:论文 §1]

这并不是说 GAN 自动解决了所有生成建模难题。它用“双模型同步训练”的难题,换掉了显式似然、采样链和部分近似推断的负担。[来源:论文表 2、§6]

三、方法怎样工作

输入与输出。 先从简单先验分布采样噪声 zz,生成器 G(z)G(z) 将其映射到数据空间。判别器 D(x)D(x) 输出一个标量,表示 xx 来自真实数据而非生成器的概率。[来源:论文 §3]

训练目标。 D 希望同时正确识别真实样本和生成样本;G 希望降低 D 识破生成样本的能力。论文把它写成两人极小极大博弈:

minGmaxDV(D,G)=Expdata[logD(x)]+Ezpz[log(1D(G(z)))].\min_G\max_D V(D,G) =\mathbb{E}_{x\sim p_{data}}[\log D(x)] +\mathbb{E}_{z\sim p_z}[\log(1-D(G(z)))].

直观地说,D 学习“哪里不像真的”,G 顺着穿过 D 的梯度把生成结果推向更像真实数据的区域。[来源:论文公式 1、§3]

实际更新。 论文没有在每一轮把 D 训练到完全最优,因为这既昂贵,也可能在有限数据上过拟合;实验采用交替更新,算法 1 中判别器步数超参数取 k=1k=1。论文还指出,训练早期若直接最小化 log(1D(G(z)))\log(1-D(G(z))),梯度可能太弱,因此实际可改为最大化 logD(G(z))\log D(G(z)):固定点相同,但早期梯度更强。[来源:论文 §3、算法 1]

四、证据与边界

理论证据。 对固定生成器,最优判别器为 D(x)=pdata(x)/(pdata(x)+pg(x))D^*(x)=p_{data}(x)/(p_{data}(x)+p_g(x))。代回目标后,优化等价于缩小真实分布与生成分布之间的 Jensen–Shannon 散度;其全局最优点是 pg=pdatap_g=p_{data},此时判别器处处输出 1/21/2。[来源:论文命题 1、定理 1、公式 2–6]

实验信号。 作者在 MNIST、Toronto Face Database(TFD)和 CIFAR-10 上训练模型,并展示随机生成样本;图 2 的最右列还给出邻近训练样本,以检查结果不是简单记忆。作者明确表示,并不声称样本优于既有方法,只认为结果具有竞争力并展示了框架潜力。[来源:论文 §5、图 2]

论文表 1 使用 Gaussian Parzen window 估计测试集对数似然;数值越高越好,但不同数据集之间不可直接比较:

模型MNISTTFD
DBN138 ± 21909 ± 66
Stacked CAE121 ± 1.62110 ± 50
Deep GSN214 ± 1.11890 ± 29
Adversarial nets225 ± 22057 ± 26

来源:论文表 1。MNIST 的误差是跨测试样本计算的均值标准误;TFD 的误差跨数据折计算。

最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]

五、实际意味着什么

对研究者,这篇论文提供的是一种新的训练接口:只要生成过程和判别过程可微,就能用反向传播把一个难以直接评价概率的生成器训练起来;采样时只运行 G。因此它把很多设计自由度从“概率密度是否可解”转移到“生成器、判别器及其优化是否协调”。[来源:论文 §6]

对产品读者,更稳妥的理解是:GAN 证明了“用可学习的评价器监督生成器”这条路线可行,而不是证明任何生成任务都能稳定得到高质量、多样且可信的输出。论文已指出两个具体代价:没有显式的 pg(x)p_g(x),以及 G 与 D 必须保持同步;若 D 训练过头、G 没及时跟上,许多不同噪声可能被映射到相同输出,损失多样性。[来源:论文 §6;产品含义为本文解释]

研究附录:核查清单

  • 一句话问题: 如何绕开深度生成模型中难算的似然、近似推断与马尔可夫链负担?
  • 一句话改动: 用生成器与判别器的极小极大博弈学习数据分布。
  • 最强证据: 理想条件下的全局最优点推导,加上 MNIST、TFD、CIFAR-10 的早期实验。
  • 最大未解风险: 有限容量和交替梯度训练不享有论文非参数分析中的收敛保证,评估指标也较脆弱。
  • 复现时应问: G/D 的更新比例和容量是否平衡?是否同时评估样本质量、多样性与训练集记忆?结果是否依赖 Parzen 带宽或挑选样本?

来源定位与术语

  • 主要来源: arXiv 摘要页;论文 §3(目标与算法)、§4(理论)、§5(实验)、§6(优缺点)。
  • 生成器(generator): 将噪声变量映射成数据空间样本的可微函数。
  • 判别器(discriminator): 估计输入来自真实数据而非生成器的概率。
  • Jensen–Shannon 散度: 衡量两个概率分布差异的对称量;论文的理想化目标在它为零时达到全局最优。
  • 不确定性处理: 本文没有用后来的 GAN 变体或现代指标倒推原论文结论;只陈述 2014 年论文中给出的理论、实验与限制。

关于这篇论文的三个关键问题

GAN:让“造假者”和“鉴别者”一起学会生成 解决了什么问题?

2014 年前后的深度生成模型常遇到一个尴尬:模型想学习复杂数据分布,但最大似然训练里的一些概率计算难以精确完成;无向模型往往依赖 MCMC,链的混合又可能很慢。另一些方法需要近似推断网络,或要求概率密度至少能写到一个归一化常数。[来源:论文 §1–§2]

GAN:让“造假者”和“鉴别者”一起学会生成 的核心结论有哪些证据?

最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]

阅读 GAN:让“造假者”和“鉴别者”一起学会生成 时最需要注意什么局限?

最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro