AI / Technology
GAN让“造假者”和“鉴别者”一起学会生成
GAN 的输入、生成、判别与反馈回路
图 1|原创教学图。黑色路径表示样本流,蓝色回路表示判别器的梯度如何帮助生成器调整;它不是论文原图。依据:论文 §3 与算法 1。
- 两张网络互相训练。 G 负责生成,D 负责鉴别;G 的目标是让 D 犯错。
- 生成时一步前向传播即可。 论文所研究的多层感知机版本不需要马尔可夫链,也不需要在生成时做近似推断。[来源:论文摘要、§1]
- 漂亮的平衡点不等于容易训练。 理论在无限容量、判别器每步充分优化等理想条件下成立;有限网络的实际优化没有同等保证。[来源:论文 §4、§6]
判别器与生成器交替更新
图 2|原创教学图。先让 D 学会区分,再固定 D、用其反馈更新 G,然后重复;天平强调两方需要保持同步。依据:论文 §3、算法 1、§6。
实际更新。 论文没有在每一轮把 D 训练到完全最优,因为这既昂贵,也可能在有限数据上过拟合;实验采用交替更新,算法 1 中判别器步数超参数取 。论文还指出,训练早期若直接最小化 ,梯度可能太弱,因此实际可改为最大化 :固定点相同,但早期梯度更强。[来源:论文 §3、算法 1]
从可区分到分布重合的概念过程
图 3|原创概念图,不是实验曲线。它只表达论文的理论平衡:两分布重合时,D 无法优于随机猜测。依据:论文 §4.1。
理论证据。 对固定生成器,最优判别器为 。代回目标后,优化等价于缩小真实分布与生成分布之间的 Jensen–Shannon 散度;其全局最优点是 ,此时判别器处处输出 。[来源:论文命题 1、定理 1、公式 2–6]
研究附录
论文:Ian J. Goodfellow 等,Generative Adversarial Nets(2014)
原文:arXiv:1406.2661
一、结论先行
这篇论文最重要的改变,是不再要求生成模型直接写出一套容易计算的概率公式,而是把学习变成一场比赛:生成器 G 把随机噪声变成样本,判别器 D 判断样本来自真实数据还是 G;D 的判断再反过来给 G 提供改进方向。[来源:论文摘要、§1、§3]
读完只需记住三点:
- 两张网络互相训练。 G 负责生成,D 负责鉴别;G 的目标是让 D 犯错。
- 生成时一步前向传播即可。 论文所研究的多层感知机版本不需要马尔可夫链,也不需要在生成时做近似推断。[来源:论文摘要、§1]
- 漂亮的平衡点不等于容易训练。 理论在无限容量、判别器每步充分优化等理想条件下成立;有限网络的实际优化没有同等保证。[来源:论文 §4、§6]
二、它要解决什么问题
2014 年前后的深度生成模型常遇到一个尴尬:模型想学习复杂数据分布,但最大似然训练里的一些概率计算难以精确完成;无向模型往往依赖 MCMC,链的混合又可能很慢。另一些方法需要近似推断网络,或要求概率密度至少能写到一个归一化常数。[来源:论文 §1–§2]
GAN 换了问题:与其直接问“这个样本的概率到底是多少”,不如训练一个可学习的评委,让它持续区分真实样本和模型样本。评委越会挑错,生成器获得的学习信号就越有针对性。论文用“造假者与警察”的类比解释这种竞争。[来源:论文 §1]
这并不是说 GAN 自动解决了所有生成建模难题。它用“双模型同步训练”的难题,换掉了显式似然、采样链和部分近似推断的负担。[来源:论文表 2、§6]
三、方法怎样工作
输入与输出。 先从简单先验分布采样噪声 ,生成器 将其映射到数据空间。判别器 输出一个标量,表示 来自真实数据而非生成器的概率。[来源:论文 §3]
训练目标。 D 希望同时正确识别真实样本和生成样本;G 希望降低 D 识破生成样本的能力。论文把它写成两人极小极大博弈:
直观地说,D 学习“哪里不像真的”,G 顺着穿过 D 的梯度把生成结果推向更像真实数据的区域。[来源:论文公式 1、§3]
实际更新。 论文没有在每一轮把 D 训练到完全最优,因为这既昂贵,也可能在有限数据上过拟合;实验采用交替更新,算法 1 中判别器步数超参数取 。论文还指出,训练早期若直接最小化 ,梯度可能太弱,因此实际可改为最大化 :固定点相同,但早期梯度更强。[来源:论文 §3、算法 1]
四、证据与边界
理论证据。 对固定生成器,最优判别器为 。代回目标后,优化等价于缩小真实分布与生成分布之间的 Jensen–Shannon 散度;其全局最优点是 ,此时判别器处处输出 。[来源:论文命题 1、定理 1、公式 2–6]
实验信号。 作者在 MNIST、Toronto Face Database(TFD)和 CIFAR-10 上训练模型,并展示随机生成样本;图 2 的最右列还给出邻近训练样本,以检查结果不是简单记忆。作者明确表示,并不声称样本优于既有方法,只认为结果具有竞争力并展示了框架潜力。[来源:论文 §5、图 2]
论文表 1 使用 Gaussian Parzen window 估计测试集对数似然;数值越高越好,但不同数据集之间不可直接比较:
| 模型 | MNIST | TFD |
|---|---|---|
| DBN | 138 ± 2 | 1909 ± 66 |
| Stacked CAE | 121 ± 1.6 | 2110 ± 50 |
| Deep GSN | 214 ± 1.1 | 1890 ± 29 |
| Adversarial nets | 225 ± 2 | 2057 ± 26 |
来源:论文表 1。MNIST 的误差是跨测试样本计算的均值标准误;TFD 的误差跨数据折计算。
最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]
五、实际意味着什么
对研究者,这篇论文提供的是一种新的训练接口:只要生成过程和判别过程可微,就能用反向传播把一个难以直接评价概率的生成器训练起来;采样时只运行 G。因此它把很多设计自由度从“概率密度是否可解”转移到“生成器、判别器及其优化是否协调”。[来源:论文 §6]
对产品读者,更稳妥的理解是:GAN 证明了“用可学习的评价器监督生成器”这条路线可行,而不是证明任何生成任务都能稳定得到高质量、多样且可信的输出。论文已指出两个具体代价:没有显式的 ,以及 G 与 D 必须保持同步;若 D 训练过头、G 没及时跟上,许多不同噪声可能被映射到相同输出,损失多样性。[来源:论文 §6;产品含义为本文解释]
研究附录:核查清单
- 一句话问题: 如何绕开深度生成模型中难算的似然、近似推断与马尔可夫链负担?
- 一句话改动: 用生成器与判别器的极小极大博弈学习数据分布。
- 最强证据: 理想条件下的全局最优点推导,加上 MNIST、TFD、CIFAR-10 的早期实验。
- 最大未解风险: 有限容量和交替梯度训练不享有论文非参数分析中的收敛保证,评估指标也较脆弱。
- 复现时应问: G/D 的更新比例和容量是否平衡?是否同时评估样本质量、多样性与训练集记忆?结果是否依赖 Parzen 带宽或挑选样本?
来源定位与术语
- 主要来源: arXiv 摘要页;论文 §3(目标与算法)、§4(理论)、§5(实验)、§6(优缺点)。
- 生成器(generator): 将噪声变量映射成数据空间样本的可微函数。
- 判别器(discriminator): 估计输入来自真实数据而非生成器的概率。
- Jensen–Shannon 散度: 衡量两个概率分布差异的对称量;论文的理想化目标在它为零时达到全局最优。
- 不确定性处理: 本文没有用后来的 GAN 变体或现代指标倒推原论文结论;只陈述 2014 年论文中给出的理论、实验与限制。
关于这篇论文的三个关键问题
GAN:让“造假者”和“鉴别者”一起学会生成 解决了什么问题?
2014 年前后的深度生成模型常遇到一个尴尬:模型想学习复杂数据分布,但最大似然训练里的一些概率计算难以精确完成;无向模型往往依赖 MCMC,链的混合又可能很慢。另一些方法需要近似推断网络,或要求概率密度至少能写到一个归一化常数。[来源:论文 §1–§2]
GAN:让“造假者”和“鉴别者”一起学会生成 的核心结论有哪些证据?
最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]
阅读 GAN:让“造假者”和“鉴别者”一起学会生成 时最需要注意什么局限?
最大边界。 这些数字不能被读成“GAN 已全面胜出”:Parzen 估计方差较高,在高维空间表现不好;CIFAR-10 主要给出定性样本,没有表 1 的对应数值。更重要的是,收敛论证假设 G、D 容量充足,且每一步 D 能在给定 G 时达到最优;论文自己承认,有限多层感知机的参数空间有多个临界点,实际没有同样的保证。[来源:论文 §4.2、§5]