返回报告库

AI / Technology

VAE 的关键一步让随机采样也能反向传播

共享编码器把逐样本推断变成一次前向计算 {#2-问题-看不见的变量-让学习卡在积分与采样上}

图 1|AEVB 的工作流。上方是论文方法:所有样本共享编码器,编码器与解码器联合训练;下方淡化并划掉的是教学性对比,表示避免为每个样本各自运行迭代推断。图为基于论文 §1–2 的原创解释,不是论文原图。

第一项鼓励从 z 还原 x,第二项约束近似后验不要偏离先验。问题随即变成:怎样对含随机采样的期望,得到方差够低、又能对 φ 求导的梯度?朴素 Monte Carlo 梯度估计在这里方差很高,论文明确称其不实用。来源:§2.2,式 (1)–(3)

重参数化前后,梯度路径的差别 {#3-方法-把-随机节点-改写成-固定噪声的函数}

图 2|高斯重参数化的计算关系。黑线表示前向采样,蓝线表示反向梯度;准确关系是 εσ 先相乘,再与 μ 相加得到 z。上半部分用“受阻”表达直接采样对参数梯度不友好;这是计算直觉图,不表示随机采样在数学上不可微分的所有情形。来源:论文 §2.4。

模块一|重参数化。qφ(z|x) 是对角高斯,编码器输出均值 μ(x) 与标准差 σ(x)。不直接写“从这个高斯中采样”,而是先取 ε ~ N(0, I),再令 z = μ + σ ⊙ ε。对一次抽到的 ε 来说,zμ、σ 的普通可微函数,因此重建损失的梯度能沿着 z 回到编码器参数 φ来源:§2.3–2.4,式 (4)–(7)、(9)–(10)

ELBO 的两股力量与论文证据边界 {#4-证据与边界-更快收敛-但证据范围不宽}

图 3|上方是 ELBO 的教学性比喻:重建项与贴近先验的 KL 项共同决定下界。下方实线区域对应论文实际测试的 MNIST 与 Frey Face;雾区中的更深层级模型和时间序列来自作者“未来工作”,不是本文已验证结果。来源:§2.3、§5、§7。

论文还用估计边际似然比较 AEVB、wake-sleep 与 Monte Carlo EM;但这项估计只在很低维潜空间可靠。实验采用 3 个潜变量,附录明确写道估计器在采样空间低于 5 维、且样本足够多时才给出良好估计;更高维时作者认为结果不可靠。MCEM 也无法高效用于完整 MNIST。来源:§5“Marginal likelihood”、附录 D、图 3

研究附录

论文:Diederik P. Kingma、Max Welling,Auto-Encoding Variational Bayes(arXiv:1312.6114,v11)
原文:摘要页 · 全文
阅读提示:本文区分“论文报告的结果”和“面向实践的解释”;后者不会冒充作者结论。

1. 一句话带走

这篇论文解决的不是“怎样把图片压缩再还原”这么简单,而是:当潜变量不可见、真实后验又算不出来时,怎样仍用小批量数据和普通反向传播,同时训练生成模型与推断模型。 它给出的关键动作,是把一次依赖模型参数的随机采样改写成“与参数无关的噪声 + 可微的确定性变换”。这样,随机节点不再切断梯度;再配上一个共享编码器,模型无需为每个样本重新跑一轮昂贵推断。来源:摘要、§1、§2.3–2.4

记住三点:

  1. 重参数化让梯度穿过采样。 高斯情形写成 z = μ + σ ⊙ ε,其中 ε 来自固定的标准正态分布;随机性被移到参数之外。来源:§2.4,式 (4)–(5)
  2. 编码器把推断成本“摊薄”到所有样本。 它从 x 一次性给出近似后验的参数,而不是给每个新样本单独迭代求后验;这就是摊销推断的核心直觉。来源:§1、§2.1、算法 1
  3. 目标同时要求“还原得像”和“潜空间守规矩”。 变分下界包含期望重建项与 KL 正则项;实验支持方法更快达到更好的训练下界,但并没有证明所有数据、网络或离散潜变量上都成立。来源:§2.3、图 2、§4–7

2. 问题:看不见的变量,让学习卡在积分与采样上

生成模型假设观测 x 是由潜变量 z 产生的:先从先验 p(z) 取一个 z,再由 pθ(x|z) 生成 x。学习时却反过来需要知道 pθ(z|x)。对带非线性神经网络的模型,这个真实后验以及边际似然中的积分通常不可解;传统均值场变分方法所需的期望也可能不可解,而 MCMC 又往往要对每个样本运行采样循环,难以扩展到大数据。来源:§1、§2.1

论文引入近似后验 qφ(z|x)。它不是把难题完全消掉,而是最大化一个可计算的替代目标——证据下界(ELBO):

ELBO = E_q[log pθ(x|z)] − KL(qφ(z|x) || p(z)) ≤ log pθ(x)

第一项鼓励从 z 还原 x,第二项约束近似后验不要偏离先验。问题随即变成:怎样对含随机采样的期望,得到方差够低、又能对 φ 求导的梯度?朴素 Monte Carlo 梯度估计在这里方差很高,论文明确称其不实用。来源:§2.2,式 (1)–(3)

3. 方法:把“随机节点”改写成“固定噪声的函数”

模块一|重参数化。qφ(z|x) 是对角高斯,编码器输出均值 μ(x) 与标准差 σ(x)。不直接写“从这个高斯中采样”,而是先取 ε ~ N(0, I),再令 z = μ + σ ⊙ ε。对一次抽到的 ε 来说,zμ、σ 的普通可微函数,因此重建损失的梯度能沿着 z 回到编码器参数 φ来源:§2.3–2.4,式 (4)–(7)、(9)–(10)

模块二|随机梯度变分贝叶斯(SGVB)。 论文把重参数化代入 ELBO,得到可微的 Monte Carlo 估计器。若 KL 项可解析计算,就只需对重建项采样,通常比完全采样的通用估计器方差更低;随后可用 SGD 或 Adagrad 优化。来源:§2.3,式 (6)–(8)

模块三|自动编码变分贝叶斯(AEVB)。 对独立同分布、每个样本带连续潜变量的数据,编码器 qφ(z|x) 与解码器 pθ(x|z) 在同一个下界上联合训练。论文实验设置中,每个数据点只取 1 个潜变量样本;作者报告当小批量足够大(例如 100)时即可工作。来源:§2.3、算法 1

4. 证据与边界:更快收敛,但证据范围不宽

论文在 MNIST 与 Frey Face 上训练图像生成模型,并与 wake-sleep 比较。图 2 报告:不同潜空间维度下,AEVB 都明显更快收敛,并达到更好的平均变分下界;图注还给出当时硬件上的量级——有效约 40 GFLOPS 的 Intel Xeon CPU,每评估 100 万个训练样本约需 20–40 分钟。这里最强的证据是同类在线方法、相同任务上的优化轨迹比较,而不是一张覆盖多任务的最终榜单。来源:§5、图 2

论文还用估计边际似然比较 AEVB、wake-sleep 与 Monte Carlo EM;但这项估计只在很低维潜空间可靠。实验采用 3 个潜变量,附录明确写道估计器在采样空间低于 5 维、且样本足够多时才给出良好估计;更高维时作者认为结果不可靠。MCEM 也无法高效用于完整 MNIST。来源:§5“Marginal likelihood”、附录 D、图 3

最大风险来自外推。论文主要展示简单的单隐藏层 MLP、连续高斯潜变量与两套图像数据;wake-sleep 的一个明确优势是可处理离散潜变量,而本文的重参数化方案以连续潜变量为主。全局参数的变分推断只在附录给出算法,没有实验;层级生成架构、卷积网络、时间序列和监督潜变量模型都被列为未来方向。来源:§2、§3–5、§7

5. 实际意义:它改变的是“怎样训练潜变量模型”

面向实践,可以把论文的价值理解成一次计算图重构:若能把随机变量写成“固定噪声经可微变换”,自动微分和小批量优化就能直接接管训练;若再让一个共享网络预测每个样本的近似后验参数,新样本的推断就从“重新优化”变成“一次前向计算”。这两步后来成为 VAE 的标准训练模板。这是对机制的实践解释,不是论文对所有现代 VAE 变体的验证。

适用前先问三件事:潜变量分布能否稳定重参数化?近似后验的形状是否足够表达真实后验?ELBO 变好是否真的对应你的下游目标?若答案分别是“不能、未必、未必”,就需要离散变量梯度估计、更灵活的后验族,或额外的任务指标,而不能只照搬这篇论文的高斯 VAE 配方。

研究附录:证据台账

条目论文中的依据可信边界
问题后验、边际似然及均值场所需积分可能不可解;逐样本采样昂贵(§1、§2.1)指论文设定中的有向生成模型,不等于所有潜变量模型
核心改动z = gφ(ε, x) 使 Monte Carlo 估计可对参数求导(§2.3–2.4,式 4–7)需要合适的连续分布与可微变换
摊销推断识别模型/编码器近似 `pθ(zx)`,与生成模型联合训练(§1、§2.1、算法 1)
实验数据MNIST、Frey Face(§5)只有两套图像数据
主要基线wake-sleep;低维边际似然实验另含 MCEM(§4–5)不是现代生成模型的广泛比较
训练采样每数据点 1 个样本;文中举例小批量 100(§2.3、算法 1)是论文报告的经验设置,不是普适最优值
收敛证据图 2 中 AEVB 在各潜维度更快且达到更好下界(图 2)图中曲线结论;原文未给统一显著性检验
计算量每 100 万训练样本约 20–40 分钟,CPU 约 40 GFLOPS(图 2 图注)2013 年实现与硬件,不能直接映射到今天
边际似然限制实验用 3 维潜变量;附录称低于 5 维且样本足够多时估计良好(§5、附录 D)高维估计不可靠,不能把图 3 外推到常见高维 VAE
未完成工作全局参数实验、深层/卷积层级模型、时间序列、监督模型(§2、§7)作者明确留作未来工作

术语小抄

  • 潜变量(latent variable):未直接观测、但用来解释数据生成因素的变量 z
  • 后验(posterior):看到 x 后,z 可能取值的分布 p(z|x)
  • 变分下界(ELBO):对数边际似然的可优化下界;越大通常越好,但仍只是代理目标。
  • 重参数化(reparameterization):把参数相关的随机采样改写为独立噪声的可微变换。
  • 摊销推断(amortized inference):用共享模型一次学习从 x 到近似后验参数的映射。

复核时值得追问

  1. 图 2 的优势来自更低方差的梯度估计、目标函数差异,还是具体优化超参数?
  2. 当潜变量维度升高时,边际似然该用什么更可靠的方法评估?
  3. 对角高斯 qφ(z|x) 与真实后验差距多大,论文实验没有直接测量;怎样拆分近似族限制与摊销误差?
  4. 在离散潜变量、非可微生成过程或强多峰后验中,重参数化方案需要怎样替换?

来源说明

本文以 arXiv v11 摘要页论文全文 为权威来源;章节、公式、图号均指该版本。三张配图均为依据论文机制重新创作的教学图,不复用论文图像,也不把视觉比喻当作实验结果。

关于这篇论文的三个关键问题

VAE 的关键一步:让随机采样也能反向传播 解决了什么问题?

生成模型假设观测 x 是由潜变量 z 产生的:先从先验 p(z) 取一个 z,再由 pθ(x|z) 生成 x。学习时却反过来需要知道 pθ(z|x)。对带非线性神经网络的模型,这个真实后验以及边际似然中的积分通常不可解;传统均值场变分方法所需的期望也可能不可解,而 MCMC 又往往要对每个样本运行采样循环,难以扩展到大数据。来源:§1、§2.1

VAE 的关键一步:让随机采样也能反向传播 的核心结论有哪些证据?

论文在 MNIST 与 Frey Face 上训练图像生成模型,并与 wake-sleep 比较。图 2 报告:不同潜空间维度下,AEVB 都明显更快收敛,并达到更好的平均变分下界;图注还给出当时硬件上的量级——有效约 40 GFLOPS 的 Intel Xeon CPU,每评估 100 万个训练样本约需 20–40 分钟。这里最强的证据是同类在线方法、相同任务上的优化轨迹比较,而不是一张覆盖多任务的最终榜单。来源:§5、图 2

阅读 VAE 的关键一步:让随机采样也能反向传播 时最需要注意什么局限?

论文还用估计边际似然比较 AEVB、wake-sleep 与 Monte Carlo EM;但这项估计只在很低维潜空间可靠。实验采用 3 个潜变量,附录明确写道估计器在采样空间低于 5 维、且样本足够多时才给出良好估计;更高维时作者认为结果不可靠。MCEM 也无法高效用于完整 MNIST。来源:§5“Marginal likelihood”、附录 D、图 3

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro