返回报告库

AI / Technology

VAE 的关键一步让随机采样也能反向传播

关于这篇论文的三个关键问题

VAE 的关键一步:让随机采样也能反向传播 解决了什么问题?

生成模型假设观测 x 是由潜变量 z 产生的:先从先验 p(z) 取一个 z,再由 pθ(x|z) 生成 x。学习时却反过来需要知道 pθ(z|x)。对带非线性神经网络的模型,这个真实后验以及边际似然中的积分通常不可解;传统均值场变分方法所需的期望也可能不可解,而 MCMC 又往往要对每个样本运行采样循环,难以扩展到大数据。来源:§1、§2.1

VAE 的关键一步:让随机采样也能反向传播 的核心结论有哪些证据?

论文在 MNIST 与 Frey Face 上训练图像生成模型,并与 wake-sleep 比较。图 2 报告:不同潜空间维度下,AEVB 都明显更快收敛,并达到更好的平均变分下界;图注还给出当时硬件上的量级——有效约 40 GFLOPS 的 Intel Xeon CPU,每评估 100 万个训练样本约需 20–40 分钟。这里最强的证据是同类在线方法、相同任务上的优化轨迹比较,而不是一张覆盖多任务的最终榜单。来源:§5、图 2

阅读 VAE 的关键一步:让随机采样也能反向传播 时最需要注意什么局限?

论文还用估计边际似然比较 AEVB、wake-sleep 与 Monte Carlo EM;但这项估计只在很低维潜空间可靠。实验采用 3 个潜变量,附录明确写道估计器在采样空间低于 5 维、且样本足够多时才给出良好估计;更高维时作者认为结果不可靠。MCEM 也无法高效用于完整 MNIST。来源:§5“Marginal likelihood”、附录 D、图 3

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro