レポート一覧へ

AI / Technology

連続潜在変数をもつ生成モデルを速く学習する方法

従来の反復推論とAEVBの共有エンコーダーの比較

図1 — 左は各データ点に別々の反復推論が必要な姿、右は共有エンコーダーが一度の順方向計算で近似事後分布を返す姿。これは原論文図の転載ではなく、§1–2.1をもとにした説明図。

観測データを xx、その背後の説明要因を zz とする生成モデルでは、本当に知りたい事後分布 pθ(zx)p_\theta(z\mid x) がしばしば計算できない。平均場変分推論も必要な期待値を解析的に求められないことがあり、MCMC や Monte Carlo EM は各データ点で反復サンプリングを要する。データが増えるほど、この「一件ごとに推論をやり直す」費用が効いてくる。【原論文 §1、§2.1】

再パラメータ化による順方向サンプリングと勾配経路

図2 — 黒は順方向の生成、青は学習時に勾配が戻る決定的経路。ノイズ源そのものを学習するのではない。§2.4をもとにした説明図。

と書ける。サンプリングを「パラメータ付き分布から直接引く操作」ではなく、「パラメータに依存しないノイズを決定的に変換する操作」として表すことで、zz からエンコーダーまで微分可能な経路ができる。著者らはこれを変分下限へ適用し、SGVB(Stochastic Gradient Variational Bayes)推定量を得た。【原論文 §2.3–2.4、式(4)–(7)】

VAEのエンコーダー、潜在分布、デコーダーと二つの学習圧力

図3 — 「復元する」と「事前分布へ近づける」を同じ変分下限で釣り合わせ、エンコーダーとデコーダーを共同最適化する。§2.3と§3をもとにした説明図。

ガウス事前分布と対角ガウス近似では KL 項を解析的に計算でき、サンプリングが必要なのは主に復元項になる。論文の実験では、十分な大きさのミニバッチ(例として100)なら、データ点あたり1サンプルでよいと報告している。【原論文 §2.3、§3、式(7)–(10)】

研究付録

原題: Auto-Encoding Variational Bayes

Diederik P. Kingma と Max Wellingによるこの論文は、連続潜在変数をもつ生成モデルを、通常の確率的勾配法でまとめて学習できる形にした。現在「変分オートエンコーダー(VAE)」と呼ばれる方法の出発点である。正式題名・著者・版情報は arXiv:1312.6114 で確認できる。

要点

3つだけ覚えるなら

  1. 乱数そのものではなく、乱数を使った決定的な変換を微分する。 これが再パラメータ化であり、変分下限を低分散な確率的勾配で最適化しやすくする。
  2. 推論結果をデータごとに探し直さず、推論の仕方をエンコーダーに学ばせる。 ひとつの認識モデルを全データで共有するため、大規模データへ広げやすい。
  3. 復元と正則化をひとつの目的で同時に扱う。 デコーダーは入力を説明し、エンコーダーが作る潜在分布は事前分布から離れすぎないように学習される。

一文で言えば、扱いにくい潜在変数の推論を、ノイズを含むオートエンコーダーの誤差逆伝播へ変換した論文 である。【原論文 Abstract、§2.3–3】

問題

なぜ従来の推論は重かったのか

観測データを xx、その背後の説明要因を zz とする生成モデルでは、本当に知りたい事後分布 pθ(zx)p_\theta(z\mid x) がしばしば計算できない。平均場変分推論も必要な期待値を解析的に求められないことがあり、MCMC や Monte Carlo EM は各データ点で反復サンプリングを要する。データが増えるほど、この「一件ごとに推論をやり直す」費用が効いてくる。【原論文 §1、§2.1】

論文が置き換えたもの

著者らは、計算困難な事後分布を qϕ(zx)q_\phi(z\mid x) で近似し、その分布のパラメータを返す「認識モデル」を全データで共有した。これは後に償却推論(amortized inference) と呼ばれる考え方で、データごとの最適化コストを、共有ネットワークを学ぶコストへ置き換える。論文自身の表現では、AEVB は高価な反復推論なしに単純な祖先サンプリングで近似事後推論を行う。【原論文 §1、§2.1】

方法

再パラメータ化:乱数を経路の外へ出す

ガウス近似なら、エンコーダーが平均 μϕ(x)\mu_\phi(x) と標準偏差 σϕ(x)\sigma_\phi(x) を出し、独立な標準正規ノイズ ϵ\epsilon を使って

ϵN(0,I),z=μϕ(x)+σϕ(x)ϵ\epsilon\sim\mathcal N(0,I),\qquad z=\mu_\phi(x)+\sigma_\phi(x)\odot\epsilon

と書ける。サンプリングを「パラメータ付き分布から直接引く操作」ではなく、「パラメータに依存しないノイズを決定的に変換する操作」として表すことで、zz からエンコーダーまで微分可能な経路ができる。著者らはこれを変分下限へ適用し、SGVB(Stochastic Gradient Variational Bayes)推定量を得た。【原論文 §2.3–2.4、式(4)–(7)】

AEVB:推論器と生成器を一緒に学ぶ

エンコーダー qϕ(zx)q_\phi(z\mid x) は入力から潜在分布を作り、デコーダー pθ(xz)p_\theta(x\mid z) は潜在サンプルからデータを説明する。最大化する変分下限(ELBO)は、平たく言えば次の二つの差である。

L(x)=Eqϕ(zx)[logpθ(xz)]入力をよく説明するDKL(qϕ(zx)p(z))事前分布からの離れすぎを抑える\mathcal L(x)=\underbrace{\mathbb E_{q_\phi(z\mid x)}[\log p_\theta(x\mid z)]}_{\text{入力をよく説明する}} -\underbrace{D_{KL}(q_\phi(z\mid x)\Vert p(z))}_{\text{事前分布からの離れすぎを抑える}}

ガウス事前分布と対角ガウス近似では KL 項を解析的に計算でき、サンプリングが必要なのは主に復元項になる。論文の実験では、十分な大きさのミニバッチ(例として100)なら、データ点あたり1サンプルでよいと報告している。【原論文 §2.3、§3、式(7)–(10)】

証拠と限界

実験で確かめられたこと

著者らは MNIST と Frey Face で画像生成モデルを学習し、AEVB と wake-sleep を比較した。原論文 Figure 2 では、調べたすべての潜在次元で AEVB が変分下限をより速く改善し、より良い値へ到達したと報告される。計算時間は Intel Xeon CPU(実効40 GFLOPS)で、100万訓練サンプルあたり約20〜40分だった。【原論文 §5 “Likelihood lower bound”、Figure 2】

低次元の潜在空間では、推定周辺尤度でも wake-sleep と Monte Carlo EM を比較した。ただし周辺尤度推定が信頼できたのは潜在空間が非常に低次元のときで、実験では3次元を使い、高次元では推定が不安定になった。Monte Carlo EM はオンライン法ではなく、MNIST 全体へ効率よく適用できないとも記されている。【原論文 §5 “Marginal likelihood”、Figure 3、Appendix D】

何までは言えないか

この結果は、2013年当時の MNIST と Frey Face、単一隠れ層 MLP を中心とした比較である。現代的な大規模画像生成の品質、深い階層モデルでの安定性、離散潜在変数への適用を直接示すものではない。再パラメータ化には分布を微分可能な変換で表せることが必要で、wake-sleep には離散潜在変数にも使える利点がある。【原論文 §2.4、§4–5】

また、グローバルパラメータ自体の完全ベイズ推論は付録でアルゴリズムを示すにとどまり、実験は将来課題とされた。時系列、深い階層生成モデル、教師あり潜在変数モデルも将来研究として挙げられている。【原論文 §2、§7】

実務的な意味

何が設計原理として残ったのか

実務上の価値は、単に「オートエンコーダーで画像を作れる」ことではない。より一般には、推論を毎回解く代わりに推論器を学習すること、そして確率的な内部状態を微分可能な計算へ組み替えること が設計原理として残った。これは論文の機構から導く解釈であり、特定製品の性能を著者らが保証したという意味ではない。

使う側は三点を確認するとよい。第一に、潜在変数の分布を安定して再パラメータ化できるか。第二に、ELBO は対数尤度そのものではなく下限なので、改善がそのまま知覚品質や下流性能の改善を意味するとは限らない。第三に、共有エンコーダーの速さと引き換えに、近似分布の形や償却推論の誤差がボトルネックになり得る。最後の点は本論文が定量評価した主題ではなく、方法の前提から生じる検証課題である。

用語と検証ポイント

  • 変分下限(ELBO):直接計算しにくい対数周辺尤度の下限。学習の代理目的になる。【原論文 §2.2】
  • 認識モデル/確率的エンコーダーxx から近似事後分布 qϕ(zx)q_\phi(z\mid x) を返す共有モデル。【原論文 §2.1】
  • SGVB:再パラメータ化した変分下限の確率的勾配推定量。【原論文 §2.3】
  • AEVB:SGVB を用いて認識モデルと生成モデルをミニバッチで共同学習するアルゴリズム。【原論文 Algorithm 1】
  • 次に確かめるべきこと:対象データでの尤度下限だけでなく、サンプル品質、下流性能、推論速度、潜在次元を増やしたときの推定安定性を別々に測る。

一次資料:Kingma, D. P. & Welling, M., “Auto-Encoding Variational Bayes,” arXiv:1312.6114, v11 (2022 revision; originally submitted 2013), abstract page / full text

この論文についての3つの重要な質問

連続潜在変数をもつ生成モデルを速く学習する方法はどの課題を扱いますか?

Diederik P. Kingma と Max Wellingによるこの論文は、連続潜在変数をもつ生成モデルを、通常の確率的勾配法でまとめて学習できる形にした。現在「変分オートエンコーダー(VAE)」と呼ばれる方法の出発点である。正式題名・著者・版情報は arXiv:1312.6114 で確認できる。

連続潜在変数をもつ生成モデルを速く学習する方法の中心的な主張を支える根拠は何ですか?

低次元の潜在空間では、推定周辺尤度でも wake-sleep と Monte Carlo EM を比較した。ただし周辺尤度推定が信頼できたのは潜在空間が非常に低次元のときで、実験では3次元を使い、高次元では推定が不安定になった。Monte Carlo EM はオンライン法ではなく、MNIST 全体へ効率よく適用できないとも記されている。【原論文 §5 “Marginal likelihood”、Figure 3、Appendix D】

連続潜在変数をもつ生成モデルを速く学習する方法を読むときに注意すべき限界は何ですか?

低次元の潜在空間では、推定周辺尤度でも wake-sleep と Monte Carlo EM を比較した。ただし周辺尤度推定が信頼できたのは潜在空間が非常に低次元のときで、実験では3次元を使い、高次元では推定が不安定になった。Monte Carlo EM はオンライン法ではなく、MNIST 全体へ効率よく適用できないとも記されている。【原論文 §5 “Marginal likelihood”、Figure 3、Appendix D】

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード