潜在空間
VAEはデータを連続した潜在変数へ写し、後の潜在空間生成を理解する直感を与えます。
拡散モデル論文の学習ルート
拡散モデルは、データへ少しずつノイズを加え、その逆のノイズ除去を学習します。DDPMはこの方法で高品質な画像を安定して生成できると示しました。Latent Diffusionは計算を画素空間から圧縮された潜在空間へ移し、高解像度のtext-to-imageを実用的なコストに近づけました。
VAEはデータを連続した潜在変数へ写し、後の潜在空間生成を理解する直感を与えます。
GANは生成器と識別器を競わせ、DDPMは反復的なノイズ除去を学びます。DDPMは安定しやすい一方、生成に多くのstepが必要です。
Latent Diffusionは圧縮表現上で拡散を行い、条件制御を加え、Stable Diffusionの研究基盤になりました。
時間順に読むと、潜在表現、敵対的学習、画素空間の拡散、潜在空間の拡散が解決した問題を分けられます。
拡散過程を圧縮潜在空間へ移し、高解像度の画像生成を現実的な計算量にしました。
FAQ
High-Resolution Image Synthesis with Latent Diffusion Modelsが主要な研究基盤です。拡散処理を圧縮潜在空間で行います。
前向き過程で複雑なデータ分布を単純なノイズへ変え、学習した逆過程でノイズを段階的に除去してサンプルを生成するためです。
GANは生成器と識別器のゲームで学習し高速に生成できますが、不安定になる場合があります。拡散モデルは安定しやすい一方、複数stepの生成が必要です。