AI / Technology
ノイズから画像を取り戻す拡散確率モデル
元画像にノイズを加える順過程と、ノイズから画像を復元する逆過程
図1 — 左上から右へ進むほど信号を壊し、右下から左へ進むほど学習済みの逆過程で復元する。説明用に新規作成。根拠: 論文 Fig. 2、§2。
順方向では、元画像 x₀ にごく小さなガウスノイズを T 回加え、最後の x_T をほぼ標準正規分布のノイズにする。この壊し方 q は固定されている。逆方向では、現在のノイズ画像 x_t から一段だけきれいな x_{t-1} を出す分布 p_θ を学ぶ。各変化を小さくすれば、両方向の遷移をガウス分布で表せるため、問題を扱いやすくできる。(論文 §2、Eq. 1–4)
学習時のノイズ予測と生成時の反復除去
図2 — 上段では正解ノイズが分かるため教師ありの回帰問題になる。下段では同じ予測器を繰り返し使う。説明用に新規作成。根拠: 論文 Algorithms 1–2、§3.2–3.4。
生成は x_T ~ N(0, I) から始める。各時刻で U-Net がノイズ成分を予測し、それを差し引いた平均に所定のランダム性を加えて、一段前の状態を得る。論文の全実験では T = 1000、ノイズ分散 β_t は 10⁻⁴ から 0.02 まで線形に増やした。ネットワークは時刻埋め込みと16×16解像度の自己注意を持つ U-Net である。(論文 Algorithm 2、§4、Appendix B)
粗い構造から細部へ進む生成と、画質・速度・尤度のトレードオフ
図3 — 逆過程では大域的な特徴が先に、細部が後に現れる。右側は論文が示す長所と制約の要約。説明用に新規作成。根拠: 論文 §4.3、Figs. 6–7、Appendix B。
- 生成が逐次的で遅い。
T = 1000回の評価が必要で、著者の TPU v3-8 環境では CIFAR-10 を256枚生成するのに17秒、256×256画像を128枚生成するのに300秒かかった。(論文 §4、Appendix B) - 尤度と画質にトレードオフがある。 真の変分下限は符号長を良くしたが、
L_simpleは画質を良くした。最良画質モデルの NLL はテストで ≤ 3.75 bits/dim で、他の尤度ベースモデルには競争的でない。(論文 Table 1、§4.1、§4.3) - 評価範囲は限定的。 主な実証は CIFAR-10、CelebA-HQ、LSUN の無条件画像生成で、テキスト条件付き生成や実運用での安全性は検証していない。(論文 §4、Appendix B)
- データ由来の偏りと悪用は残る。 著者ら自身が、偽画像・偽動画への利用と、訓練データの偏りを増幅する危険を挙げている。(論文 Broader Impact)
研究付録
原題: Denoising Diffusion Probabilistic Models
著者: Jonathan Ho, Ajay Jain, Pieter Abbeel
発表: NeurIPS 2020 / arXiv:2006.11239v2
一次資料: arXiv 概要 · 論文 PDF
要点
3つだけ覚えるなら
- 画像生成を「一発で描く」問題から「少しずつノイズを消す」問題へ変えた。 学習時は本物の画像に既知のガウスノイズを加え、ネットワークにそのノイズを当てさせる。生成時は純粋なノイズから始め、学んだ逆向きの処理を繰り返す。(論文 §2、§3.2、Algorithms 1–2)
- 効いた工夫は、元画像そのものではなく、加えたノイズ ε を予測すること。 さらに標準の変分下限を簡略化した損失
L_simpleを使うと、CIFAR-10 の無条件生成で FID 3.17、Inception Score 9.46 を達成した。(論文 §3.2、§3.4、Table 1–2) - 高画質の代償は遅さと尤度性能。 論文の設定では1枚の生成に1000回の逐次的なネットワーク評価が必要で、対数尤度も他の尤度ベース生成モデルには及ばない。(論文 §4、§4.3、Appendix B)
ひとことで言うと
この論文は、画像を壊す手順をあらかじめ固定し、その逆をニューラルネットワークに学ばせることで、拡散モデルでも当時の有力な生成モデルに並ぶ高品質画像を作れると示した研究である。(論文 §1、§4)
問題
高品質と扱いやすい学習を両立できるか
2020年当時、GAN、自己回帰モデル、フロー、VAE はすでに強力だった。一方、拡散確率モデルは定義が素直で学習もしやすいものの、高品質な画像生成ができるという実証がなかった。著者らの問いは、固定したノイズ付加過程と学習可能な逆過程だけで、競争力のある画質まで到達できるか、だった。(論文 §1)
壊し方が分かれば、戻し方を練習できる
順方向では、元画像 x₀ にごく小さなガウスノイズを T 回加え、最後の x_T をほぼ標準正規分布のノイズにする。この壊し方 q は固定されている。逆方向では、現在のノイズ画像 x_t から一段だけきれいな x_{t-1} を出す分布 p_θ を学ぶ。各変化を小さくすれば、両方向の遷移をガウス分布で表せるため、問題を扱いやすくできる。(論文 §2、Eq. 1–4)
方法
ネットワークには「混ぜたノイズ」を当てさせる
学習では、データから画像 x₀ を取り、時刻 t を一様に選び、ノイズ ε を生成する。式4を使えば、途中の画像 x_t は前段階をすべて計算せず一度で作れる。U-Net は x_t と t を入力し、実際に加えた ε を予測する。予測誤差の二乗を小さくするのが簡略化損失 L_simple である。(論文 Eq. 4、Eq. 14、Algorithm 1、§4)
生成では1000回、少しずつ戻る
生成は x_T ~ N(0, I) から始める。各時刻で U-Net がノイズ成分を予測し、それを差し引いた平均に所定のランダム性を加えて、一段前の状態を得る。論文の全実験では T = 1000、ノイズ分散 β_t は 10⁻⁴ から 0.02 まで線形に増やした。ネットワークは時刻埋め込みと16×16解像度の自己注意を持つ U-Net である。(論文 Algorithm 2、§4、Appendix B)
簡略化損失が画質を押し上げた理由
標準の変分下限は時刻ごとに異なる重みを持つ。L_simple はその重みを外し、微量ノイズを除く簡単な課題の比重を下げ、ノイズが多い難しい課題へ相対的に集中させる。これは著者らの説明であり、実際のアブレーションでは、固定分散・ε予測・L_simple の組合せが最良だった。ただし、これは同じ実験設定内での経験的な裏づけであり、あらゆるデータでの一般則までは示していない。(論文 §3.4、§4.2、Table 2)
証拠と限界
最も強い証拠はCIFAR-10の画質
無条件 CIFAR-10 生成で、最良モデルは FID 3.17、Inception Score 9.46 ± 0.11 を記録した。FID は訓練集合を基準に計算され、テスト集合を基準にすると 5.24 だった。256×256 の LSUN では Church が FID 7.89、Bedroom が 4.90 で、著者らは ProgressiveGAN に近い品質と報告した。評価はいずれも5万サンプルで行われた。(論文 Abstract、§4.1、Figs. 3–4、Appendix B)
| 実験 | 指標 | 論文の値 | 読み方 |
|---|---|---|---|
| CIFAR-10・無条件 | FID(訓練集合基準) | 3.17 | 低いほど実画像分布に近い |
| CIFAR-10・無条件 | FID(テスト集合基準) | 5.24 | 比較対象集合で値が変わる |
| CIFAR-10・無条件 | Inception Score | 9.46 ± 0.11 | 高いほど多様で識別しやすい傾向 |
| LSUN Church 256×256 | FID | 7.89 | 無条件生成 |
| LSUN Bedroom 256×256 | FID | 4.90 | 無条件生成 |
何が効いたかはアブレーションで見える
CIFAR-10 の Table 2 では、平均 μ̃ を予測し標準の変分下限で学習した固定分散モデルが FID 13.22、εを予測して同じ変分下限で学習したモデルが 13.51 だった。ところが ε予測を L_simple で学習すると 3.17 まで改善した。学習可能な対角分散は不安定、または画質が悪かった。したがって「ε予測だけ」が勝因なのではなく、パラメータ化・固定分散・損失の組合せ が重要と読むべきである。(論文 §4.2、Table 2)
論文が残した限界
- 生成が逐次的で遅い。
T = 1000回の評価が必要で、著者の TPU v3-8 環境では CIFAR-10 を256枚生成するのに17秒、256×256画像を128枚生成するのに300秒かかった。(論文 §4、Appendix B) - 尤度と画質にトレードオフがある。 真の変分下限は符号長を良くしたが、
L_simpleは画質を良くした。最良画質モデルの NLL はテストで ≤ 3.75 bits/dim で、他の尤度ベースモデルには競争的でない。(論文 Table 1、§4.1、§4.3) - 評価範囲は限定的。 主な実証は CIFAR-10、CelebA-HQ、LSUN の無条件画像生成で、テキスト条件付き生成や実運用での安全性は検証していない。(論文 §4、Appendix B)
- データ由来の偏りと悪用は残る。 著者ら自身が、偽画像・偽動画への利用と、訓練データの偏りを増幅する危険を挙げている。(論文 Broader Impact)
実務的な意味
重要なのは「生成器」より再利用できる設計パターン
この論文の実務的な価値は、複雑な出力を一度に完成させる代わりに、簡単に作れる劣化データを教師信号にし、小さな修正を反復する 設計を成立させた点にある。正解ノイズを自動生成できるためラベル付けが不要で、同じネットワークを全時刻で共有できる。一方、反復回数がそのまま待ち時間につながるので、製品化では画質だけでなく、ステップ数、計算費用、応答時間を同時に評価する必要がある。これは論文の機構から導く実務上の解釈であり、著者が製品要件として検証した主張ではない。
途中状態が「粗から細」の表現になる
逆過程では大きな構図が先に現れ、細部が後から加わる。同じ中間状態から複数回生成すると、後半で分岐するほど姿勢や髪色などの大域的属性を共有した。著者らはこれを段階的な非可逆圧縮として読み解いている。実務的には、途中状態をプレビュー、粗粒度編集、補間に使える可能性を示すが、この論文はそれらの製品品質や操作性までは評価していない。(論文 §4.3–4.4、Figs. 6–8、Appendix D)
研究者向け確認メモ
- 再現条件: CIFAR-10 モデルは3570万パラメータ。TPU v3-8、バッチ128、80万ステップ、約10.6時間。大画像モデルは1億1400万パラメータで、別途約2億5600万の Bedroom モデルも使用した。(Appendix B)
- 評価上の注意: CIFAR-10 の主 FID 3.17 は訓練集合基準で、最小 FID を記録した時点のモデルを報告している。比較時には参照集合とモデル選択方法を揃える必要がある。(論文 §4.1、Appendix B)
- 未確定事項:
T = 1000は探索せずに固定され、他データセットの設定の多くは CIFAR-10 で調整後に移植された。最適なステップ数や他領域への一般化は、この論文だけでは確定しない。(Appendix B) - 用語: FID は生成分布と実画像分布の距離の近似指標、NLL はデータをモデルがどれだけ高い確率で説明するかを見る指標、
bits/dimは1画素チャネルあたりの符号長として読める。
出典ガイド
中心的な仕組みは 論文 PDF の §2–3、結果は §4 と Tables 1–2、計算量と評価条件は Appendix B、社会的な制約は Broader Impact に基づく。書誌情報と正式題名は arXiv の一次ページ で確認できる。
この論文についての3つの重要な質問
ノイズから画像を取り戻す拡散確率モデルはどの課題を扱いますか?
標準の変分下限は時刻ごとに異なる重みを持つ。Lsimple はその重みを外し、微量ノイズを除く簡単な課題の比重を下げ、ノイズが多い難しい課題へ相対的に集中させる。これは著者らの説明であり、実際のアブレーションでは、固定分散・ε予測・Lsimple の組合せが最良だった。ただし、これは同じ実験設定内での経験的な裏づけであり、あらゆるデータでの一般則までは示していない。(論文 §3.4、§4.2、Table 2)
ノイズから画像を取り戻す拡散確率モデルの中心的な主張を支える根拠は何ですか?
標準の変分下限は時刻ごとに異なる重みを持つ。Lsimple はその重みを外し、微量ノイズを除く簡単な課題の比重を下げ、ノイズが多い難しい課題へ相対的に集中させる。これは著者らの説明であり、実際のアブレーションでは、固定分散・ε予測・Lsimple の組合せが最良だった。ただし、これは同じ実験設定内での経験的な裏づけであり、あらゆるデータでの一般則までは示していない。(論文 §3.4、§4.2、Table 2)
ノイズから画像を取り戻す拡散確率モデルを読むときに注意すべき限界は何ですか?
無条件 CIFAR-10 生成で、最良モデルは FID 3.17、Inception Score 9.46 ± 0.11 を記録した。FID は訓練集合を基準に計算され、テスト集合を基準にすると 5.24 だった。256×256 の LSUN では Church が FID 7.89、Bedroom が 4.90 で、著者らは ProgressiveGAN に近い品質と報告した。評価はいずれも5万サンプルで行われた。(論文 Abstract、§4.1、Figs. 3–4、Appendix B)