レポート一覧へ

AI / Technology

Residual 学習で、深すぎるネットワークの学習を通しやすくする

浅い Plain network と深い Plain network の最適化の違いを示す概念図

図1(新規作成)。深いモデルには、追加層を恒等変換にして浅いモデルを再現する解が理屈上あります。それでも通常の積み重ねでは、その解を実用的な時間内に見つけにくい、という問題設定です。図は概念説明であり、測定グラフではありません。出典: 論文 pp.1–2、Fig. 1 の議論。

勾配消失・爆発への対策が進み、深いネットワークが訓練を開始できるようになっても、別の壁が残りました。層を増やすと精度が頭打ちになり、その後は急に悪化します。しかも訓練誤差まで高くなるため、単なる過学習では説明できません(論文 p.1、Sec. 1)。

残差ブロックで入力 x と学習した差分 F(x) を加える仕組み

図2(新規作成)。上の経路は入力 xx をそのまま運び、下の経路は層を通して残差 F(x)F(x) を学びます。合流点で要素ごとに加え、H(x)=F(x)+xH(x)=F(x)+x を得ます。出典: 論文 p.3、Eq. 1。

Plain、ResNet、超深層 ResNet での深さと結果の関係を示す概念図

図3(新規作成)。比較実験が示す方向性と、極端な深さでは訓練成功とテスト性能が分かれうることをまとめた概念図です。数値チャートではありません。出典: 論文 Table 2、Fig. 6、Table 6。

値は10-crop testing。Plain と ResNet の対応モデルは、ショートカット以外の深さ・幅・パラメータ数・計算量をそろえています(論文 Table 2、Fig. 4)。さらに ResNet-152 は単一モデルで top-1 21.43%、top-5 5.71%(検証時の10-crop結果)、より多くのcropを用いた評価では top-5 4.49%でした。6モデルのアンサンブルは ImageNet テストで top-5 3.57%を記録しましたが、単一モデルの結果とは分けて読む必要があります(論文 Table 3–5)。

研究付録

Kaiming He、Xiangyu Zhang、Shaoqing Ren、Jian Sun による Deep Residual Learning for Image Recognition(2015年)。画像認識を題材に、層を増やすほど訓練しにくくなる問題へ「入力を近道で残し、必要な差分だけを学ぶ」という答えを示した論文です。
出典: arXiv:1512.03385 / 論文PDF

要点

3つの要点

  1. 深ければ自動的に良くなるわけではない。 当時の通常のネットワークでは、層を増やすと検証誤差だけでなく訓練誤差まで上がる「degradation problem(劣化問題)」が起きた(論文 p.1、Fig. 1)。
  2. 完成形を丸ごと学ばず、入力からの差分を学ぶ。 望む変換を H(x)H(x) とすると、積み重ねた層には F(x)=H(x)xF(x)=H(x)-x を担当させ、出力を H(x)=F(x)+xH(x)=F(x)+x とする(論文 pp.2–3、Eq. 1)。
  3. 近道によって、深さを精度へ結びつけやすくなった。 ImageNet の同条件比較では34層の Plain が top-1 誤差28.54%だったのに対し、34層 ResNet は25.03%。152層の単一モデルは top-5 検証誤差4.49%を記録した(論文 Table 2、Table 3–4)。

強い証拠は、層数や計算量をそろえた Plain と ResNet の比較で、訓練誤差そのものが改善したことです。一方、「差分化がなぜ最適化を容易にするか」の完全な理論説明や、深くすれば常に汎化性能が上がるという保証はありません。

問題

劣化問題

勾配消失・爆発への対策が進み、深いネットワークが訓練を開始できるようになっても、別の壁が残りました。層を増やすと精度が頭打ちになり、その後は急に悪化します。しかも訓練誤差まで高くなるため、単なる過学習では説明できません(論文 p.1、Sec. 1)。

問題の切り分け

著者らは Batch Normalization を使い、順伝播の信号分散と逆伝播の勾配ノルムが健全であることを確認しました。34層 Plain の劣化は、勾配が単純に消えたためとは考えにくいと述べています。ただし収束が遅くなる根本理由は仮説にとどまり、将来課題とされました(論文 p.5、Sec. 4.1)。

方法

残差学習

複数の層に目的の変換 H(x)H(x) を直接覚えさせる代わりに、入力 xx からどれだけ変えるかという残差 F(x)=H(x)xF(x)=H(x)-x を覚えさせます。必要な変換が恒等写像に近いなら、複雑な層で「何もしない」を作るより、残差をゼロ付近へ寄せるほうが最適化しやすいのではないか、という発想です。これは著者らの仮説であり、一般的な証明ではありません(論文 pp.2–3、Sec. 3.1)。

ショートカット接続

入力と出力の次元が同じなら、近道は恒等写像なので追加パラメータも追加の計算量もほぼ不要です。次元が変わる場所だけ線形射影 WsxW_sx を使えます。論文の比較では、恒等ショートカットだけでも劣化問題への効果が大きく、射影は必須ではありませんでした(論文 pp.3, 6、Eq. 2、Table 3)。

深層化の実装

50・101・152層では、1×1、3×3、1×1 畳み込みからなるボトルネックを使い、中央の3×3層の次元を小さくしました。これにより152層でも11.3 billion FLOPsで、VGG-19の19.6 billion FLOPsを下回ります(論文 Table 1、p.6)。

証拠と限界

ImageNet の対照比較

モデルtop-1 検証誤差読み取り
Plain 18層27.94%基準
Plain 34層28.54%深くして悪化
ResNet 18層27.88%Plain 18層とほぼ同等
ResNet 34層25.03%深くして改善

値は10-crop testing。Plain と ResNet の対応モデルは、ショートカット以外の深さ・幅・パラメータ数・計算量をそろえています(論文 Table 2、Fig. 4)。さらに ResNet-152 は単一モデルで top-1 21.43%、top-5 5.71%(検証時の10-crop結果)、より多くのcropを用いた評価では top-5 4.49%でした。6モデルのアンサンブルは ImageNet テストで top-5 3.57%を記録しましたが、単一モデルの結果とは分けて読む必要があります(論文 Table 3–5)。

CIFAR-10 と限界

CIFAR-10 でも110層 ResNet はテスト誤差6.43%まで学習でき、残差層の応答が Plain より概して小さいという観察は「各層が小さな修正を学ぶ」という動機と整合します(論文 Fig. 7、Table 6)。しかし1202層は訓練誤差0.1%未満でもテスト誤差7.93%で、110層より悪化しました。著者らは、小さなデータセットに対して19.4Mパラメータが過大で過学習した可能性を挙げています(論文 p.8)。

この論文が直接確かめた中心領域は、2015年時点の画像分類・物体検出と、記載された学習設定です。ほかのデータ形式、別の最適化手法、現代の大規模モデルまで同じ効果量が出るとは、この実験だけでは言えません。

実務的な意味

設計判断としての意味

実務的な読み方は「深さそのものが価値」ではなく、「既存の表現を保つ経路を用意し、各ブロックには修正分を担当させると、深いモデルを最適化しやすい」です。入力と出力の形が同じ箇所では安価な恒等ショートカットを使い、形が変わる箇所だけ射影を検討する、という設計原則になります。これは論文の機構と比較結果からの解釈であり、著者があらゆる製品への適用を保証したものではありません。

導入前に確かめること

  • Plain と残差版で、深さ・幅・学習設定・計算量をできるだけそろえ、訓練誤差と検証誤差を別々に比較する。
  • 改善が「最適化しやすくなった」ためか、単にパラメータや計算量が増えたためかを切り分ける。
  • 深層化を続けるなら、訓練誤差の低下だけで判断せず、過学習、メモリ、推論時間も測る。

出典・用語・不確実性

  • Residual / 残差: 目標変換と入力との差 F(x)=H(x)xF(x)=H(x)-x
  • Identity shortcut / 恒等ショートカット: 入力を変えずに加算点へ運ぶ経路。
  • Degradation problem / 劣化問題: 深層化で訓練誤差まで悪化する現象。過学習とは区別される。
  • 最大の不確実性: 残差化が最適化を容易にする理由は、実験で強く支持される一方、論文中では完全には理論化されていない。
  • 一次資料: He et al., “Deep Residual Learning for Image Recognition,” arXiv:1512.03385v1, 2015. 要旨 / PDF

この論文についての3つの重要な質問

Residual 学習で、深すぎるネットワークの学習を通しやすくするはどの課題を扱いますか?

Kaiming He、Xiangyu Zhang、Shaoqing Ren、Jian Sun による Deep Residual Learning for Image Recognition(2015年)。画像認識を題材に、層を増やすほど訓練しにくくなる問題へ「入力を近道で残し、必要な差分だけを学ぶ」という答えを示した論文です。 出典: arXiv:1512.03385 / 論文PDF

Residual 学習で、深すぎるネットワークの学習を通しやすくするの中心的な主張を支える根拠は何ですか?

入力と出力の次元が同じなら、近道は恒等写像なので追加パラメータも追加の計算量もほぼ不要です。次元が変わる場所だけ線形射影 (Wsx) を使えます。論文の比較では、恒等ショートカットだけでも劣化問題への効果が大きく、射影は必須ではありませんでした(論文 pp.3, 6、Eq. 2、Table 3)。

Residual 学習で、深すぎるネットワークの学習を通しやすくするを読むときに注意すべき限界は何ですか?

値は10-crop testing。Plain と ResNet の対応モデルは、ショートカット以外の深さ・幅・パラメータ数・計算量をそろえています(論文 Table 2、Fig. 4)。さらに ResNet-152 は単一モデルで top-1 21.43%、top-5 5.71%(検証時の10-crop結果)、より多くのcropを用いた評価では top-5 4.49%でした。6モデルのアンサンブルは ImageNet テストで top-5 3.57%を記録しましたが、単一モデルの結果とは分けて読む必要があります(論文 Table 3–5)。

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード