レポート一覧へ

AI / Technology

1枚の画像は16×16の言葉に値する大規模画像認識のためのTransformer

この論文についての3つの重要な質問

1枚の画像は16×16の言葉に値する:大規模画像認識のためのTransformerはどの課題を扱いますか?

JFT-300M で事前学習した ViT-H/14 は、3回の fine-tuning の平均で ImageNet 88.55±0.04%、ImageNet-ReaL 90.72±0.05%、CIFAR-100 94.55±0.04%、19課題の VTAB 77.63±0.23% を記録した。比較対象の BiT-L(ResNet152×4)は順に 87.54±0.02%、90.54%、93.51±0.08%、76.29±1.70% だった(論文 Table 2、p. 6)。これは同論文の条件内での比較であり、あらゆる学習設定での普遍的な優位を意味しない。

1枚の画像は16×16の言葉に値する:大規模画像認識のためのTransformerの中心的な主張を支える根拠は何ですか?

問題は、画像認識が CNN 固有の仕組みに強く依存していたこと。論文の変更は、画像をパッチ列にして標準 Transformer に直接渡したこと。最も強い証拠は、JFT-300M で事前学習した ViT-H/14 が ImageNet で 88.55% を達成し、同じ比較表の強力な CNN 系モデルを上回ったこと。最大の未解決点は、その強さが巨大な教師ありデータと計算資源を必要とすることだ(論文 Table 2、pp. 5–6)。

1枚の画像は16×16の言葉に値する:大規模画像認識のためのTransformerを読むときに注意すべき限界は何ですか?

JFT-300M で事前学習した ViT-H/14 は、3回の fine-tuning の平均で ImageNet 88.55±0.04%、ImageNet-ReaL 90.72±0.05%、CIFAR-100 94.55±0.04%、19課題の VTAB 77.63±0.23% を記録した。比較対象の BiT-L(ResNet152×4)は順に 87.54±0.02%、90.54%、93.51±0.08%、76.29±1.70% だった(論文 Table 2、p. 6)。これは同論文の条件内での比較であり、あらゆる学習設定での普遍的な優位を意味しない。

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード