レポート一覧へ

厳選リーディングガイド

現代AIを形作った20本の重要論文

引用数だけの順位ではありません。モデル構造・学習方法・作れるプロダクトを変えた論文を選びました。各論文を日本語・英語・中国語の図解付きで公開します。

現代AIを体系的に理解するには、まずAlexNet、ResNet、Transformerでモデル構造の流れを学び、BERT、GPT-3、RAG、InstructGPTで言語モデルを追います。その後、拡散モデル、マルチモーダル、エージェントへ進みます。以下の20本は発表年順です。

目的別の読書順序

モデル構造の基礎

AlexNet → ResNet → Transformer → Vision Transformerで、畳み込み・残差接続・注意機構の流れを理解します。

大規模言語モデル

BERT → Scaling Laws → GPT-3 → RAG → InstructGPT → Chinchillaで、事前学習・規模・検索・アラインメントを学びます。

生成とエージェント

VAE → GAN → DDPM → Latent Diffusionから、Chain-of-ThoughtとReActへ進みます。

  1. 01
    2012コンピュータビジョン

    ImageNet Classification with Deep Convolutional Neural Networks

    Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton

    ImageNet Classification with Deep Convolutional Neural Networks: GPU・大規模データ・深い畳み込みネットワークを、拡張可能な画像認識の方法として結びつけました。

    原論文
  2. 02
    2013生成モデル

    Auto-Encoding Variational Bayes

    Diederik P. Kingma, Max Welling

    Auto-Encoding Variational Bayes: 確率的な潜在変数モデルを通常の誤差逆伝播で学習できる形にしました。

    原論文
  3. 03
    2014生成モデル

    Generative Adversarial Networks

    Ian J. Goodfellow et al.

    Generative Adversarial Networks: 生成器と識別器の対戦として生成を捉え直し、一世代の生成モデルを形作りました。

    原論文
  4. 04
    2015コンピュータビジョン

    Deep Residual Learning for Image Recognition

    Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Deep Residual Learning for Image Recognition: 残差接続によって、非常に深いネットワークを現実的に最適化できるようにしました。

    原論文
  5. 05
    2017言語モデル

    Attention Is All You Need

    Ashish Vaswani et al.

    Attention Is All You Need: 再帰構造を注意機構に置き換え、現在の基盤モデルに共通する土台になりました。

    原論文
  6. 06
    2018言語モデル

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding: 双方向の事前学習とタスク別微調整を、自然言語理解の標準的な方法にしました。

    原論文
  7. 07
    2020言語モデル

    Scaling Laws for Neural Language Models

    Jared Kaplan et al.

    Scaling Laws for Neural Language Models: モデル規模・データ・計算量と損失の関係が予測可能なべき乗則に従うことを示しました。

    原論文
  8. 08
    2020言語モデル

    Language Models are Few-Shot Learners

    Tom B. Brown et al.

    Language Models are Few-Shot Learners: 大規模化した言語モデルが、少数の例を含むプロンプトだけで多様な課題に対応できると示しました。

    原論文
  9. 09
    2020言語モデル

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

    Patrick Lewis et al.

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks: モデル内部の記憶と更新可能な外部検索を組み合わせ、知識アシスタントの基礎を作りました。

    原論文
  10. 10
    2020生成モデル

    Denoising Diffusion Probabilistic Models

    Jonathan Ho, Ajay Jain, Pieter Abbeel

    Denoising Diffusion Probabilistic Models: 段階的なノイズ付加と除去を、安定した高品質生成の方法にしました。

    原論文
  11. 11
    2020コンピュータビジョン

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale: 画像をパッチに分ければ、純粋なTransformerでも大規模画像認識で畳み込み網を上回れると示しました。

    原論文
  12. 12
    2021マルチモーダル

    Learning Transferable Visual Models From Natural Language Supervision

    Alec Radford et al.

    Learning Transferable Visual Models From Natural Language Supervision: 大規模な画像と文章の対応学習により、強力なゼロショット視覚転移を可能にしました。

    原論文
  13. 13
    2021言語モデル

    LoRA: Low-Rank Adaptation of Large Language Models

    Edward J. Hu et al.

    LoRA: Low-Rank Adaptation of Large Language Models: 全パラメータを学習し直さず、小さな低ランク更新だけで大規模モデルを適応させました。

    原論文
  14. 14
    2021生成モデル

    High-Resolution Image Synthesis with Latent Diffusion Models

    Robin Rombach et al.

    High-Resolution Image Synthesis with Latent Diffusion Models: 拡散過程を圧縮潜在空間へ移し、高解像度の画像生成を現実的な計算量にしました。

    原論文
  15. 15
    2022推論・エージェント

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    Jason Wei et al.

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: 途中の思考手順を含む少数例が、大規模モデルの複雑な推論を大きく改善すると示しました。

    原論文
  16. 16
    2022言語モデル

    Training language models to follow instructions with human feedback

    Long Ouyang et al.

    Training language models to follow instructions with human feedback: 人間の指示と好みに言語モデルを合わせる実用的な学習手順を確立しました。

    原論文
  17. 17
    2022言語モデル

    Training Compute-Optimal Large Language Models

    Jordan Hoffmann et al.

    Training Compute-Optimal Large Language Models: 多くの大規模モデルは学習データが不足していると示し、計算量あたりの最適な配分を見直しました。

    原論文
  18. 18
    2022推論・エージェント

    ReAct: Synergizing Reasoning and Acting in Language Models

    Shunyu Yao et al.

    ReAct: Synergizing Reasoning and Acting in Language Models: 推論とツール操作を交互に行わせ、現在のAIエージェントの基本ループを示しました。

    原論文
  19. 19
    2023コンピュータビジョン

    Segment Anything

    Alexander Kirillov et al.

    Segment Anything: 画像分割をプロンプト可能で転移しやすい基盤能力にし、大規模データも公開しました。

    原論文
  20. 20
    2023マルチモーダル

    Visual Instruction Tuning

    Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

    Visual Instruction Tuning: 視覚指示チューニングにより画像エンコーダと言語モデルをつなぎ、対話型マルチモーダル助手を作りました。

    原論文