モデル構造の基礎
AlexNet → ResNet → Transformer → Vision Transformerで、畳み込み・残差接続・注意機構の流れを理解します。
厳選リーディングガイド
引用数だけの順位ではありません。モデル構造・学習方法・作れるプロダクトを変えた論文を選びました。各論文を日本語・英語・中国語の図解付きで公開します。
現代AIを体系的に理解するには、まずAlexNet、ResNet、Transformerでモデル構造の流れを学び、BERT、GPT-3、RAG、InstructGPTで言語モデルを追います。その後、拡散モデル、マルチモーダル、エージェントへ進みます。以下の20本は発表年順です。
AlexNet → ResNet → Transformer → Vision Transformerで、畳み込み・残差接続・注意機構の流れを理解します。
BERT → Scaling Laws → GPT-3 → RAG → InstructGPT → Chinchillaで、事前学習・規模・検索・アラインメントを学びます。
VAE → GAN → DDPM → Latent Diffusionから、Chain-of-ThoughtとReActへ進みます。
ImageNet Classification with Deep Convolutional Neural Networks: GPU・大規模データ・深い畳み込みネットワークを、拡張可能な画像認識の方法として結びつけました。
原論文Auto-Encoding Variational Bayes: 確率的な潜在変数モデルを通常の誤差逆伝播で学習できる形にしました。
原論文Generative Adversarial Networks: 生成器と識別器の対戦として生成を捉え直し、一世代の生成モデルを形作りました。
原論文Deep Residual Learning for Image Recognition: 残差接続によって、非常に深いネットワークを現実的に最適化できるようにしました。
原論文BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding: 双方向の事前学習とタスク別微調整を、自然言語理解の標準的な方法にしました。
原論文Scaling Laws for Neural Language Models: モデル規模・データ・計算量と損失の関係が予測可能なべき乗則に従うことを示しました。
原論文Language Models are Few-Shot Learners: 大規模化した言語モデルが、少数の例を含むプロンプトだけで多様な課題に対応できると示しました。
原論文Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks: モデル内部の記憶と更新可能な外部検索を組み合わせ、知識アシスタントの基礎を作りました。
原論文Denoising Diffusion Probabilistic Models: 段階的なノイズ付加と除去を、安定した高品質生成の方法にしました。
原論文An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale: 画像をパッチに分ければ、純粋なTransformerでも大規模画像認識で畳み込み網を上回れると示しました。
原論文Learning Transferable Visual Models From Natural Language Supervision: 大規模な画像と文章の対応学習により、強力なゼロショット視覚転移を可能にしました。
原論文LoRA: Low-Rank Adaptation of Large Language Models: 全パラメータを学習し直さず、小さな低ランク更新だけで大規模モデルを適応させました。
原論文High-Resolution Image Synthesis with Latent Diffusion Models: 拡散過程を圧縮潜在空間へ移し、高解像度の画像生成を現実的な計算量にしました。
原論文Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: 途中の思考手順を含む少数例が、大規模モデルの複雑な推論を大きく改善すると示しました。
原論文Training language models to follow instructions with human feedback: 人間の指示と好みに言語モデルを合わせる実用的な学習手順を確立しました。
原論文Training Compute-Optimal Large Language Models: 多くの大規模モデルは学習データが不足していると示し、計算量あたりの最適な配分を見直しました。
原論文ReAct: Synergizing Reasoning and Acting in Language Models: 推論とツール操作を交互に行わせ、現在のAIエージェントの基本ループを示しました。
原論文Visual Instruction Tuning: 視覚指示チューニングにより画像エンコーダと言語モデルをつなぎ、対話型マルチモーダル助手を作りました。
原論文