返回报告库

策展阅读路径

读懂 AI 的 20 篇关键论文

不是按引用量机械排名,而是选出真正改变模型结构、训练方法和产品形态的论文。每篇都会提供中文、英文和日文图文解读。

如果你想系统理解现代 AI,可以先读 AlexNet、ResNet 和 Transformer 建立模型结构主线,再沿着 BERT、GPT-3、RAG 与 InstructGPT 理解语言模型,最后补上扩散模型、多模态和 Agent。下面 20 篇按发表时间排序,每篇都说明它改变了什么。

按你的目标选择阅读顺序

模型结构基础

AlexNet → ResNet → Transformer → Vision Transformer,理解卷积、残差连接与注意力如何改变模型骨架。

大语言模型

BERT → Scaling Laws → GPT-3 → RAG → InstructGPT → Chinchilla,理解预训练、规模、检索与对齐。

生成式与 Agent

VAE → GAN → DDPM → Latent Diffusion,再读 Chain-of-Thought 与 ReAct,连接生成、推理和工具行动。

  1. 01
    2012计算机视觉

    ImageNet Classification with Deep Convolutional Neural Networks

    Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton

    ImageNet Classification with Deep Convolutional Neural Networks: GPU、大数据和深层卷积网络第一次以压倒性优势连成了一条可规模化的视觉路线。

    原论文
  2. 02
    2013生成模型

    Auto-Encoding Variational Bayes

    Diederik P. Kingma, Max Welling

    Auto-Encoding Variational Bayes: 把概率生成模型变成可用反向传播训练的神经网络,为可控潜空间奠定基础。

    原论文
  3. 03
    2014生成模型

    Generative Adversarial Networks

    Ian J. Goodfellow et al.

    Generative Adversarial Networks: 用生成器与判别器的对抗博弈重新定义了图像生成,并影响了一代生成模型。

    原论文
  4. 04
    2015计算机视觉

    Deep Residual Learning for Image Recognition

    Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Deep Residual Learning for Image Recognition: 残差连接解决了深层网络越深越难训练的问题,今天仍是大量模型的基本结构。

    原论文
  5. 05
    2017语言模型

    Attention Is All You Need

    Ashish Vaswani et al.

    Attention Is All You Need: Transformer 用注意力替代循环结构,成为大语言模型与多模态模型的共同底座。

    原论文
  6. 06
    2018语言模型

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding: 把双向预训练加任务微调变成自然语言理解的通用范式。

    原论文
  7. 07
    2020语言模型

    Scaling Laws for Neural Language Models

    Jared Kaplan et al.

    Scaling Laws for Neural Language Models: 用可预测的幂律关系解释模型、数据和算力如何共同决定损失。

    原论文
  8. 08
    2020语言模型

    Language Models are Few-Shot Learners

    Tom B. Brown et al.

    Language Models are Few-Shot Learners: 证明足够大的语言模型可以只靠提示中的少量例子完成大量新任务。

    原论文
  9. 09
    2020语言模型

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

    Patrick Lewis et al.

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks: 把参数记忆和可更新的外部检索结合起来,成为企业知识问答的基础架构。

    原论文
  10. 10
    2020生成模型

    Denoising Diffusion Probabilistic Models

    Jonathan Ho, Ajay Jain, Pieter Abbeel

    Denoising Diffusion Probabilistic Models: 把逐步加噪与去噪变成稳定的高质量生成方法,打开了扩散模型时代。

    原论文
  11. 11
    2020计算机视觉

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale: 证明把图像切成 patch 后,纯 Transformer 也能在视觉任务上胜过卷积网络。

    原论文
  12. 12
    2021多模态

    Learning Transferable Visual Models From Natural Language Supervision

    Alec Radford et al.

    Learning Transferable Visual Models From Natural Language Supervision: 用海量图文对齐训练出可零样本迁移的视觉模型,连接了图像和语言。

    原论文
  13. 13
    2021语言模型

    LoRA: Low-Rank Adaptation of Large Language Models

    Edward J. Hu et al.

    LoRA: Low-Rank Adaptation of Large Language Models: 只训练低秩增量就能适配大模型,大幅降低微调的显存和存储成本。

    原论文
  14. 14
    2021生成模型

    High-Resolution Image Synthesis with Latent Diffusion Models

    Robin Rombach et al.

    High-Resolution Image Synthesis with Latent Diffusion Models: 把扩散过程搬到压缩潜空间,让高分辨率文生图在成本上真正可用。

    原论文
  15. 15
    2022推理与 Agent

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    Jason Wei et al.

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: 少量带中间步骤的示例就能显著提升大模型的复杂推理表现。

    原论文
  16. 16
    2022语言模型

    Training language models to follow instructions with human feedback

    Long Ouyang et al.

    Training language models to follow instructions with human feedback: 把人类偏好反馈用于指令跟随,奠定了现代对话式 AI 的训练路径。

    原论文
  17. 17
    2022语言模型

    Training Compute-Optimal Large Language Models

    Jordan Hoffmann et al.

    Training Compute-Optimal Large Language Models: 指出许多大模型参数过多、数据过少,并重写了固定算力下的训练配比。

    原论文
  18. 18
    2022推理与 Agent

    ReAct: Synergizing Reasoning and Acting in Language Models

    Shunyu Yao et al.

    ReAct: Synergizing Reasoning and Acting in Language Models: 让模型交替进行推理与工具行动,成为今天 Agent 工作循环的直接原型。

    原论文
  19. 19
    2023计算机视觉

    Segment Anything

    Alexander Kirillov et al.

    Segment Anything: 把图像分割变成可提示、可迁移的基础能力,并配套发布了大规模数据。

    原论文
  20. 20
    2023多模态

    Visual Instruction Tuning

    Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

    Visual Instruction Tuning: 用视觉指令数据把图像编码器和语言模型接成可对话的多模态助手。

    原论文