AI 论文学习路径

读懂现代 AI 的 20 篇关键论文

如果只想建立一张可靠的现代 AI 地图,可以先读 AlexNet、ResNet 和 Transformer 理解模型结构,再沿 BERT、GPT-3、RAG、InstructGPT 理解语言模型,最后补上扩散模型、多模态和 Agent。下面不是按引用量机械排名,而是选择真正改变了模型结构、训练方法或产品形态的论文。

PaperBridge Editorial·July 21, 2026

按目标选择阅读顺序

模型结构基础

AlexNet → ResNet → Transformer → Vision Transformer,理解卷积、残差连接与注意力如何改变模型骨架。

大语言模型

BERT → Scaling Laws → GPT-3 → RAG → InstructGPT → Chinchilla,理解预训练、规模、检索和对齐。

生成与 Agent

VAE → GAN → DDPM → Latent Diffusion,再读 Chain-of-Thought 与 ReAct,连接生成、推理和行动。

20 篇论文及其关键变化

每一项都链接到原论文;已有中文图解时,可直接进入 PaperBridge 解读。

  1. 01

    2012 · Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton

    ImageNet Classification with Deep Convolutional Neural Networks

    GPU、大数据和深层卷积网络第一次以压倒性优势连成了一条可规模化的视觉路线。

  2. 02

    2013 · Diederik P. Kingma, Max Welling

    Auto-Encoding Variational Bayes

    把概率生成模型变成可用反向传播训练的神经网络,为可控潜空间奠定基础。

  3. 03

    2014 · Ian J. Goodfellow et al.

    Generative Adversarial Networks

    用生成器与判别器的对抗博弈重新定义了图像生成,并影响了一代生成模型。

  4. 04

    2015 · Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun

    Deep Residual Learning for Image Recognition

    残差连接解决了深层网络越深越难训练的问题,今天仍是大量模型的基本结构。

  5. 05

    2017 · Ashish Vaswani et al.

    Attention Is All You Need

    Transformer 用注意力替代循环结构,成为大语言模型与多模态模型的共同底座。

  6. 06

    2018 · Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    把双向预训练加任务微调变成自然语言理解的通用范式。

  7. 07

    2020 · Jared Kaplan et al.

    Scaling Laws for Neural Language Models

    用可预测的幂律关系解释模型、数据和算力如何共同决定损失。

  8. 08

    2020 · Tom B. Brown et al.

    Language Models are Few-Shot Learners

    证明足够大的语言模型可以只靠提示中的少量例子完成大量新任务。

  9. 09

    2020 · Patrick Lewis et al.

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

    把参数记忆和可更新的外部检索结合起来,成为企业知识问答的基础架构。

  10. 10

    2020 · Jonathan Ho, Ajay Jain, Pieter Abbeel

    Denoising Diffusion Probabilistic Models

    把逐步加噪与去噪变成稳定的高质量生成方法,打开了扩散模型时代。

  11. 11

    2020 · Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    证明把图像切成 patch 后,纯 Transformer 也能在视觉任务上胜过卷积网络。

  12. 12

    2021 · Alec Radford et al.

    Learning Transferable Visual Models From Natural Language Supervision

    用海量图文对齐训练出可零样本迁移的视觉模型,连接了图像和语言。

  13. 13

    2021 · Edward J. Hu et al.

    LoRA: Low-Rank Adaptation of Large Language Models

    只训练低秩增量就能适配大模型,大幅降低微调的显存和存储成本。

  14. 14

    2021 · Robin Rombach et al.

    High-Resolution Image Synthesis with Latent Diffusion Models

    把扩散过程搬到压缩潜空间,让高分辨率文生图在成本上真正可用。

  15. 15

    2022 · Jason Wei et al.

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    少量带中间步骤的示例就能显著提升大模型的复杂推理表现。

  16. 16

    2022 · Long Ouyang et al.

    Training language models to follow instructions with human feedback

    把人类偏好反馈用于指令跟随,奠定了现代对话式 AI 的训练路径。

  17. 17

    2022 · Jordan Hoffmann et al.

    Training Compute-Optimal Large Language Models

    指出许多大模型参数过多、数据过少,并重写了固定算力下的训练配比。

  18. 18

    2022 · Shunyu Yao et al.

    ReAct: Synergizing Reasoning and Acting in Language Models

    让模型交替进行推理与工具行动,成为今天 Agent 工作循环的直接原型。

  19. 19

    2023 · Alexander Kirillov et al.

    Segment Anything

    把图像分割变成可提示、可迁移的基础能力,并配套发布了大规模数据。

  20. 20

    2023 · Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

    Visual Instruction Tuning

    用视觉指令数据把图像编码器和语言模型接成可对话的多模态助手。

FAQ

关于 AI 必读论文的常见问题

AI 初学者应该先读哪篇论文?

建议先读 Transformer 的《Attention Is All You Need》,再根据兴趣选择 BERT、RAG 或扩散模型。阅读前可先用 AI 论文阅读指南建立问题、方法、证据和局限四个检查点。

需要把 20 篇论文全部读完吗?

不需要。产品读者可以先读摘要、方法图、主结果和局限;工程师再深入公式、训练配置、基线和消融实验。

为什么列表里没有所有热门大模型论文?

这份列表强调研究路线的关键转折,而不是品牌或热度。它优先选择能解释后续大量工作的基础论文。