模型结构基础
AlexNet → ResNet → Transformer → Vision Transformer,理解卷积、残差连接与注意力如何改变模型骨架。
策展阅读路径
不是按引用量机械排名,而是选出真正改变模型结构、训练方法和产品形态的论文。每篇都会提供中文、英文和日文图文解读。
如果你想系统理解现代 AI,可以先读 AlexNet、ResNet 和 Transformer 建立模型结构主线,再沿着 BERT、GPT-3、RAG 与 InstructGPT 理解语言模型,最后补上扩散模型、多模态和 Agent。下面 20 篇按发表时间排序,每篇都说明它改变了什么。
AlexNet → ResNet → Transformer → Vision Transformer,理解卷积、残差连接与注意力如何改变模型骨架。
BERT → Scaling Laws → GPT-3 → RAG → InstructGPT → Chinchilla,理解预训练、规模、检索与对齐。
VAE → GAN → DDPM → Latent Diffusion,再读 Chain-of-Thought 与 ReAct,连接生成、推理和工具行动。
ImageNet Classification with Deep Convolutional Neural Networks: GPU、大数据和深层卷积网络第一次以压倒性优势连成了一条可规模化的视觉路线。
原论文Auto-Encoding Variational Bayes: 把概率生成模型变成可用反向传播训练的神经网络,为可控潜空间奠定基础。
原论文Generative Adversarial Networks: 用生成器与判别器的对抗博弈重新定义了图像生成,并影响了一代生成模型。
原论文Deep Residual Learning for Image Recognition: 残差连接解决了深层网络越深越难训练的问题,今天仍是大量模型的基本结构。
原论文BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding: 把双向预训练加任务微调变成自然语言理解的通用范式。
原论文Scaling Laws for Neural Language Models: 用可预测的幂律关系解释模型、数据和算力如何共同决定损失。
原论文Language Models are Few-Shot Learners: 证明足够大的语言模型可以只靠提示中的少量例子完成大量新任务。
原论文Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks: 把参数记忆和可更新的外部检索结合起来,成为企业知识问答的基础架构。
原论文Denoising Diffusion Probabilistic Models: 把逐步加噪与去噪变成稳定的高质量生成方法,打开了扩散模型时代。
原论文An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale: 证明把图像切成 patch 后,纯 Transformer 也能在视觉任务上胜过卷积网络。
原论文Learning Transferable Visual Models From Natural Language Supervision: 用海量图文对齐训练出可零样本迁移的视觉模型,连接了图像和语言。
原论文LoRA: Low-Rank Adaptation of Large Language Models: 只训练低秩增量就能适配大模型,大幅降低微调的显存和存储成本。
原论文High-Resolution Image Synthesis with Latent Diffusion Models: 把扩散过程搬到压缩潜空间,让高分辨率文生图在成本上真正可用。
原论文Chain-of-Thought Prompting Elicits Reasoning in Large Language Models: 少量带中间步骤的示例就能显著提升大模型的复杂推理表现。
原论文Training language models to follow instructions with human feedback: 把人类偏好反馈用于指令跟随,奠定了现代对话式 AI 的训练路径。
原论文Training Compute-Optimal Large Language Models: 指出许多大模型参数过多、数据过少,并重写了固定算力下的训练配比。
原论文ReAct: Synergizing Reasoning and Acting in Language Models: 让模型交替进行推理与工具行动,成为今天 Agent 工作循环的直接原型。
原论文