Transformer 论文学习路径
从 Transformer 原论文读懂现代 AI
《Attention Is All You Need》最重要的变化,是用注意力机制替代序列模型中的循环结构,让不同位置可以直接建立联系,也让训练更容易并行。它最初验证的是机器翻译,并不等于论文当时已经证明了所有大语言模型能力;BERT、GPT-3、ViT 和后续多模态工作,才一步步扩展了这条路线。
PaperBridge Editorial·July 21, 2026
六篇论文组成的 Transformer 主线
先理解注意力
先读 Transformer 的输入、位置编码、自注意力、前馈层和编码器—解码器结构,不必第一遍推导所有公式。
再看预训练与规模
BERT 展示双向预训练,GPT-3 展示规模与上下文学习,说明同一骨架如何走向不同能力。
最后看跨模态与适配
ViT 把图像变成 patch token,LoRA 降低适配成本,LLaVA 连接视觉编码器与语言模型。
Transformer 发展路线中的关键论文
按下面顺序阅读,可以把“注意力结构”与后来出现的语言、视觉和多模态能力分开理解。
- 01
2017 · Ashish Vaswani et al.
Attention Is All You Need
Transformer 用注意力替代循环结构,成为大语言模型与多模态模型的共同底座。
- 02
2018 · Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
把双向预训练加任务微调变成自然语言理解的通用范式。
- 03
2020 · Tom B. Brown et al.
Language Models are Few-Shot Learners
证明足够大的语言模型可以只靠提示中的少量例子完成大量新任务。
- 04
2020 · Alexey Dosovitskiy et al.
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
证明把图像切成 patch 后,纯 Transformer 也能在视觉任务上胜过卷积网络。
- 05
2021 · Edward J. Hu et al.
LoRA: Low-Rank Adaptation of Large Language Models
只训练低秩增量就能适配大模型,大幅降低微调的显存和存储成本。
- 06
2023 · Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee
Visual Instruction Tuning
用视觉指令数据把图像编码器和语言模型接成可对话的多模态助手。
FAQ
Transformer 论文常见问题
Transformer 和自注意力是什么关系?
自注意力是 Transformer 的核心计算模块之一;完整 Transformer 还包括多头注意力、位置编码、前馈网络、残差连接和归一化等部分。
Attention Is All You Need 证明了什么?
论文直接证明的是:只用注意力构建的序列转导模型,在当时的机器翻译任务上可以达到更好的质量,并显著提高训练并行性。
BERT 和 GPT 都是 Transformer 吗?
是,但使用方式不同。BERT 主要使用编码器并做双向上下文预训练;GPT 系列主要使用自回归解码器,从左到右预测后续 token。