Transformer 论文学习路径

从 Transformer 原论文读懂现代 AI

《Attention Is All You Need》最重要的变化,是用注意力机制替代序列模型中的循环结构,让不同位置可以直接建立联系,也让训练更容易并行。它最初验证的是机器翻译,并不等于论文当时已经证明了所有大语言模型能力;BERT、GPT-3、ViT 和后续多模态工作,才一步步扩展了这条路线。

PaperBridge Editorial·July 21, 2026

六篇论文组成的 Transformer 主线

先理解注意力

先读 Transformer 的输入、位置编码、自注意力、前馈层和编码器—解码器结构,不必第一遍推导所有公式。

再看预训练与规模

BERT 展示双向预训练,GPT-3 展示规模与上下文学习,说明同一骨架如何走向不同能力。

最后看跨模态与适配

ViT 把图像变成 patch token,LoRA 降低适配成本,LLaVA 连接视觉编码器与语言模型。

Transformer 发展路线中的关键论文

按下面顺序阅读,可以把“注意力结构”与后来出现的语言、视觉和多模态能力分开理解。

  1. 01

    2017 · Ashish Vaswani et al.

    Attention Is All You Need

    Transformer 用注意力替代循环结构,成为大语言模型与多模态模型的共同底座。

  2. 02

    2018 · Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    把双向预训练加任务微调变成自然语言理解的通用范式。

  3. 03

    2020 · Tom B. Brown et al.

    Language Models are Few-Shot Learners

    证明足够大的语言模型可以只靠提示中的少量例子完成大量新任务。

  4. 04

    2020 · Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    证明把图像切成 patch 后,纯 Transformer 也能在视觉任务上胜过卷积网络。

  5. 05

    2021 · Edward J. Hu et al.

    LoRA: Low-Rank Adaptation of Large Language Models

    只训练低秩增量就能适配大模型,大幅降低微调的显存和存储成本。

  6. 06

    2023 · Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

    Visual Instruction Tuning

    用视觉指令数据把图像编码器和语言模型接成可对话的多模态助手。

FAQ

Transformer 论文常见问题

Transformer 和自注意力是什么关系?

自注意力是 Transformer 的核心计算模块之一;完整 Transformer 还包括多头注意力、位置编码、前馈网络、残差连接和归一化等部分。

Attention Is All You Need 证明了什么?

论文直接证明的是:只用注意力构建的序列转导模型,在当时的机器翻译任务上可以达到更好的质量,并显著提高训练并行性。

BERT 和 GPT 都是 Transformer 吗?

是,但使用方式不同。BERT 主要使用编码器并做双向上下文预训练;GPT 系列主要使用自回归解码器,从左到右预测后续 token。