Transformer論文の学習ルート

原論文からTransformerと現代AIを理解する

Attention Is All You Needは、系列モデルの再帰構造を注意機構に置き換え、離れた位置を直接結び、学習を並列化しやすくしました。原論文が直接検証したのは機械翻訳です。BERT、GPT-3、Vision Transformer、マルチモーダル研究が、その基礎を段階的に別の能力へ拡張しました。

PaperBridge Editorial·July 21, 2026

6本でたどるTransformerの流れ

まず注意機構

入力token、位置情報、自己注意、フィードフォワード層、エンコーダ—デコーダを追い、数式の導出は二回目に回します。

事前学習と規模

BERTは双方向事前学習、GPT-3は規模と文脈内学習を示し、同じ骨格の異なる使い方を明らかにしました。

画像と適応

ViTは画像patchをtoken化し、LoRAは適応コストを下げ、LLaVAは視覚表現と言語モデルをつなぎました。

Transformer系譜の重要論文

原型の構造と、後続研究で示された言語・画像・マルチモーダル能力を分けて理解できます。

  1. 01

    2017 · Ashish Vaswani et al.

    Attention Is All You Need

    再帰構造を注意機構に置き換え、現在の基盤モデルに共通する土台になりました。

  2. 02

    2018 · Jacob Devlin, Ming-Wei Chang, Kenton Lee, Kristina Toutanova

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    双方向の事前学習とタスク別微調整を、自然言語理解の標準的な方法にしました。

  3. 03

    2020 · Tom B. Brown et al.

    Language Models are Few-Shot Learners

    大規模化した言語モデルが、少数の例を含むプロンプトだけで多様な課題に対応できると示しました。

  4. 04

    2020 · Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    画像をパッチに分ければ、純粋なTransformerでも大規模画像認識で畳み込み網を上回れると示しました。

  5. 05

    2021 · Edward J. Hu et al.

    LoRA: Low-Rank Adaptation of Large Language Models

    全パラメータを学習し直さず、小さな低ランク更新だけで大規模モデルを適応させました。

  6. 06

    2023 · Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

    Visual Instruction Tuning

    視覚指示チューニングにより画像エンコーダと言語モデルをつなぎ、対話型マルチモーダル助手を作りました。

FAQ

Transformer論文のFAQ

自己注意とTransformerは同じですか?

同じではありません。自己注意は中心的な部品で、完全なTransformerには多頭注意、位置情報、フィードフォワード網、残差接続、正規化なども含まれます。

Attention Is All You Needは何を証明しましたか?

注意だけで構成した系列変換モデルが、当時の機械翻訳で高い品質を達成し、学習の並列性を大きく改善できると示しました。

BERTとGPTはどちらもTransformerですか?

はい。BERTは主に双方向エンコーダ、GPTは前のtokenから次を予測する自己回帰デコーダを使います。