まず注意機構
入力token、位置情報、自己注意、フィードフォワード層、エンコーダ—デコーダを追い、数式の導出は二回目に回します。
Transformer論文の学習ルート
Attention Is All You Needは、系列モデルの再帰構造を注意機構に置き換え、離れた位置を直接結び、学習を並列化しやすくしました。原論文が直接検証したのは機械翻訳です。BERT、GPT-3、Vision Transformer、マルチモーダル研究が、その基礎を段階的に別の能力へ拡張しました。
入力token、位置情報、自己注意、フィードフォワード層、エンコーダ—デコーダを追い、数式の導出は二回目に回します。
BERTは双方向事前学習、GPT-3は規模と文脈内学習を示し、同じ骨格の異なる使い方を明らかにしました。
ViTは画像patchをtoken化し、LoRAは適応コストを下げ、LLaVAは視覚表現と言語モデルをつなぎました。
原型の構造と、後続研究で示された言語・画像・マルチモーダル能力を分けて理解できます。
双方向の事前学習とタスク別微調整を、自然言語理解の標準的な方法にしました。
大規模化した言語モデルが、少数の例を含むプロンプトだけで多様な課題に対応できると示しました。
画像をパッチに分ければ、純粋なTransformerでも大規模画像認識で畳み込み網を上回れると示しました。
全パラメータを学習し直さず、小さな低ランク更新だけで大規模モデルを適応させました。
視覚指示チューニングにより画像エンコーダと言語モデルをつなぎ、対話型マルチモーダル助手を作りました。
FAQ
同じではありません。自己注意は中心的な部品で、完全なTransformerには多頭注意、位置情報、フィードフォワード網、残差接続、正規化なども含まれます。
注意だけで構成した系列変換モデルが、当時の機械翻訳で高い品質を達成し、学習の並列性を大きく改善できると示しました。
はい。BERTは主に双方向エンコーダ、GPTは前のtokenから次を予測する自己回帰デコーダを使います。