AI / Technology
言語モデルは少数例から学べる
微調整と文脈内学習の違い
図1|上段は大量の正解例で重みを更新する微調整、下段は少数例を入力文脈に置き、重みを固定したまま答える文脈内学習。論文 Figure 2.1 の複製ではなく、本文 pp. 5–6 に基づく説明図。
当時の主流は、大量の文章で事前学習した後、目的ごとに数千〜数十万件の正解例でモデルの重みを更新する微調整でした。性能は高い一方、新しい仕事のたびにデータ収集と再学習が必要です。論文が問うたのは、もっと人間に近く、短い指示や数例だけで新しい言語タスクへ切り替えられないか、ということでした。(本文 pp. 2–3, 5)
文脈内学習の推論フロー
図2|指示と入出力例を一つの文脈に並べ、固定したモデルが並び方を手掛かりに次の続きを予測する。本文 pp. 3–6 に基づく説明図。
どの条件でも評価時の勾配更新や微調整はありません。違うのは、入力文に何件の見本を含めるかです。(本文 pp. 4–6)
確認できた能力と残る限界
図3|同じモデルに、測定できた能力と未解決のリスクが併存する。線は因果ではなく対応関係。本文 pp. 10–38 と付録Cに基づく説明図。
GPT-3は、ANLIやWiCではone-shot・few-shotでもほぼ偶然水準にとどまり、RACEやQuACなど一部の読解も弱い結果でした。生成文は長くなると反復、矛盾、話のつながらない文が現れます。また訓練集合にウェブ文書を使うため、ベンチマークのテスト例が混ざる可能性があります。著者らはN-gram重複を検査し、深刻な集合は非掲載または印付きにしましたが、前処理の不具合が判明しても計算費用のため再訓練できませんでした。(本文 pp. 5, 32–33、付録C pp. 43–45)
研究付録
原題: Language Models are Few-Shot Learners
著者: Tom B. Brown ほか(OpenAI)
公開: arXiv:2005.14165v4、2020年7月22日
一次資料: arXiv概要・論文PDF
要点
3つだけ覚えるなら
- 新しいタスクごとにモデルを再訓練しなくても、指示と少数の例を文章として渡せば解ける場合がある。 GPT-3では、推論時に重みを更新しない「文脈内学習」を、zero-shot・one-shot・few-shotの3条件で広く検証した。(本文 pp. 4–6)
- 大きくするほど、例を文脈から利用する力が伸びた。 最大モデルは1750億パラメータで、少数例条件では質問応答・翻訳・穴埋めなどの一部で、タスク別に微調整した当時の強力な手法に近づくか上回った。(概要、本文 pp. 4–5)
- 万能性の証明ではない。 ANLI、WiC、一部の読解では弱く、ウェブ由来の訓練データとテスト集合の重複、長文の一貫性、社会的な偏りも残る。(本文 pp. 5, 32–38、付録C)
一言でいえば、この論文の転換点は「タスクごとに学習し直す」から「その場の文章でタスクを伝える」へ重心を移したことです。最も強い証拠は、モデル規模の増加とともに少数例の利用効果が多くの課題で伸びたこと。最大の未解決点は、それが未知の技能を本当に学んだのか、事前学習で見たパターンを巧みに呼び出したのかを切り分けきれていないことです。
問題
タスクごとの大量データ
当時の主流は、大量の文章で事前学習した後、目的ごとに数千〜数十万件の正解例でモデルの重みを更新する微調整でした。性能は高い一方、新しい仕事のたびにデータ収集と再学習が必要です。論文が問うたのは、もっと人間に近く、短い指示や数例だけで新しい言語タスクへ切り替えられないか、ということでした。(本文 pp. 2–3, 5)
何を「学習」と呼ぶのか
ここでの few-shot learning は、推論中にモデル内部の重みを書き換える学習ではありません。例を含む入力列の中で規則を読み取り、続きとして答えを生成することを指します。著者ら自身も、未知のタスクを一から学んだのか、訓練中に見たパターンを認識したのかについて、この用語は中立だと明記しています。(本文 pp. 3–4)
方法
1750億パラメータへの拡大
GPT-3は、次の語を予測する自己回帰型Transformerです。最大モデルは1750億パラメータで、比較のため1.25億から130億までの小型モデル群も訓練しました。これにより「モデルを大きくすると文脈内学習がどう変わるか」を同じ系統内で調べています。(概要、本文 pp. 5, 8、Table 2.1)
3つの提示条件
- zero-shot: 自然言語の指示だけ。
- one-shot: 指示に加えて例を1件。
- few-shot: 文脈窓に入るだけの例を提示。典型的には10〜100件で、文脈長は2048トークン。
どの条件でも評価時の勾配更新や微調整はありません。違うのは、入力文に何件の見本を含めるかです。(本文 pp. 4–6)
広い課題で同じ使い方を試す
評価は二十数個以上のNLPデータセットにまたがり、質問応答、翻訳、穴埋め、常識推論、読解に加えて、単語の並べ替え、3桁計算、新語を文中で使う課題も含みます。狙いは一つのベンチマークの最高点ではなく、同じ「文章でタスクを渡す」方法がどこまで横断的に通じるかを見ることでした。(本文 pp. 4, 10–29)
証拠と限界
数字で見える前進
| 評価 | zero-shot | one-shot | few-shot | 読み方 |
|---|---|---|---|---|
| CoQA | 81.5 F1 | 84.0 F1 | 85.0 F1 | 例を増やすと会話型質問応答が改善 |
| TriviaQA(closed-book) | 64.3% | 68.0% | 71.2% | few-shotは同条件の微調整モデルに対して当時の最高水準 |
この2例は「少数例が常に効く」証明ではありませんが、重みを更新せず、入力に例を足すだけで性能が上がることを具体的に示します。さらに42件の正解率ベンチマークを集約した分析では、モデルが大きいほど few-shot の伸びが zero-shot より速い傾向が見られました。ただし著者らは、この集約値自体を厳密な単一ベンチマークと見なすべきではないと注意しています。(本文 pp. 4–5)
失敗と測定上の注意
GPT-3は、ANLIやWiCではone-shot・few-shotでもほぼ偶然水準にとどまり、RACEやQuACなど一部の読解も弱い結果でした。生成文は長くなると反復、矛盾、話のつながらない文が現れます。また訓練集合にウェブ文書を使うため、ベンチマークのテスト例が混ざる可能性があります。著者らはN-gram重複を検査し、深刻な集合は非掲載または印付きにしましたが、前処理の不具合が判明しても計算費用のため再訓練できませんでした。(本文 pp. 5, 32–33、付録C pp. 43–45)
偏りの予備分析では、人種・性別・宗教に関するステレオタイプや不均衡な連想が観察されました。これは少数例学習の精度とは別軸の問題で、用途判断には性能表だけでなく、出力監査と人による確認が必要だと読めます。後半は本稿による実務上の解釈であり、論文の直接的な実験結論ではありません。(本文 pp. 35–38)
実務的な意味
プロンプトが軽量な設定面になる
実務上の重要な示唆は、指示と例を入力に置くことで、再学習なしに試せる仕事の範囲が広がることです。これは、試作や要件変更への対応を速められる可能性を示します。ただし論文が確立したのは、限られた評価条件での「可能性」であり、品質保証・コスト・速度・安全性を含む本番運用の優位性ではありません。
導入前に確かめること
- 自社の実データで、zero-shot・one-shot・few-shotを同じ採点方法で比較する。
- 例の順序や書き方を変え、結果が安定するかを見る。
- テスト例と事前学習データの重複を完全には把握できない前提で、非公開の評価集合を用意する。
- 長文、一貫性、偏り、誤答コストが高い場面では、人の確認と失敗時の逃げ道を設計する。
この論文を「数例だけで何でも学べる」と読むのは強すぎます。より正確には、十分に大きな言語モデルは、重みを変えなくても、入力中の指示と例を使って多様な課題へかなり適応できる。ただし、その強さは課題ごとに大きく異なり、データ混入や偏りを含む評価上・社会上の限界が残る、という結果です。
この論文についての3つの重要な質問
言語モデルは少数例から学べるはどの課題を扱いますか?
一言でいえば、この論文の転換点は「タスクごとに学習し直す」から「その場の文章でタスクを伝える」へ重心を移したことです。最も強い証拠は、モデル規模の増加とともに少数例の利用効果が多くの課題で伸びたこと。最大の未解決点は、それが未知の技能を本当に学んだのか、事前学習で見たパターンを巧みに呼び出したのかを切り分けきれていないことです。
言語モデルは少数例から学べるの中心的な主張を支える根拠は何ですか?
GPT-3は、次の語を予測する自己回帰型Transformerです。最大モデルは1750億パラメータで、比較のため1.25億から130億までの小型モデル群も訓練しました。これにより「モデルを大きくすると文脈内学習がどう変わるか」を同じ系統内で調べています。(概要、本文 pp. 5, 8、Table 2.1)
言語モデルは少数例から学べるを読むときに注意すべき限界は何ですか?
この2例は「少数例が常に効く」証明ではありませんが、重みを更新せず、入力に例を足すだけで性能が上がることを具体的に示します。さらに42件の正解率ベンチマークを集約した分析では、モデルが大きいほど few-shot の伸びが zero-shot より速い傾向が見られました。ただし著者らは、この集約値自体を厳密な単一ベンチマークと見なすべきではないと注意しています。(本文 pp. 4–5)