レポート一覧へ

AI / Technology

言語モデルは少数例から学べる

この論文についての3つの重要な質問

言語モデルは少数例から学べるはどの課題を扱いますか?

一言でいえば、この論文の転換点は「タスクごとに学習し直す」から「その場の文章でタスクを伝える」へ重心を移したことです。最も強い証拠は、モデル規模の増加とともに少数例の利用効果が多くの課題で伸びたこと。最大の未解決点は、それが未知の技能を本当に学んだのか、事前学習で見たパターンを巧みに呼び出したのかを切り分けきれていないことです。

言語モデルは少数例から学べるの中心的な主張を支える根拠は何ですか?

GPT-3は、次の語を予測する自己回帰型Transformerです。最大モデルは1750億パラメータで、比較のため1.25億から130億までの小型モデル群も訓練しました。これにより「モデルを大きくすると文脈内学習がどう変わるか」を同じ系統内で調べています。(概要、本文 pp. 5, 8、Table 2.1)

言語モデルは少数例から学べるを読むときに注意すべき限界は何ですか?

この2例は「少数例が常に効く」証明ではありませんが、重みを更新せず、入力に例を足すだけで性能が上がることを具体的に示します。さらに42件の正解率ベンチマークを集約した分析では、モデルが大きいほど few-shot の伸びが zero-shot より速い傾向が見られました。ただし著者らは、この集約値自体を厳密な単一ベンチマークと見なすべきではないと注意しています。(本文 pp. 4–5)

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード