レポート一覧へ

AI / Technology

計算予算に対して、モデルを大きくするより学習を十分に行うべきかを調べた研究

この論文についての3つの重要な質問

計算予算に対して、モデルを大きくするより学習を十分に行うべきかを調べた研究はどの課題を扱いますか?

大規模言語モデルの学習では、使えるアクセラレータ数と期間、つまり計算予算が先に決まることがよくあります。その予算を「もっと大きいモデル」に使うか、「より多くの文章を読ませる」ことに使うかが本論文の問いです(本文 §1)。当時の GPT-3、Jurassic-1、Gopher、MT-NLG は、モデルサイズが 175B から 530B と違っても、学習量はおおむね 270B〜300B tokens に集中していました(Table 1)。著者らは、ここに学習不足があると考えました。

計算予算に対して、モデルを大きくするより学習を十分に行うべきかを調べた研究の中心的な主張を支える根拠は何ですか?

同じ学習計算量で、Chinchilla は MMLU 57課題の 5-shot 平均が 67.6%、Gopher は 60.0% でした。個別では 51/57 課題で上、2課題で同じ、4課題で下です(Table 6、Figure 6)。BIG-bench 62課題の平均も 65.1% 対 54.4% で、Chinchilla が 10.7ポイント高く、58/62 課題で上回りました(本文 §4.2.4)。「小さいモデルを長く学習させる」という配分が、学習損失だけでなく下流評価にもつながったことが、この論文の強い証拠です。

計算予算に対して、モデルを大きくするより学習を十分に行うべきかを調べた研究を読むときに注意すべき限界は何ですか?

同じ学習計算量で、Chinchilla は MMLU 57課題の 5-shot 平均が 67.6%、Gopher は 60.0% でした。個別では 51/57 課題で上、2課題で同じ、4課題で下です(Table 6、Figure 6)。BIG-bench 62課題の平均も 65.1% 対 54.4% で、Chinchilla が 10.7ポイント高く、58/62 課題で上回りました(本文 §4.2.4)。「小さいモデルを長く学習させる」という配分が、学習損失だけでなく下流評価にもつながったことが、この論文の強い証拠です。

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード