レポート一覧へ

AI / Technology

ニューラル言語モデルのスケーリング則

この論文についての3つの重要な質問

ニューラル言語モデルのスケーリング則はどの課題を扱いますか?

図3 — 実測された範囲の滑らかさと、その外側の確実さは別問題である。空の棚はデータ制約、疑問符は理論不足、格子は省略された計算項の影響を表す。根拠: §6.3、Appendix C。

ニューラル言語モデルのスケーリング則の中心的な主張を支える根拠は何ですか?

著者らは主に decoder-only Transformer を WebText2 で学習し、1024トークンの文脈における自己回帰対数尤度、つまり交差エントロピー損失を測った。比較用に LSTM と recurrent Transformer も扱った。WebText2 は 2,030万文書、96 GB のテキストから成り、別分布として Books Corpus、Common Crawl、英語版Wikipedia、Internet Books でも評価した。[論文 §2、§3.2.1–3.2.2]

ニューラル言語モデルのスケーリング則を読むときに注意すべき限界は何ですか?

最も強い証拠は、一点の最高性能ではなく、多数の規模をまたいで滑らかな傾向が現れたことにある。異なるテキスト分布でも、WebText2上の改善とほぼ並行して損失が下がった。ただし、これは下流タスク能力や人間の好み、安全性が同じ則で伸びることを直接示さない。[論文 §3.2.2]

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード