レポート一覧へ

AI / Technology

思考の連鎖プロンプティングは大規模言語モデルから推論を引き出す

この論文についての3つの重要な質問

思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すはどの課題を扱いますか?

常識推論では PaLM 540B が StrategyQA で75.6%となり、当時の既存最高69.4%を上回ったが、CSQA の改善は小さかった。記号操作の玩具課題では、大規模モデルのCoTが、見本より長い列にもある程度一般化した。ただし論文自身が、見本に完全な解法構造がある単純化された課題だと注意している。さらに、CoTの改善は小型モデルでは安定せず、算数表でもLaMDA 420MやGPT 350Mでは多くの項目が悪化した。[出典: §4, Figure 7; §5, Figure 8; Table 2]

思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すの中心的な主張を支える根拠は何ですか?

小学校レベルの多段階文章題 GSM8K で、PaLM 540B は標準プロンプト17.9%に対しCoT 56.9%、39.0ポイント増だった。論文掲載時の既存最高値55%も上回った。同じPaLM 540Bで SVAMP は69.4%→79.0%、MAWPS は79.2%→93.3%だった。一方 ASDiv は72.1%→73.9%と伸びが小さく、AQuA は25.2%→35.8%だった。[出典: Table 1; Table 2; Figure 2]

思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すを読むときに注意すべき限界は何ですか?

小学校レベルの多段階文章題 GSM8K で、PaLM 540B は標準プロンプト17.9%に対しCoT 56.9%、39.0ポイント増だった。論文掲載時の既存最高値55%も上回った。同じPaLM 540Bで SVAMP は69.4%→79.0%、MAWPS は79.2%→93.3%だった。一方 ASDiv は72.1%→73.9%と伸びが小さく、AQuA は25.2%→35.8%だった。[出典: Table 1; Table 2; Figure 2]

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード