AI / Technology
思考の連鎖プロンプティングは大規模言語モデルから推論を引き出す
標準プロンプトは答えへ直行する一方、CoTプロンプトは途中ステップを例と出力に含める
図1 — 変更点はモデルではなく、少数例に途中ステップを含めること。論文 Figure 1 の複製ではなく、本文に基づく説明図。
標準プロンプトでは、見本は〈入力, 出力〉である。CoTプロンプティングでは、これを〈入力, 自然言語の途中ステップ, 出力〉に変える。算数実験では、著者らが手作業した8件の見本を主に使った。テスト時には新しい問題を続け、モデル自身に途中ステップと最終回答を順番に生成させる。追加学習やタスク別モデルは使っていない。[出典: §2; §3.1; §6]
CoTの効果は小型モデルでは安定せず、大規模モデルで段階的な処理として現れたという概念図
図2 — 論文が報告した規模依存の傾向を表す概念図。数値グラフではない。
常識推論では PaLM 540B が StrategyQA で75.6%となり、当時の既存最高69.4%を上回ったが、CSQA の改善は小さかった。記号操作の玩具課題では、大規模モデルのCoTが、見本より長い列にもある程度一般化した。ただし論文自身が、見本に完全な解法構造がある単純化された課題だと注意している。さらに、CoTの改善は小型モデルでは安定せず、算数表でもLaMDA 420MやGPT 350Mでは多くの項目が悪化した。[出典: §4, Figure 7; §5, Figure 8; Table 2]
モデルが生成した途中ステップと最終回答を検証してから利用判断へ進める流れ
図3 — CoT出力を実務で扱う際の安全な読み方。検証フローは論文の限界から導いた実務的な解釈。
途中ステップは、デバッグや誤り発見の手掛かりにはなるが、正解証明ではない。高影響の用途では、最終回答だけでなく前提、計算、事実を外部ルール・計算機・参照資料・人の確認で検証する設計が必要になる。論文でも、生成した式を外部計算機で評価すると多くの算数課題で改善した。[出典: §2; Appendix B, Table 1]
研究付録
原題: Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
著者: Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc V. Le, Denny Zhou
発表: NeurIPS 2022 / arXiv:2201.11903v6
一次ソース: arXiv 論文ページ · PDF
要点
3つだけ覚えるなら
- 答えだけの例より、途中の解き方を含む例を見せる。 これが思考の連鎖(Chain-of-Thought、CoT)プロンプティングで、モデル自体の追加学習は要らない。
- 効果は一様ではなく、大規模モデルの難しい多段階問題で強く現れた。 PaLM 540B の GSM8K 正答率は、標準プロンプトの17.9%からCoTの56.9%へ上がった。
- 出てきた説明は真実の保証ではない。 正答でも途中が誤っている例があり、小型モデルや簡単な問題では効果が小さい、あるいは悪化する場合もある。
この論文が変えたのは、モデルの重みではなく、少数例の「答え方」だ。問いと答えだけを並べる代わりに、問い→自然言語の途中ステップ→最終回答という見本を与える。算数、常識、記号操作の実験から、十分に大きなモデルでは、この小さな変更が多段階の問題を解く力を引き出せると示した。最大の未解決リスクは、生成された筋道がもっともらしくても正しいとは限らず、それがモデル内部の本当の計算過程かも分からないことだ。[出典: Abstract; §2; §6]
問題
従来の少数例プロンプトが落とすもの
通常の few-shot prompting は「問題→答え」の組を数件見せ、新しい問題にも答えさせる。単純な質問には便利だが、複数の判断をつなぐ算数・常識・記号操作では、モデルを大きくするだけでも性能が伸びにくかった。最終回答しか例にないため、問題をどう分割し、どの順で処理するかという足場がない。[出典: §1; §3.1]
既存の解決策が高くつく理由
自然言語の解法を大量に付けて学習・微調整する先行研究はあった。しかし、高品質な途中説明を大規模に作るのは、答えだけのラベル付けより手間がかかる。本研究は、その二択を崩し、わずかな解法例をプロンプトに入れるだけで、既製の言語モデルから段階的な出力を引き出そうとした。[出典: §1; §7]
方法
見本を「問題・途中・答え」の三つ組にする
標準プロンプトでは、見本は〈入力, 出力〉である。CoTプロンプティングでは、これを〈入力, 自然言語の途中ステップ, 出力〉に変える。算数実験では、著者らが手作業した8件の見本を主に使った。テスト時には新しい問題を続け、モデル自身に途中ステップと最終回答を順番に生成させる。追加学習やタスク別モデルは使っていない。[出典: §2; §3.1; §6]
なぜ効くと考えられるか
途中ステップを言葉にすると、複雑な問題を小さな処理へ分け、難しい問題ほど長い計算過程を使える。また、どこで間違えたかを人が点検しやすくなる。ただし論文は、表示された文章がニューラルネット内部の計算を忠実に映すとは主張していない。これは振る舞いを観察する窓であって、心の中を読む装置ではない。[出典: §2, properties 1–2; §6 Limitations]
比較実験で切り分けたこと
著者らは「式だけを先に出す」「意味のない点を増やして計算時間だけ延ばす」「答えの後に理由を書く」という代替案を GSM8K で比較した。いずれも完全なCoTほど伸びず、単に出力を長くすることや知識を呼び起こすことだけでは説明しにくい。自然言語で意味をつなぎ、答えより前に順番に生成する点が重要だと解釈された。[出典: §3.3, Figure 5]
証拠と限界
最も強い数値:GSM8K
小学校レベルの多段階文章題 GSM8K で、PaLM 540B は標準プロンプト17.9%に対しCoT 56.9%、39.0ポイント増だった。論文掲載時の既存最高値55%も上回った。同じPaLM 540Bで SVAMP は69.4%→79.0%、MAWPS は79.2%→93.3%だった。一方 ASDiv は72.1%→73.9%と伸びが小さく、AQuA は25.2%→35.8%だった。[出典: Table 1; Table 2; Figure 2]
| 算数ベンチマーク | 標準 | CoT | 差 |
|---|---|---|---|
| GSM8K | 17.9% | 56.9% | +39.0pt |
| SVAMP | 69.4% | 79.0% | +9.6pt |
| ASDiv | 72.1% | 73.9% | +1.8pt |
| AQuA | 25.2% | 35.8% | +10.6pt |
| MAWPS | 79.2% | 93.3% | +14.2pt |
表 — PaLM 540B、外部計算機なし。評価指標は正答率。出典: Table 1。
算数以外と規模依存
常識推論では PaLM 540B が StrategyQA で75.6%となり、当時の既存最高69.4%を上回ったが、CSQA の改善は小さかった。記号操作の玩具課題では、大規模モデルのCoTが、見本より長い列にもある程度一般化した。ただし論文自身が、見本に完全な解法構造がある単純化された課題だと注意している。さらに、CoTの改善は小型モデルでは安定せず、算数表でもLaMDA 420MやGPT 350Mでは多くの項目が悪化した。[出典: §4, Figure 7; §5, Figure 8; Table 2]
何がまだ証明されていないか
- 本当に「推論」しているかは不明。 人間の思考に似た文章を出しても、内部で同じ過程を踏んだ証拠にはならない。[出典: §6 Limitations]
- 途中ステップの正しさは保証されない。 LaMDA 137B の GSM8K を50件ずつ人手確認した分析では、正答50件中2件は誤った筋道から偶然正答し、誤答50件の46%は小さなミス、54%は意味理解や一貫性の大きな誤りだった。標本が小さい点にも注意が要る。[出典: §3.2; Appendix D]
- プロンプトに敏感。 算数では作成者や見本を変えても標準法を概ね上回ったが、Coin Flip は作成者によって99.6%から71.4%まで振れた。[出典: §3.4; Appendix A.2, Table 7]
- 適用範囲と費用に限界がある。 改善は難しい多段階問題と大規模モデルに偏り、簡単な1〜2段階問題では小さい。大規模モデルの提供コスト、手作業による説明例の作成費も残る。翻訳など他タスクへの一般化は未検証である。[出典: §6 Limitations; Appendix A.3]
実務的な意味
向いている場面
この研究から直接言える実務上の候補は、答えまでに複数の判断が必要で、通常プロンプトでは性能が頭打ちになり、十分大きなモデルを使える場面だ。まず少数の高品質な見本で、問題の分割、各段階、最終回答の形式をそろえて比較するとよい。すでに簡単な問題を高精度で解ける場合は、長い出力による遅延と費用に見合わない可能性がある。これは論文の実験条件からの実務的な解釈 であり、あらゆる製品での効果を著者が保証したものではない。[根拠: Appendix A.3; Table 3]
「説明」ではなく検証対象として扱う
途中ステップは、デバッグや誤り発見の手掛かりにはなるが、正解証明ではない。高影響の用途では、最終回答だけでなく前提、計算、事実を外部ルール・計算機・参照資料・人の確認で検証する設計が必要になる。論文でも、生成した式を外部計算機で評価すると多くの算数課題で改善した。[出典: §2; Appendix B, Table 1]
読み終えた後の確認質問
- 同じ見本で、標準プロンプトとCoTを分けて評価したか。
- 正答率だけでなく、途中ステップの誤りと偶然の正答も確認したか。
- 見本の作成者、順番、件数を変えても改善が残るか。
- 小さいモデル、短い問題、実運用の費用でも利点が残るか。
- 生成された説明を、モデル内部の忠実な記録だと誤認していないか。
この論文についての3つの重要な質問
思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すはどの課題を扱いますか?
常識推論では PaLM 540B が StrategyQA で75.6%となり、当時の既存最高69.4%を上回ったが、CSQA の改善は小さかった。記号操作の玩具課題では、大規模モデルのCoTが、見本より長い列にもある程度一般化した。ただし論文自身が、見本に完全な解法構造がある単純化された課題だと注意している。さらに、CoTの改善は小型モデルでは安定せず、算数表でもLaMDA 420MやGPT 350Mでは多くの項目が悪化した。[出典: §4, Figure 7; §5, Figure 8; Table 2]
思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すの中心的な主張を支える根拠は何ですか?
小学校レベルの多段階文章題 GSM8K で、PaLM 540B は標準プロンプト17.9%に対しCoT 56.9%、39.0ポイント増だった。論文掲載時の既存最高値55%も上回った。同じPaLM 540Bで SVAMP は69.4%→79.0%、MAWPS は79.2%→93.3%だった。一方 ASDiv は72.1%→73.9%と伸びが小さく、AQuA は25.2%→35.8%だった。[出典: Table 1; Table 2; Figure 2]
思考の連鎖プロンプティングは大規模言語モデルから推論を引き出すを読むときに注意すべき限界は何ですか?
小学校レベルの多段階文章題 GSM8K で、PaLM 540B は標準プロンプト17.9%に対しCoT 56.9%、39.0ポイント増だった。論文掲載時の既存最高値55%も上回った。同じPaLM 540Bで SVAMP は69.4%→79.0%、MAWPS は79.2%→93.3%だった。一方 ASDiv は72.1%→73.9%と伸びが小さく、AQuA は25.2%→35.8%だった。[出典: Table 1; Table 2; Figure 2]