AI / Technology
ReAct言語モデルで推論と行動を協調させる
標準、推論のみ、行動のみ、ReActの比較
図1 — 従来の3方式とReActの違い。これは理解用に新規作成した図であり、論文図の転載ではない。根拠: 論文 Figure 1、§1–2。
ReActは、言語モデルの途中経過を 思考 → 行動 → 観察 の循環に変え、手元の知識だけでは足りないときに外部から情報を取り、その結果に応じて計画を修正する方法である。[論文 §1–2]
思考・行動・観察・更新の循環
図2 — 外部の観察を次の思考へ戻す閉ループ。質問応答では密に、長い意思決定では思考を疎に置く。根拠: 論文 §2。
モデルは、自由文の「思考」で質問を分解し、次の「行動」を選ぶ。環境が返した「観察」を文脈へ追加し、それを材料に次の思考を更新する。思考そのものは外界を変えず、行動だけが検索APIや環境を動かす。質問応答ではこの3段階を密に交互配置し、長い操作列が必要な意思決定では、計画変更など重要な地点だけに思考を置く。[論文 §2]
検索から成功または失敗へ分岐する経路
図3 — 外部情報は根拠を与える一方、情報不足や反復も生む。危険な行動の停止は論文の安全上の注意を実装へ翻訳した解釈であり、論文が評価した機構ではない。根拠: 論文 §3.3、Conclusion、Ethics Statement。
最も説得力があるのは、同じ軌跡から思考だけを除いたActとの制御比較である。ALFWorldではReActが6つすべてのプロンプトでActを上回り、WebShopでも成功率が30.1から40.0へ上がった。HotpotQAの人手分析では、正答例の誤った根拠はReAct 6%、CoT 14%だった。一方、ReActの誤答例では47%が推論エラー、23%が役に立たない検索結果で、外部検索があれば自動的に正しくなるわけではない。[論文 §3.3、§4、Table 2–4]
研究付録
原題: ReAct: Synergizing Reasoning and Acting in Language Models
著者: Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
公開: arXiv:2210.03629 v3(2023年3月10日、ICLR camera-ready版)
一次資料: arXiv抄録ページ · 論文全文
要点
3つの持ち帰り
- ReActの新しさは、「考える」と「外界に働きかける」を交互に行うこと。 推論だけで答えを作らず、検索や環境操作の結果を次の推論へ戻す。
- 強みは、万能な高得点ではなく、外部情報で推論を更新できること。 FEVERでは推論のみのCoTを上回った一方、HotpotQAでは単独ReActがCoTを少し下回った。内部知識と外部検索を組み合わせた方式が最良だった。
- 実用化には、検索失敗・反復・危険な操作への備えが必要。 論文の環境はWikipedia、模擬ショッピング、テキストゲームに限定され、現実世界で安全に動けることまでは示していない。
一文でいうと
ReActは、言語モデルの途中経過を 思考 → 行動 → 観察 の循環に変え、手元の知識だけでは足りないときに外部から情報を取り、その結果に応じて計画を修正する方法である。[論文 §1–2]
問題
推論だけでは外の事実を確かめられない
Chain-of-Thought(CoT)は途中の推論を書き出せるが、その途中で新しい事実を検索したり、誤った前提を観察結果で直したりはしない。したがって、最初の誤りが後続の推論へ伝わることがある。論文のHotpotQA人手分析では、CoTの誤答例の56%が「幻覚」に分類された。これは200例を人手で分類した分析であり、あらゆるCoTの一般的な幻覚率ではない。[論文 §1、§3.3、Table 2]
行動だけでは目的と進捗を見失う
検索やクリックができても、何を調べるべきか、観察のどこが重要か、次の小目標は何かを整理できなければ行動は迷走する。論文のAct-only例では、最終回答をまとめられない、同じ誤った操作を繰り返す、現在の状態を追えない、といった失敗が見られた。[論文 Figure 1、§2、§4]
先行研究との位置関係
CoT系は主に「言葉で考えること」を、WebGPTや言語モデルによる行動生成は主に「外界で動くこと」を扱っていた。ReActは両者を同じ逐次的な軌跡に入れる。論文の主張は新しい学習アルゴリズムというより、少数の例をプロンプトに示して推論と行動を協調させるプロンプティング枠組み である。[論文 §1、§5]
方法
思考・行動・観察のループ
モデルは、自由文の「思考」で質問を分解し、次の「行動」を選ぶ。環境が返した「観察」を文脈へ追加し、それを材料に次の思考を更新する。思考そのものは外界を変えず、行動だけが検索APIや環境を動かす。質問応答ではこの3段階を密に交互配置し、長い操作列が必要な意思決定では、計画変更など重要な地点だけに思考を置く。[論文 §2]
外部情報への3つの操作
HotpotQAとFEVERでは、モデルに簡易Wikipedia APIを与えた。操作は search[entity]、ページ内の次の該当文を返す lookup[string]、回答を確定する finish[answer] の3種である。この検索器はページ名の一致に強く依存し、最先端の検索器より意図的に弱い。つまり実験は「強力な検索基盤込みの性能」ではなく、「明示的に考えながら限定的な検索を使えるか」を見ている。[論文 §3.1]
少数例で軌跡を教える
基盤モデルは主に凍結したPaLM-540Bで、タスクを解く人手作成の軌跡を文脈内例として提示した。HotpotQAは6例、FEVERは3例。ALFWorldでは各タスク種につき3軌跡を注釈し、そのうち2つを並べ替えた6種類のプロンプトを評価した。WebShopは1-shotである。したがって、ここでの成果はゼロショット能力ではない。[論文 §2、§3.2、§4]
証拠と限界
4ベンチマークで何が起きたか
論文は、複数文書の質問応答HotpotQA、事実検証FEVER、家庭内テキストゲームALFWorld、商品探索WebShopで評価した。主要値は次のとおり。[論文 Table 1、Table 3、Table 4]
| タスク・指標 | 比較対象 | ReAct | 読み方 |
|---|---|---|---|
| HotpotQA exact match | CoT 29.4 | 27.4 | ReAct単独はCoTを2.0ポイント下回る |
| FEVER accuracy | CoT 56.3 | 60.9 | ReActが4.6ポイント上回る |
| HotpotQA exact match | CoT-SC 33.4 | ReAct→CoT-SC 35.1 | 内部知識との併用が単独方式を上回る |
| FEVER accuracy | CoT-SC 60.4 | CoT-SC→ReAct 64.6 | 不確かな場合に検索へ切替える方式が最高 |
| ALFWorld success rate | Act best 45 / BUTLER best 37 | best 71 | 134の未見ゲーム、6プロンプト中の最良値 |
| WebShop success rate | IL 29.1 | 40.0 | 500テスト指示。人間は59.6 |
要旨にあるALFWorldの「絶対34%向上」は71%対BUTLERの37%、WebShopの「絶対10%向上」は40.0%対当時の最良ベースライン29.1%を丸めた表現と読める。比較条件は同一ではなく、ALFWorldのReAct値は6試行の最良、BUTLERは学習済みモデルの最良である点に注意がいる。[論文 Abstract、§4、Table 3–4]
強い証拠と失敗分析
最も説得力があるのは、同じ軌跡から思考だけを除いたActとの制御比較である。ALFWorldではReActが6つすべてのプロンプトでActを上回り、WebShopでも成功率が30.1から40.0へ上がった。HotpotQAの人手分析では、正答例の誤った根拠はReAct 6%、CoT 14%だった。一方、ReActの誤答例では47%が推論エラー、23%が役に立たない検索結果で、外部検索があれば自動的に正しくなるわけではない。[論文 §3.3、§4、Table 2–4]
この論文が示していないこと
- 主実験は非公開のPaLM-540Bであり、完全な再現性には制約がある。著者は全プロンプトとGPT-3追加実験を公開した。[論文 Reproducibility Statement、Appendix A.1]
- 大きな行動空間では必要な実演例が入力長を超えうる。3,000件の自己生成した正解軌跡による微調整は初期結果で、人手の高品質データによる大規模検証ではない。[論文 §3.2–3.3、Conclusion]
- ALFWorldは合成テキスト環境、WebShopは購入が発生しない研究用環境である。実世界のロボット操作、支払い、機密情報へのアクセスの安全性は検証していない。[論文 §4、Ethics Statement]
- 見える思考列がモデル内部の因果過程を忠実に表すことは、この実験からは保証されない。論文が直接示すのは、軌跡を人が点検・一部編集できることまでである。[論文 §2、Appendix A.3;後半は本稿の解釈]
実務的な意味
向いている設計
ReActが特に合うのは、答えを一度で生成するよりも、途中で検索・API・環境の状態を確認する価値が高い仕事である。たとえば、複数資料をまたぐ調査、在庫や仕様を確認する商品探索、長い手順で現在地を失いやすい操作などだ。実装上の核心は「長く考えさせること」ではなく、観察結果を次の判断へ戻す小さな閉ループを作ることにある。これは論文の結果から導く実務上の解釈である。
導入時に置くべき境界
まず行動空間を絞り、検索・参照と、購入・送信・削除のような不可逆操作を分離する。検索結果が空なら検索語を変える、同じ操作が続けば停止する、根拠が競合すれば人へ返す、といった終了条件も必要になる。さらに、軌跡が読めることを安全性そのものと取り違えず、取得元・観察内容・実行した操作を別々に記録するべきである。これらは論文の失敗分析と倫理上の注意から導く実装上の提案であり、著者が本実験で検証した製品仕様ではない。
読後に残る問い
- より強い検索器を使ったとき、ReAct固有の改善はどれだけ残るか。
- 見える推論がもっともらしくても、実際の判断根拠と一致しているか。
- プロンプト選択の最良値ではなく、平均・分散・コストを含めると他方式より有利か。
- 現実のウェブや物理環境で、権限、プライバシー、不可逆操作をどう制御するか。
出典と用語
主な根拠: Yao et al., arXiv:2210.03629 v3。節・表・付録の表記はこの版に対応する。
ReAct: Reasoning と Acting を組み合わせた名称。
CoT: Chain-of-Thought。途中の言語的推論を生成する方式。
Act: 思考列を含めず、行動と観察だけを進める比較方式。
CoT-SC: 複数のCoT結果を生成し、多数決するself-consistency方式。
EM: Exact Match。予測文字列が正解と完全一致した割合。
この論文についての3つの重要な質問
ReAct:言語モデルで推論と行動を協調させるはどの課題を扱いますか?
図3 — 外部情報は根拠を与える一方、情報不足や反復も生む。危険な行動の停止は論文の安全上の注意を実装へ翻訳した解釈であり、論文が評価した機構ではない。根拠: 論文 §3.3、Conclusion、Ethics Statement。
ReAct:言語モデルで推論と行動を協調させるの中心的な主張を支える根拠は何ですか?
要旨にあるALFWorldの「絶対34%向上」は71%対BUTLERの37%、WebShopの「絶対10%向上」は40.0%対当時の最良ベースライン29.1%を丸めた表現と読める。比較条件は同一ではなく、ALFWorldのReAct値は6試行の最良、BUTLERは学習済みモデルの最良である点に注意がいる。[論文 Abstract、§4、Table 3–4]
ReAct:言語モデルで推論と行動を協調させるを読むときに注意すべき限界は何ですか?
論文は、複数文書の質問応答HotpotQA、事実検証FEVER、家庭内テキストゲームALFWorld、商品探索WebShopで評価した。主要値は次のとおり。[論文 Table 1、Table 3、Table 4]