返回报告库

AI / Technology

ReAct:把“想”与“做”交替起来的语言模型方法

这篇论文研究一个直白问题:大语言模型不只要会回答,还要会查证据、做决定、并在环境里执行动作。作者发现,单靠链式思维容易幻觉和错误传播,单靠动作又缺少抽象推理和计划能力。

为什么只会“想”或只会“做”都不够

推理与行动分离的问题结构

问答任务需要先找证据,再判断答案是否成立。若模型只在内部连着想,容易编造看似合理但其实没证据的内容,论文把这称为幻觉和错误传播。

交互式任务更麻烦。模型不只是输出一句话,而是要在环境里搜索、选择、购买、移动物体,或者调用像 Wikipedia API 这样的外部信息源。

ReAct 的基本想法:把推理写进动作之间

ReAct 的交替轨迹

ReAct 的关键不是先想完再做,而是交替生成“thought”和“action”。thought 用来分解问题、提取信息、做常识和算术推理;action 用来查证据或推进环境。

论文把动作空间扩展为“环境动作 + 语言动作”。这样,模型输出的思考本身也成为轨迹的一部分,但不会直接改变环境。

  • 先想什么,再做什么,由中间观察决定。
  • 思考不是装饰,而是用来更新下一步动作。

这些证据,能把结论推到哪一步

与 CoT / Act / 混合切换的差异与边界

ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。

在 HotpotQA 和 FEVER 上,ReAct 被描述为能缓解幻觉和错误传播。

在 ALFWorld 和 WebShop 上,ReAct 相对 imitation 和 reinforcement learning 基线有更高的绝对成功率,分别高 34% 和 10%。

摘要和部分章节没有给出完整评测协议与统计显著性。

研究附录术语、来源与待验证问题

论文证据

高可信

ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。

证据笔记:method/problem;Paper section 3。提出 ReAct,将推理轨迹与任务动作交替生成。

高可信

在 HotpotQA 和 FEVER 上,ReAct 被描述为能缓解幻觉和错误传播。

证据笔记:paperFacts;Paper section 3。HotpotQA 和 Fever 上,ReAct 缓解了幻觉与错误传播。

高可信

在 ALFWorld 和 WebShop 上,ReAct 相对 imitation 和 reinforcement learning 基线有更高的绝对成功率,分别高 34% 和 10%。

证据笔记:paperFacts;Paper section 3。ALFWorld 和 WebShop 上,较 imitation 和 reinforcement learning 的绝对成功率分别高 34% 和 10%。

高可信

ReAct 可以通过少量上下文示例启动,摘要中明确提到只需要 1 或 2 个 in-context examples。

证据笔记:paperFacts;sourceLabel: arXiv metadata。只需 1 或 2 个 in-context examples 即可提示。

高可信

作者提供了基于 Wikipedia API 的动作接口,至少包括 search、lookup 和 finish 三类动作。

证据笔记:paperFacts;Paper section 3。设计 Wikipedia API:search、lookup、finish 三种动作。

高可信

在 FEVER 的示例中,ReAct/Act 能区分 SUPPORTS、REFUTES 和 NOT ENOUGH INFO,并通过检索证据完成判断。

证据笔记:paperFacts;Paper section 7。Fever 示例中,Act/\model 通过搜索与查找证据判断三类命题,并给出 SUPPORTS、REFUTES、NOT ENOUGH INFO。

高可信

在 HotpotQA 的报告结果里,PaLM-540B 上 ReAct 的 exact match 为 27.4,低于 CoT 的 29.4,但高于 Act 的 25.7。

证据笔记:paperFacts;Paper section 3。PaLM-540B 上,\model 在 FEVER 达到 60.9... HotPotQA 上,\model 为 27.4,略低于 CoT 29.4,但高于 Act 25.7。

能力边界与局限

  • 摘要和部分章节没有给出完整评测协议与统计显著性。
  • Wikipedia API 的能力范围很弱,主要依赖精确实体检索与少量段落。
  • 部分任务只报告了少数关键数值,缺少更完整的消融与误差分析。
  • HotpotQA 和 FEVER 的标签与设定可能存在过时或不完全匹配的问题。
  • 提示式设置下的推理和行动能力仍然有限,循环和恢复失败是已知问题。

和其他方案放在一起看

方案类型优势限制判断
ReAct vs CoT方法对比ReAct 在部分任务上能借助外部检索降低幻觉;在 FEVER 上的准确率高于 CoT(60.9 vs 56.3),且 false positive 更低。在 HotpotQA 上,CoT 的 exact match(29.4)高于 ReAct(27.4);说明并非所有设置都占优。结果互有胜负,不能简单说 ReAct 全面胜过 CoT。
ReAct vs Act方法对比ReAct 在多项任务中优于只做动作的 Act,尤其在 FEVER、ALFWorld 和 WebShop 上表现更好。Act 的设计更直接,某些场景下也能接近或超过 ReAct;而 ReAct 依赖更复杂的思考-行动交替。在给定证据下,ReAct 通常优于纯动作法,但优势不是绝对的。
ReAct vs 人类/专家上限能力上限对比ReAct 明显强于若干自动基线,说明交替推理与行动有实际收益。WebShop 上 human 仍达到 82.1/59.6,明显高于所有方法;现有方法远未到专家水平。ReAct 改进明显,但离人类表现还有较大差距。

还不能确定的地方

ReAct 的提升主要来自推理、行动,还是二者交替机制本身,现有证据无法拆分清楚。

笔记中提到提升,但没有完整消融或因果分解。

查看论文中是否有对 thought-only、action-only、交替机制的消融实验。

不同任务上的结果是否稳健可复现,当前笔记没有给出置信区间或多次重复的方差。

只看到若干点估计和少量对照数值。

查找表格、附录或补充材料中的多次运行统计与误差范围。

Wikipedia API 以外的外部工具、环境或知识源支持范围不明确。

证据只明确提到 Wikipedia API。

阅读方法章节和附录,确认是否有其他工具接口或额外环境设定。

HotpotQA 与 FEVER 的具体评测样本大小、采样方式和预处理细节未完全展开。

笔记中明确指出摘要未给出完整设置,部分结果只涉及抽样。

检查实验设置、数据预处理和附录中的完整数据说明。

ReAct 在更小模型上的效果是否同样成立,证据不充分。

笔记主要提到 PaLM-540B、PaLM-8B/62B 和 GPT-3,缺少系统性的规模对比。

查看不同模型规模的实验表格和补充实验。

术语表

ReAct
一种让语言模型交替产生推理(thought)和行动(action)的提示方法。
链式思维(CoT)
让模型先展开一串内部推理,再给出答案的方法。
in-context examples
放在提示里的少量示例,用来引导模型按目标格式或行为模式生成。
Wikipedia API
论文中用于检索证据的外部接口,包含搜索、查找和结束等动作。
幻觉
模型说出看似合理、但缺少证据或与事实不符的内容。
错误传播
前一步推错后,后续推理继续建立在错误前提上。
FEVER
一个事实核验任务,要求判断声明是支持、反驳还是信息不足。
ALFWorld
一个需要在环境中执行多步动作的任务环境。

参考来源

来源追踪

摘要: ReAct 将推理轨迹与任务动作交替生成,并通过少量示例启动。 arXiv 论文摘要

摘要: ReAct 在 HotpotQA 和 FEVER 上缓解幻觉与错误传播。 arXiv 论文摘要

摘要: ReAct 在 ALFWorld 和 WebShop 上相对 imitation / reinforcement learning 提升成功率。 arXiv 论文摘要

第 3 节: 作者定义了 Wikipedia API 动作,并将 thought 作为不影响环境的语言动作来处理。 arXiv HTML 全文

第 3 节: PaLM-540B 上,ReAct 在 FEVER 优于 Act 和 CoT,但在 HotpotQA 上不一定超过 CoT。 Paper section 3

第 4 节: ReAct 在 WebShop 和 ALFWorld 上的成功率优于 Act,并给出了与人类的差距。 Paper section 4

第 5 节: 作者比较了 PaLM-540B 与 GPT-3,并报告了跨模型的提示实验。 Paper section 5

第 7 节: 示例轨迹展示了 FEVER、WebShop 和 ALFWorld 中的检索、判断和行动步骤。 Paper section 7

关于这篇论文的三个关键问题

ReAct:把“想”与“做”交替起来的语言模型方法 解决了什么问题?

问答任务需要先找证据,再判断答案是否成立。若模型只在内部连着想,容易编造看似合理但其实没证据的内容,论文把这称为幻觉和错误传播。

ReAct:把“想”与“做”交替起来的语言模型方法 的核心结论有哪些证据?

ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。 证据笔记:method/problem;Paper section 3。提出 ReAct,将推理轨迹与任务动作交替生成。

阅读 ReAct:把“想”与“做”交替起来的语言模型方法 时最需要注意什么局限?

Wikipedia API 的能力范围很弱,主要依赖精确实体检索与少量段落。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro