AI / Technology
ReAct:把“想”与“做”交替起来的语言模型方法
这篇论文研究一个直白问题:大语言模型不只要会回答,还要会查证据、做决定、并在环境里执行动作。作者发现,单靠链式思维容易幻觉和错误传播,单靠动作又缺少抽象推理和计划能力。
为什么只会“想”或只会“做”都不够
问答任务需要先找证据,再判断答案是否成立。若模型只在内部连着想,容易编造看似合理但其实没证据的内容,论文把这称为幻觉和错误传播。
交互式任务更麻烦。模型不只是输出一句话,而是要在环境里搜索、选择、购买、移动物体,或者调用像 Wikipedia API 这样的外部信息源。
ReAct 的基本想法:把推理写进动作之间
ReAct 的关键不是先想完再做,而是交替生成“thought”和“action”。thought 用来分解问题、提取信息、做常识和算术推理;action 用来查证据或推进环境。
论文把动作空间扩展为“环境动作 + 语言动作”。这样,模型输出的思考本身也成为轨迹的一部分,但不会直接改变环境。
- 先想什么,再做什么,由中间观察决定。
- 思考不是装饰,而是用来更新下一步动作。
这些证据,能把结论推到哪一步
ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。
在 HotpotQA 和 FEVER 上,ReAct 被描述为能缓解幻觉和错误传播。
在 ALFWorld 和 WebShop 上,ReAct 相对 imitation 和 reinforcement learning 基线有更高的绝对成功率,分别高 34% 和 10%。
摘要和部分章节没有给出完整评测协议与统计显著性。
研究附录术语、来源与待验证问题
论文证据
ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。
证据笔记:method/problem;Paper section 3。提出 ReAct,将推理轨迹与任务动作交替生成。
在 HotpotQA 和 FEVER 上,ReAct 被描述为能缓解幻觉和错误传播。
证据笔记:paperFacts;Paper section 3。HotpotQA 和 Fever 上,ReAct 缓解了幻觉与错误传播。
在 ALFWorld 和 WebShop 上,ReAct 相对 imitation 和 reinforcement learning 基线有更高的绝对成功率,分别高 34% 和 10%。
证据笔记:paperFacts;Paper section 3。ALFWorld 和 WebShop 上,较 imitation 和 reinforcement learning 的绝对成功率分别高 34% 和 10%。
ReAct 可以通过少量上下文示例启动,摘要中明确提到只需要 1 或 2 个 in-context examples。
证据笔记:paperFacts;sourceLabel: arXiv metadata。只需 1 或 2 个 in-context examples 即可提示。
作者提供了基于 Wikipedia API 的动作接口,至少包括 search、lookup 和 finish 三类动作。
证据笔记:paperFacts;Paper section 3。设计 Wikipedia API:search、lookup、finish 三种动作。
在 FEVER 的示例中,ReAct/Act 能区分 SUPPORTS、REFUTES 和 NOT ENOUGH INFO,并通过检索证据完成判断。
证据笔记:paperFacts;Paper section 7。Fever 示例中,Act/\model 通过搜索与查找证据判断三类命题,并给出 SUPPORTS、REFUTES、NOT ENOUGH INFO。
在 HotpotQA 的报告结果里,PaLM-540B 上 ReAct 的 exact match 为 27.4,低于 CoT 的 29.4,但高于 Act 的 25.7。
证据笔记:paperFacts;Paper section 3。PaLM-540B 上,\model 在 FEVER 达到 60.9... HotPotQA 上,\model 为 27.4,略低于 CoT 29.4,但高于 Act 25.7。
能力边界与局限
- 摘要和部分章节没有给出完整评测协议与统计显著性。
- Wikipedia API 的能力范围很弱,主要依赖精确实体检索与少量段落。
- 部分任务只报告了少数关键数值,缺少更完整的消融与误差分析。
- HotpotQA 和 FEVER 的标签与设定可能存在过时或不完全匹配的问题。
- 提示式设置下的推理和行动能力仍然有限,循环和恢复失败是已知问题。
和其他方案放在一起看
还不能确定的地方
ReAct 的提升主要来自推理、行动,还是二者交替机制本身,现有证据无法拆分清楚。
笔记中提到提升,但没有完整消融或因果分解。
查看论文中是否有对 thought-only、action-only、交替机制的消融实验。
不同任务上的结果是否稳健可复现,当前笔记没有给出置信区间或多次重复的方差。
只看到若干点估计和少量对照数值。
查找表格、附录或补充材料中的多次运行统计与误差范围。
Wikipedia API 以外的外部工具、环境或知识源支持范围不明确。
证据只明确提到 Wikipedia API。
阅读方法章节和附录,确认是否有其他工具接口或额外环境设定。
HotpotQA 与 FEVER 的具体评测样本大小、采样方式和预处理细节未完全展开。
笔记中明确指出摘要未给出完整设置,部分结果只涉及抽样。
检查实验设置、数据预处理和附录中的完整数据说明。
ReAct 在更小模型上的效果是否同样成立,证据不充分。
笔记主要提到 PaLM-540B、PaLM-8B/62B 和 GPT-3,缺少系统性的规模对比。
查看不同模型规模的实验表格和补充实验。
术语表
- ReAct
- 一种让语言模型交替产生推理(thought)和行动(action)的提示方法。
- 链式思维(CoT)
- 让模型先展开一串内部推理,再给出答案的方法。
- in-context examples
- 放在提示里的少量示例,用来引导模型按目标格式或行为模式生成。
- Wikipedia API
- 论文中用于检索证据的外部接口,包含搜索、查找和结束等动作。
- 幻觉
- 模型说出看似合理、但缺少证据或与事实不符的内容。
- 错误传播
- 前一步推错后,后续推理继续建立在错误前提上。
- FEVER
- 一个事实核验任务,要求判断声明是支持、反驳还是信息不足。
- ALFWorld
- 一个需要在环境中执行多步动作的任务环境。
参考来源
来源追踪
摘要: ReAct 将推理轨迹与任务动作交替生成,并通过少量示例启动。 arXiv 论文摘要
摘要: ReAct 在 HotpotQA 和 FEVER 上缓解幻觉与错误传播。 arXiv 论文摘要
摘要: ReAct 在 ALFWorld 和 WebShop 上相对 imitation / reinforcement learning 提升成功率。 arXiv 论文摘要
第 3 节: 作者定义了 Wikipedia API 动作,并将 thought 作为不影响环境的语言动作来处理。 arXiv HTML 全文
第 3 节: PaLM-540B 上,ReAct 在 FEVER 优于 Act 和 CoT,但在 HotpotQA 上不一定超过 CoT。 Paper section 3
第 4 节: ReAct 在 WebShop 和 ALFWorld 上的成功率优于 Act,并给出了与人类的差距。 Paper section 4
第 5 节: 作者比较了 PaLM-540B 与 GPT-3,并报告了跨模型的提示实验。 Paper section 5
第 7 节: 示例轨迹展示了 FEVER、WebShop 和 ALFWorld 中的检索、判断和行动步骤。 Paper section 7
关于这篇论文的三个关键问题
ReAct:把“想”与“做”交替起来的语言模型方法 解决了什么问题?
问答任务需要先找证据,再判断答案是否成立。若模型只在内部连着想,容易编造看似合理但其实没证据的内容,论文把这称为幻觉和错误传播。
ReAct:把“想”与“做”交替起来的语言模型方法 的核心结论有哪些证据?
ReAct 的核心思想是让语言模型交替生成“推理轨迹”和“任务动作”,把思考和执行放在同一条可读轨迹里。 证据笔记:method/problem;Paper section 3。提出 ReAct,将推理轨迹与任务动作交替生成。
阅读 ReAct:把“想”与“做”交替起来的语言模型方法 时最需要注意什么局限?
Wikipedia API 的能力范围很弱,主要依赖精确实体检索与少量段落。