返回报告库

AI / Technology

WebGPT借助浏览器与人类反馈回答问题

WebGPT 从问题到带引用回答的完整链路

WebGPT 把语言模型从“凭记忆直接回答”改造成“先在网页里行动,再拿证据回答”:它能搜索、点链接、翻页、查找文字和摘录原文,最后只根据收集到的引用组织答案。人类示范教它怎么操作,人类偏好再教它什么样的整套回答更好。[论文摘要;§1;§2]

一次检索与多步浏览的差别

开放式长问答需要完成两件事:找到相关资料,并把分散信息写成连贯解释。此前的检索增强方法通常训练一个检索器取回文档,再让模型生成答案;WebGPT 则直接调用 Bing 搜索,把更高层的“如何使用搜索引擎回答问题”交给模型学习。[§1;§2;§7]

示范、偏好与候选筛选组成的训练链

研究团队收集了 6,209 条示范和 21,548 次回答比较;正文将其概括为约 6,000 条示范、约 21,500 次比较。示范教模型复现人的浏览动作,回答比较则训练奖励模型预测人更喜欢哪一个完整的“答案+引用”。[§3.1;附录 B,表 4]

引用带来的可核查性与风险

论文明确记录了三类风险:模型可能引用不可靠网页,可能挑选更能说服标注员的证据,也可能在转述与综合时写错。引用还会让答案显得更权威,用户因此可能更容易过度相信它。[§6.1;§6.2;§6.4]

使用带引用回答时的核对流程

这篇论文给产品设计的启发,不是简单加一个搜索按钮,而是保存“问题—浏览动作—证据片段—最终主张”的对应关系。实际系统还应显示来源、让用户打开上下文,并提醒用户检查是否缺少相反证据;这是基于论文风险分析的产品解释,不是作者已经验证的产品方案。[§6.2;§6.4]

研究附录

官方标题: WebGPT: Browser-assisted question-answering with human feedback
作者: Reiichiro Nakano 等 · 版本: arXiv:2112.09332v3(2022-06-01) · 论文: https://arxiv.org/abs/2112.09332

核心结论

WebGPT 把语言模型从“凭记忆直接回答”改造成“先在网页里行动,再拿证据回答”:它能搜索、点链接、翻页、查找文字和摘录原文,最后只根据收集到的引用组织答案。人类示范教它怎么操作,人类偏好再教它什么样的整套回答更好。[论文摘要;§1;§2]

记住三点:

  1. 搜索也是模型要学的行为。 它不是一次拿到固定资料,而是连续决定搜什么、打开什么、摘录什么。[§2]
  2. 最强结果来自“多试几次再挑最好”。 175B 模型生成 64 个候选,再由奖励模型选出一个;论文中这一方案优于单独强化学习。[§3.2;§5.1]
  3. 引用让答案更容易核查,但不等于答案真实。 模型仍会选到不可靠来源、遗漏反面证据,或在改写时出错。[§6.1;§6.2;§6.4]

问题

长答案同时卡在找资料和组织资料

开放式长问答需要完成两件事:找到相关资料,并把分散信息写成连贯解释。此前的检索增强方法通常训练一个检索器取回文档,再让模型生成答案;WebGPT 则直接调用 Bing 搜索,把更高层的“如何使用搜索引擎回答问题”交给模型学习。[§1;§2;§7]

没有证据,人也很难判断长答案

一段流畅的长答案可能夹着细小错误。若让标注员独立查遍所有事实,成本高且判断容易不一致。因此论文要求模型在浏览时保存引用,让标注员先判断“这句话是否被可靠来源支持”,而不是从零研究整个问题。[§1;§6.4;附录 C.2]

方法

浏览器把开放网页变成有限动作

模型每一步看到问题、当前网页片段和历史动作摘要,然后只能输出规定命令:搜索、点击、页内查找、滚动、摘录、返回或结束。浏览结束后,只要至少有一条引用,模型就收到问题与已摘录内容,并生成最终答案。[§2,表 1]

两类人类数据分别教“怎么做”和“哪个好”

研究团队收集了 6,209 条示范和 21,548 次回答比较;正文将其概括为约 6,000 条示范、约 21,500 次比较。示范教模型复现人的浏览动作,回答比较则训练奖励模型预测人更喜欢哪一个完整的“答案+引用”。[§3.1;附录 B,表 4]

最终方案不是继续训练,而是多生成后筛选

论文比较了四种方法:行为克隆、奖励建模、PPO 强化学习和 best-of-n 拒绝采样。最佳系统先做行为克隆,再让模型独立尝试 64 次,由奖励模型选出得分最高的一次;这用更多推理算力换取更好的答案,也让模型能尝试不同网页路径。[§3.2;§5.1]

证据与局限

ELI5 上达到人类偏好水平

在 ELI5 测试中,175B best-of-64 的回答有 56% 的比较胜过使用同一浏览器写答案的人类示范者;去掉模型引用后,它有 69% 的比较胜过 Reddit 最高票答案。这里测的是人类偏好,不是“事实正确率”;平局按一半计入。[§4.1,图 2]

跨到 TruthfulQA 后,进步与差距同时出现

在对抗性短问答 TruthfulQA 上,最佳 WebGPT 的回答 75% 被评为真实,54% 同时真实且有信息量。它超过对应的基础 GPT-3,但仍低于人类。测试还把回答截到 50 个 token,约 3% 的答案因此变空,这会影响“真实但有信息量”的解读。[摘要;§1;§4.2]

论文报告的关键比较结果应该怎样读
WebGPT vs. 人类示范56% 被偏好接近并略过 50% 比较线,不代表所有事实都正确
WebGPT vs. ELI5 最高票答案69% 被偏好模型引用已移除;双方写作条件并不完全相同
TruthfulQA:真实75%跨分布短问答上的人工判断
TruthfulQA:真实且有信息量54%仍明显留有错误和回避之间的张力

引用是检查入口,不是真实印章

论文明确记录了三类风险:模型可能引用不可靠网页,可能挑选更能说服标注员的证据,也可能在转述与综合时写错。引用还会让答案显得更权威,用户因此可能更容易过度相信它。[§6.1;§6.2;§6.4]

这些结果不能直接推出什么

实验主要围绕 ELI5,跨到 TruthfulQA 已出现分布变化;团队没有直接证明 WebGPT 减少了所有“看似合理的幻觉”,因为细微错误连标注员也难发现。系统依赖实时网页、Bing 排序、175B 参数模型和最多 64 次候选采样,质量提升伴随明显的推理成本与外部信息风险。[§4.2;§5.2;§6.1;§6.5]

实际意义

产品不应只展示脚注,还要支持逐条核对

这篇论文给产品设计的启发,不是简单加一个搜索按钮,而是保存“问题—浏览动作—证据片段—最终主张”的对应关系。实际系统还应显示来源、让用户打开上下文,并提醒用户检查是否缺少相反证据;这是基于论文风险分析的产品解释,不是作者已经验证的产品方案。[§6.2;§6.4]

何时值得采用,何时要更谨慎

需要新鲜资料、答案可被人工复核、错误成本可控时,这条路线很有价值。医疗、法律、金融等高风险场景,或来源质量极不稳定的开放网页,则不能把奖励模型得分当作事实裁判;应增加独立核验、来源白名单、反面证据搜索和拒答机制。这些是从论文局限推导的实践建议。[§6.1–§6.5]

研究附录:复核这篇论文时该问什么

  • 奖励模型偏好的是事实支持、文风,还是更像“有把握”的表达?[§3.2;§6.2]
  • 若把 best-of-64 的总推理成本给更小模型或更强检索器,比较是否仍成立?[§5.2]
  • 面对互相冲突的网页,系统能否主动寻找正反双方,而不是挑一个顺眼来源?[§6.4]
  • 在 ELI5 以外的真实任务中,56% 和 69% 的偏好优势还能保留多少?[§4;§6.1]

来源说明: 本文的数字、机制和限制均来自论文 v3 的摘要、正文、图表与附录;“产品启发”和“实践建议”已明确标为解释。主源:arXiv 论文页

关于这篇论文的三个关键问题

WebGPT:借助浏览器与人类反馈回答问题 解决了什么问题?

开放式长问答需要完成两件事:找到相关资料,并把分散信息写成连贯解释。此前的检索增强方法通常训练一个检索器取回文档,再让模型生成答案;WebGPT 则直接调用 Bing 搜索,把更高层的“如何使用搜索引擎回答问题”交给模型学习。[§1;§2;§7]

WebGPT:借助浏览器与人类反馈回答问题 的核心结论有哪些证据?

在 ELI5 测试中,175B best-of-64 的回答有 56% 的比较胜过使用同一浏览器写答案的人类示范者;去掉模型引用后,它有 69% 的比较胜过 Reddit 最高票答案。这里测的是人类偏好,不是“事实正确率”;平局按一半计入。[§4.1,图 2]

阅读 WebGPT:借助浏览器与人类反馈回答问题 时最需要注意什么局限?

论文明确记录了三类风险:模型可能引用不可靠网页,可能挑选更能说服标注员的证据,也可能在转述与综合时写错。引用还会让答案显得更权威,用户因此可能更容易过度相信它。[§6.1;§6.2;§6.4]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro