AI / Technology
让语言模型更听懂“你想要什么”InstructGPT 与 RLHF
参数更多不保证更符合人的偏好;行为微调改变了比较结果
图 1|教学示意,不是数据图。右侧命中“偏好目标”只表示论文在其 API 提示词分布上的人类偏好结果;它不表示 1.3B 模型具备更强的通用能力。来源:摘要、§4.1、图 1。
论文把实际目标概括为 helpful、honest、harmless。但这些概念不能直接写成一个简单公式:同一问题可能有多种合格答案,真实用户的意图也常常含混。因此,作者转而收集人类对答案的示范与相对偏好。(来源:§1;§3.6)
InstructGPT 的三阶段训练流程
图 2|从人类示范到偏好排序,再到奖励驱动的 PPO 优化。蓝色箭头表示数据或训练流,橙色箭头表示奖励反馈。原创教学图;依据 §3.1 与 §3.5 绘制。
第三步:优化。 作者用 PPO 按奖励模型的分数继续更新 SFT 模型,并加入与 SFT 模型的 KL 惩罚,避免为了刷高奖励而偏离过远。主要版本 PPO-ptx 还混入预训练目标,以减少传统 NLP 任务上的性能回退。(来源:§3.5,公式 2)
特定标注群体的偏好边界与有害指令风险
图 3|论文证明的是对特定参考群体、特定应用的偏好对齐,不是对所有人的普遍价值对齐;红色路径表示模型仍可能服从有害指令。原创教学图;依据 §5.2–5.3 绘制。
- 主要人评来自与训练数据同源的 API 使用分布;虽然测试用户与训练用户分开,它仍不是所有现实场景。(来源:§3.2;§3.6)
- 数据超过 96% 为英语,标注团队约 40 人,不能代表所有语言、文化或受影响群体。(来源:§3.3–3.4;§5.3)
- 多数比较因成本只由一名标注员完成;分歧被压成单一排序时,平均偏好未必公平。(来源:§5.3)
- 毒性改善依赖提示方式:移除“尊重”提示后优势消失;明确要求有毒输出时,InstructGPT 甚至比同尺寸 GPT-3 更有毒。偏见基准也没有显著改善。(来源:§4.2;§5.3)
研究附录
论文:Long Ouyang 等,Training language models to follow instructions with human feedback,2022(arXiv:2203.02155)
一、结论先行
这篇论文解决的不是“怎样让模型记住更多知识”,而是“怎样让模型的回答更符合用户意图”。作者在 GPT-3 之后加上人类反馈训练:先让人示范好答案,再让人比较多个模型答案,最后把这种偏好变成奖励来优化模型。论文将所得模型称为 InstructGPT。(来源:摘要;§1;§3.1)
记住三点:
- 训练目标比参数量更关键。 在作者的 API 提示词测试分布上,1.3B 参数的 InstructGPT 回答比 175B GPT-3 更受标注员偏好;这是特定人评条件下的结果,不代表小模型在所有能力上都胜过大模型。(来源:摘要;§1;图 1)
- 人类偏好被做成了可学习的信号。 示范教模型起步,排序教奖励模型判断哪个回答更好,PPO 再推动语言模型获得更高奖励。(来源:§3.1)
- “更听话”不等于“完全安全”。 模型对齐的是约 40 名标注员与研究者所定义的偏好;它仍会编造事实、产生偏见,甚至服从有害指令。(来源:§3.4;§5.2–5.3)
二、问题:会续写,不等于会帮人
预训练语言模型主要学习“互联网文本中下一个词是什么”,用户真正需要的却是“按要求完成任务,并尽量有帮助、真实、无害”。两个目标并不相同。继续扩大模型,可能增强生成能力,却不会自动消除答非所问、虚构事实或有害输出。(来源:§1)
论文把实际目标概括为 helpful、honest、harmless。但这些概念不能直接写成一个简单公式:同一问题可能有多种合格答案,真实用户的意图也常常含混。因此,作者转而收集人类对答案的示范与相对偏好。(来源:§1;§3.6)
三、方法:把“这个回答更好”接进训练回路
第一步:示范。 标注员针对提示词写出理想回答,作者用约 13,000 个训练提示词组成的 SFT 数据集,对 GPT-3 做监督微调。模型先学会一种可用的回答方式。(来源:§3.1–3.2;表 6)
第二步:比较。 对同一提示词生成多个候选回答,让标注员排序;约 33,000 个训练提示词的排序数据用于训练一个 6B 参数的奖励模型。它接收“提示词+回答”,输出一个标量分数,用来预测人更偏好哪个答案。(来源:§3.1–3.2;§3.5;表 6)
第三步:优化。 作者用 PPO 按奖励模型的分数继续更新 SFT 模型,并加入与 SFT 模型的 KL 惩罚,避免为了刷高奖励而偏离过远。主要版本 PPO-ptx 还混入预训练目标,以减少传统 NLP 任务上的性能回退。(来源:§3.5,公式 2)
这套机制的关键不是让人逐条写出所有规则,而是让人对具体答案做选择,再让奖励模型把有限比较推广到更多提示词。代价是:奖励模型学到的不是抽象的“人类价值”,而是这批标注数据中可预测的偏好。(来源:§3.1;§5.2)
四、证据与边界:明显更合意,但远未解决安全
最直接的证据来自作者保留客户的 API 提示词测试集。175B InstructGPT 与 175B GPT-3 直接比较时,前者有 85% ± 3% 的回答被偏好;与经过精心 few-shot 提示的 175B GPT-3 比较时为 71% ± 4%。更醒目的结果是,1.3B InstructGPT 也胜过 175B GPT-3。(来源:§4.1;图 1)
行为指标也有改善:在封闭域任务中,论文报告的幻觉率由 GPT-3 的 41% 降到 InstructGPT 的 21%;在要求“尊重地回答”时,RealToxicityPrompts 上约少 25% 的有毒输出。PPO-ptx 还缓解了多数传统 NLP 基准上的“对齐税”,但在 DROP、SQuADv2 和翻译上仍落后于 GPT-3。(来源:§1;§4.2)
这些结果有四条重要边界:
- 主要人评来自与训练数据同源的 API 使用分布;虽然测试用户与训练用户分开,它仍不是所有现实场景。(来源:§3.2;§3.6)
- 数据超过 96% 为英语,标注团队约 40 人,不能代表所有语言、文化或受影响群体。(来源:§3.3–3.4;§5.3)
- 多数比较因成本只由一名标注员完成;分歧被压成单一排序时,平均偏好未必公平。(来源:§5.3)
- 毒性改善依赖提示方式:移除“尊重”提示后优势消失;明确要求有毒输出时,InstructGPT 甚至比同尺寸 GPT-3 更有毒。偏见基准也没有显著改善。(来源:§4.2;§5.3)
五、实际意义:把模型开发看成行为设计
对产品与模型团队而言,这篇论文改变了优化顺序:如果目标是让系统更好用,继续堆参数未必是最高回报;高质量的真实任务、明确的标注规范、可靠的偏好评估,可能更直接地改变用户体验。作者报告,175B SFT 与 PPO-ptx 训练分别需 4.9 和 60 petaflops/s-days,而 GPT-3 预训练为 3,640 petaflops/s-days;这支持“后训练成本相对较小”的判断,但不是所有项目的通用成本承诺。(来源:§5.1)
更重要的是建立持续闭环:收集失败案例,检查谁在定义“好”,分群观察效果,并同时保留任务能力、安全性与公平性评测。RLHF 能让模型更贴近被测偏好,却不能替团队回答“该听谁的”“偏好冲突怎么办”“哪些请求必须拒绝”。这三问不是论文已经解决的结论,而是从其局限推导出的产品治理问题。
研究附录
证据台账
| 主题 | 论文证据 | 能支持什么 | 不能支持什么 |
|---|---|---|---|
| 训练数据 | SFT 训练集 11,295 个标注员提示词+1,430 个客户提示词;RM 训练集 6,623+26,584;PPO 训练集 31,144 个客户提示词(表 6) | 三阶段使用的数据来源与规模 | 数据覆盖所有用户或语言 |
| 模型规模 | GPT-3 架构,1.3B、6B、175B 三档;奖励模型使用 6B(§3.5) | 比较在同一模型家族内进行 | 对其他架构同样成立 |
| 人类偏好 | 175B InstructGPT 对 GPT-3:85% ± 3%;对 few-shot GPT-3:71% ± 4%(§4.1) | 在论文测试分布上更受偏好 | 绝对正确率或通用能力领先 |
| 小模型结果 | 1.3B InstructGPT 胜过 175B GPT-3(摘要、图 1) | 后训练可比单纯扩参更影响指令跟随 | 1.3B 在所有任务都更强 |
| 真实性 | 封闭域幻觉率 21% 对 41%;TruthfulQA 有改善(§1、§4.2) | 某些真实性代理指标改善 | 模型不再编造,或已实现“诚实” |
| 毒性与偏见 | 尊重提示下约少 25% 有毒输出;无提示时优势消失;Winogender、CrowS-Pairs 未改善(§1、§4.2) | 安全收益有条件且不完整 | 已解决有害输出或社会偏见 |
| 能力回退 | PPO-ptx 缓解多数回退,仍在 DROP、SQuADv2、翻译落后(§4.2) | 混入预训练目标可降低对齐税 | 没有任何能力代价 |
| 代表性 | 约 40 名标注员;数据超过 96% 英语;客户群也不具普遍代表性(§3.3–3.4、§5.2–5.3) | 结论对应特定参考群体 | 已对齐普遍“人类价值” |
术语
- SFT(监督微调):用人类写出的理想回答继续训练预训练模型。
- 奖励模型(RM):根据“提示词+回答”预测人类偏好,并输出一个分数。
- RLHF(基于人类反馈的强化学习):用人类反馈训练奖励信号,再据此优化模型行为。
- PPO:本文用于最大化奖励模型分数的强化学习算法。
- PPO-ptx:PPO 训练中混入预训练目标的版本,旨在减少能力回退;论文通常用它指代 InstructGPT。
- 对齐税:为了改善对齐行为而在其他任务上损失的性能。
不确定性与复核问题
- 如果标注员来自不同语言、文化或利益相关群体,偏好结果会改变多少?论文只做了同供应商留出标注员的初步检验。
- 奖励模型在训练分布之外是否会被系统性“钻空子”?论文使用 KL 惩罚缓解过度优化,但没有证明问题消失。
- 真实性、毒性与偏见指标只是代理测量;它们能否预测具体部署中的真实伤害,论文没有建立因果证据。
- 结果基于 2022 年的 GPT-3 家族与当时的 API 分布;迁移到其他架构、数据和交互形态需要重新验证。
来源定位
关于这篇论文的三个关键问题
让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 解决了什么问题?
预训练语言模型主要学习“互联网文本中下一个词是什么”,用户真正需要的却是“按要求完成任务,并尽量有帮助、真实、无害”。两个目标并不相同。继续扩大模型,可能增强生成能力,却不会自动消除答非所问、虚构事实或有害输出。(来源:§1)
让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 的核心结论有哪些证据?
最直接的证据来自作者保留客户的 API 提示词测试集。175B InstructGPT 与 175B GPT-3 直接比较时,前者有 85% ± 3% 的回答被偏好;与经过精心 few-shot 提示的 175B GPT-3 比较时为 71% ± 4%。更醒目的结果是,1.3B InstructGPT 也胜过 175B GPT-3。(来源:§4.1;图 1)
阅读 让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 时最需要注意什么局限?
最直接的证据来自作者保留客户的 API 提示词测试集。175B InstructGPT 与 175B GPT-3 直接比较时,前者有 85% ± 3% 的回答被偏好;与经过精心 few-shot 提示的 175B GPT-3 比较时为 71% ± 4%。更醒目的结果是,1.3B InstructGPT 也胜过 175B GPT-3。(来源:§4.1;图 1)