返回报告库

AI / Technology

让语言模型更听懂“你想要什么”InstructGPT 与 RLHF

关于这篇论文的三个关键问题

让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 解决了什么问题?

预训练语言模型主要学习“互联网文本中下一个词是什么”,用户真正需要的却是“按要求完成任务,并尽量有帮助、真实、无害”。两个目标并不相同。继续扩大模型,可能增强生成能力,却不会自动消除答非所问、虚构事实或有害输出。(来源:§1)

让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 的核心结论有哪些证据?

最直接的证据来自作者保留客户的 API 提示词测试集。175B InstructGPT 与 175B GPT-3 直接比较时,前者有 85% ± 3% 的回答被偏好;与经过精心 few-shot 提示的 175B GPT-3 比较时为 71% ± 4%。更醒目的结果是,1.3B InstructGPT 也胜过 175B GPT-3。(来源:§4.1;图 1)

阅读 让语言模型更听懂“你想要什么”:InstructGPT 与 RLHF 时最需要注意什么局限?

最直接的证据来自作者保留客户的 API 提示词测试集。175B InstructGPT 与 175B GPT-3 直接比较时,前者有 85% ± 3% 的回答被偏好;与经过精心 few-shot 提示的 175B GPT-3 比较时为 71% ± 4%。更醒目的结果是,1.3B InstructGPT 也胜过 175B GPT-3。(来源:§4.1;图 1)

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro