返回报告库

AI / Technology

直接偏好优化你的语言模型其实就是奖励模型

传统 RLHF 需要显式奖励模型与强化学习循环

图 1|教学重绘。箭头表示训练信息流。DPO 仍依赖偏好对和参考模型;图中省略参考模型,是为了突出两条训练管线的结构差异,而不是表示 DPO 无需参考模型。

标准流程通常先做监督微调(SFT),再收集回答对及偏好标签,训练一个输出标量分数的奖励模型,最后用 PPO 等强化学习算法提高奖励,同时用 KL 惩罚约束新策略不要偏离参考模型。这个闭环需要多个模型、训练中采样、奖励与价值估计以及较敏感的超参数,论文将其概括为复杂、成本高且可能不稳定。来源:论文 §3,PDF pp. 3–4

一个 DPO 样本

图 2|教学重绘。这里的“提高 / 压低”都是相对于固定参考模型的变化;DPO 学到的是偏好排序,不是绝对真值分数。

DPO 的损失比较两项:偏好回答相对参考模型提升了多少,拒绝回答相对参考模型提升了多少。训练推动前者高于后者;若模型当前把拒绝回答排得更高,该样本会获得更大的权重。论文的消融结果指出,去掉这种动态权重的朴素概率比目标会导致模型退化。来源:论文 Eq. 7 及梯度分析,PDF pp. 4–5;附录表 3

论文直接测试了三类任务和最高 6B 模型

图 3|证据地图。右侧表示“尚未充分建立”,不表示 DPO 已在这些方面失败。

研究附录

官方原题: Direct Preference Optimization: Your Language Model is Secretly a Reward Model
作者: Rafael Rafailov、Archit Sharma、Eric Mitchell、Stefano Ermon、Christopher D. Manning、Chelsea Finn
发表: NeurIPS 2023;本文依据 arXiv v3(2024-07-29)
一手来源: arXiv 摘要页 · 论文 PDF

核心结论

三个记忆点

  1. DPO 删掉的是训练环节,不是人的偏好。 输入仍是同一提示下的“偏好回答 / 拒绝回答”成对数据;改变的是不再先训练独立奖励模型、再用 PPO 做强化学习,而是直接更新语言模型。来源:论文图 1 与 §4,PDF pp. 2、4–5
  2. 关键转换是把奖励差写成策略相对参考模型的对数概率差。 Bradley–Terry 偏好模型只关心两个回答的奖励差,因此只依赖提示的配分函数会抵消,最终得到可直接优化策略的二元交叉熵目标。来源:论文 Eq. 4–7,PDF p. 4
  3. 论文证明了“更简单且有竞争力”,没有证明“普遍更好”。 在情感控制、摘要和单轮对话实验中,DPO 达到或超过论文所比较的强基线;但实验最大只到 6B 参数,分布外泛化、奖励过优化和自动评估偏差仍待更系统研究。来源:论文 §6–7,PDF pp. 7–10

一句话说,这篇论文把标准 RLHF 的“先学打分器,再让模型追分”改写成“直接让模型拉开好答案与差答案的相对概率”,从而把一个复杂的两阶段训练问题变成普通的分类式微调。

问题

标准 RLHF 为什么重

标准流程通常先做监督微调(SFT),再收集回答对及偏好标签,训练一个输出标量分数的奖励模型,最后用 PPO 等强化学习算法提高奖励,同时用 KL 惩罚约束新策略不要偏离参考模型。这个闭环需要多个模型、训练中采样、奖励与价值估计以及较敏感的超参数,论文将其概括为复杂、成本高且可能不稳定。来源:论文 §3,PDF pp. 3–4

真正要优化的目标

两条路线都想解决同一件事:在提高人类偏好奖励的同时,不让模型离原来的参考策略太远。论文把这写成“期望奖励减去 β 倍 KL 散度”;β 控制保守程度。困难不在目标本身,而在常规路线需要先估奖励、再用强化学习间接寻找策略。来源:论文 Eq. 3,PDF pp. 3–4

方法

从奖励函数换到策略

对带 KL 约束的奖励最大化问题,最优策略可以写成:参考策略乘以奖励的指数权重,再做归一化。把式子反过来,奖励就等于 β × log(当前策略概率 / 参考策略概率),外加一个只随提示变化的归一化项。因为成对偏好只比较两个回答的奖励差,这个共同项会相消。来源:论文 Eq. 4–6,PDF p. 4

这就是标题里“语言模型本身就是奖励模型”的准确含义:当前策略与参考策略的概率比,隐式定义了一个奖励;它不是说任意语言模型天然知道人类真正想要什么。

一对回答如何产生更新

DPO 的损失比较两项:偏好回答相对参考模型提升了多少,拒绝回答相对参考模型提升了多少。训练推动前者高于后者;若模型当前把拒绝回答排得更高,该样本会获得更大的权重。论文的消融结果指出,去掉这种动态权重的朴素概率比目标会导致模型退化。来源:论文 Eq. 7 及梯度分析,PDF pp. 4–5;附录表 3

训练配方与前提

训练数据是三元组 (提示, 偏好回答, 拒绝回答),参考模型通常取生成这些偏好数据时的 SFT 模型。若原 SFT 模型不可得,论文先在偏好回答上做最大似然微调,以减轻参考分布不匹配,再最小化 DPO 损失。理论推导依赖 Bradley–Terry 或更一般的 Plackett–Luce 偏好假设,并不是在所有偏好生成机制下无条件成立。来源:论文 §4–5,PDF pp. 4–6

证据与局限

三类任务上的结果

场景设置与主要对照论文报告的结果该结果能说明什么
IMDb 情感控制GPT-2-large;DPO、PPO、可访问真实奖励的 PPO-GT 等;共 22 次超参数/随机种子运行DPO 的奖励–KL 前沿严格优于论文中的 PPO,并优于 PPO-GT 前沿在有真实奖励可核验的受控任务里,DPO 更有效地优化了同一个受约束目标
Reddit TL;DR 摘要同一 GPT-J SFT 起点;GPT-4 代理评审,另做人类核验温度 0 时 DPO 对参考摘要胜率约 61%,PPO 最佳约 57%;人评中 DPO(温度 0.25)对 PPO(温度 0)获偏好 58%在该摘要设置下,DPO 的质量和采样温度稳健性均有优势
Anthropic HH 单轮对话Pythia-2.8B;与 Preferred-FT、2-shot、Best of 128 等比较DPO 是论文中唯一高效且超过测试集偏好回答的方案,并达到或超过 Best of 128 的最佳温度表现对离线真实偏好数据,DPO 不靠测试时 128 次采样也能保持竞争力

来源分别为论文 §6.1–6.2、图 2–3 与表 2,PDF pp. 7–10;对话结论中的“PPO 水平”使用 Best of 128 作为粗略代理,不能当作直接 PPO 对照。论文 PDF

证据边界

最强证据是受控情感任务的奖励–KL 前沿,因为那里存在可直接计算的真实奖励;摘要和对话更贴近真实应用,却主要依赖 GPT-4 代理评审。论文的人评显示 GPT-4 与人的逐项一致率大致接近人际一致率,但也发现评审提示会改变胜率,且简单提示会让 GPT-4 比人更偏爱冗长、重复的摘要。来源:论文 §6.4、表 2,PDF p. 10

作者明确留下四类不确定性:需要更全面比较分布外泛化;尚不清楚 DPO 中的奖励过优化如何表现;最大模型只有 6B,不能直接外推到大几个数量级的前沿模型;自动评审对提示敏感。CNN/DailyMail 的分布外摘要结果是初步积极信号——温度 0 时 DPO 与 PPO 胜率分别为 0.36 和 0.26——但单个迁移实验不足以解决泛化问题。来源:论文表 1 与 §7,PDF pp. 9–10

实际意义

什么时候值得采用

如果团队已经有高质量、同提示成对的偏好数据,并希望避免维护独立奖励模型和 PPO 训练栈,DPO 是一个很直接的基线:实现接近普通监督微调,训练期间无需从当前语言模型在线采样,也减少了强化学习专属调参。这里的“更省”是根据管线结构做出的工程解释;论文证明的是其实验设置中的简化与效果,不是对所有硬件、模型和数据规模给出的统一成本数字。依据:论文摘要、§4 与 §7

落地时别忽略什么

  • 数据仍是瓶颈。 DPO 没有消除偏好标注的质量、偏差和覆盖范围问题;它只是改变利用偏好数据的方法。
  • 参考模型是方法的一部分。 概率变化以它为锚,参考分布与偏好数据来源不匹配会带来分布偏移。
  • β 仍代表真实取舍。 它控制贴近参考模型与追随偏好的平衡;“几乎无需调参”是论文实验观察,不是永远可用默认值的保证。
  • 评估必须独立。 最好同时保留人评、任务指标和不同提示的模型评审,避免用训练偏好或单一裁判循环证明自己。

复现或评审这项工作时,最值得追问的是:偏好对由谁、按什么准则产生;参考模型是否与数据来源一致;是否同时报告质量与 KL;结论是否跨随机种子、采样温度、评审提示和分布成立;模型规模是否超出论文直接覆盖的最高 6B。把这些问题答清,才能判断 DPO 带来的是可靠简化,还是只把复杂性从训练栈转移到了数据和评估。

关于这篇论文的三个关键问题

直接偏好优化:你的语言模型其实就是奖励模型 解决了什么问题?

标准流程通常先做监督微调(SFT),再收集回答对及偏好标签,训练一个输出标量分数的奖励模型,最后用 PPO 等强化学习算法提高奖励,同时用 KL 惩罚约束新策略不要偏离参考模型。这个闭环需要多个模型、训练中采样、奖励与价值估计以及较敏感的超参数,论文将其概括为复杂、成本高且可能不稳定。来源:论文 §3,PDF pp. 3–4

直接偏好优化:你的语言模型其实就是奖励模型 的核心结论有哪些证据?

作者明确留下四类不确定性:需要更全面比较分布外泛化;尚不清楚 DPO 中的奖励过优化如何表现;最大模型只有 6B,不能直接外推到大几个数量级的前沿模型;自动评审对提示敏感。CNN/DailyMail 的分布外摘要结果是初步积极信号——温度 0 时 DPO 与 PPO 胜率分别为 0.36 和 0.26——但单个迁移实验不足以解决泛化问题。来源:论文表 1 与 §7,PDF pp. 9–10

阅读 直接偏好优化:你的语言模型其实就是奖励模型 时最需要注意什么局限?

作者明确留下四类不确定性:需要更全面比较分布外泛化;尚不清楚 DPO 中的奖励过优化如何表现;最大模型只有 6B,不能直接外推到大几个数量级的前沿模型;自动评审对提示敏感。CNN/DailyMail 的分布外摘要结果是初步积极信号——温度 0 时 DPO 与 PPO 胜率分别为 0.36 和 0.26——但单个迁移实验不足以解决泛化问题。来源:论文表 1 与 §7,PDF pp. 9–10

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro