返回报告库

AI / Technology

弱到强泛化用弱监督唤出强模型的能力

未来监督难题与今天实验的类比

图 1|论文把“人类监督超强模型”缩成“弱模型监督强模型”。这是一种可实验的类比,不是两者等同。[§1,图1;§6.1]

  1. 弱标签不一定把强模型锁死在弱教师的水平。 把小模型生成的标签交给大模型微调后,强学生几乎总能超过弱教师;作者把这个现象叫作“弱到强泛化”。[摘要;§4.2,图3]
  2. 朴素微调只找回一部分能力。 NLP 表现最好,国际象棋更不稳定,ChatGPT 奖励模型通常只补回约 10% 的能力差距。[§4.2,图3]
  3. 简单方法能明显改善结果,却没有一种通吃。 在 22 个 NLP 任务上,置信度辅助损失把最极端模型组合的中位 PGR 从约 25% 提到近 80%;但它在部分设置中无效或变差。[§4.3.2,图5、图6]

弱到强实验的三阶段流程

图 2|弱教师产生训练标签;真实标签只用来造教师、训练强上限和评估。在真正的超人监督场景里,这个强上限通常不可得。[§3]

研究先用真实标签微调小模型,得到弱监督者;再让它为留出的样本生成弱标签,用这些标签微调更大的强学生。最后,研究者用真实标签微调同一个强模型,得到可比较的“强上限”。这让实验能区分弱教师水平、弱监督后的学生水平和强模型充分监督后的水平。[§3]

置信度辅助损失如何减少照抄错误

图 3|这项损失不是自动识别正确答案,而是给强模型更多空间去坚持自身已有、较明确的判断。[§4.3.2;§5.1.2]

置信度辅助损失鼓励强学生对自己的预测更确定,即使它与弱标签冲突。直觉是让模型吸收教师想教的概念,但少抄教师的错误。逐级引导则不让最弱模型一步监督最强模型,而是经由两个中间规模模型、连续三轮传递标签。[§4.3.1;§4.3.2]

逐级引导跨越模型能力差距

图 4|逐级引导在国际象棋上改善明显,在 NLP 上只小幅改善,在奖励建模上没有改善,因此不能当作通用方案。[§4.3.1,图4]

图 3|这项损失不是自动识别正确答案,而是给强模型更多空间去坚持自身已有、较明确的判断。[§4.3.2;§5.1.2]

三类任务的定性结果对比

图 5|不同任务不是同一个故事。这里呈现论文的定性结论;精确数值见正文与原论文图3。[§4.2]

研究覆盖 22 个二分类 NLP 数据集、国际象棋最佳着法生成,以及一个用于 ChatGPT 的内部偏好比较数据集。朴素微调下,学生在几乎所有模型规模组合中都超过弱教师。NLP 的最大学生常补回 50% 以上差距;国际象棋在师生差距较小时可超过 40%,但差距扩大后反而恶化;奖励模型通常约为 10%,几乎从不超过 20%。[§4.1;§4.2,图3]

实验类比与真实未来监督之间的缺口

图 6|这些缺口意味着结果可能偏乐观。作者明确把现有方法称为概念验证,而不是建议今天部署的方案。[§1;§6.1]

第一,当前强模型未专门学过如何模仿弱模型,甚至模型越大越不容易拟合弱教师的错误;未来超强模型可能非常擅长预测并迎合人类判断。第二,NLP 任务或相近内容可能已进入预训练数据,使相关能力更容易被唤出。第三,奖励建模实验只测偏好预测准确率,没有继续用强化学习反复优化奖励模型;高压优化下是否稳健仍未知。[§5.1.3;§6.1;§4.1;§6.2.1]

研究附录

官方原题: Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision
作者: Collin Burns、Pavel Izmailov、Jan Hendrik Kirchner 等|发布: 2023-12-14|来源: arXiv:2312.09390

核心结论

三句话记住这篇论文

  1. 弱标签不一定把强模型锁死在弱教师的水平。 把小模型生成的标签交给大模型微调后,强学生几乎总能超过弱教师;作者把这个现象叫作“弱到强泛化”。[摘要;§4.2,图3]
  2. 朴素微调只找回一部分能力。 NLP 表现最好,国际象棋更不稳定,ChatGPT 奖励模型通常只补回约 10% 的能力差距。[§4.2,图3]
  3. 简单方法能明显改善结果,却没有一种通吃。 在 22 个 NLP 任务上,置信度辅助损失把最极端模型组合的中位 PGR 从约 25% 提到近 80%;但它在部分设置中无效或变差。[§4.3.2,图5、图6]

一句话说,这篇论文最大的贡献不是交出了一套可部署的超级对齐方案,而是搭了一个今天就能反复实验的试验场。它给出一个乐观信号:强模型有时能从不完美标签中读出教师的意图,而不是只复刻教师的错误。它也给出一个警告:在最接近现实对齐的奖励建模任务上,朴素方法尤其弱。[§1;§4.2;§6.3]

问题

今天的对齐依赖人能判断答案好坏

RLHF 等常见方法需要人类评价模型是否遵循指令、回答是否安全。可如果未来模型能写出上百万行复杂代码,人类可能连代码在做什么都无法可靠判断,更别说稳定标注它是否诚实、安全。论文追问的是:当监督者比被监督者弱很多时,训练还能唤出后者已有的更强能力吗?[§1]

过去的教师—学生训练通常假设教师更强

知识蒸馏和伪标签训练也会让教师给学生打标签,但常见目标是把强教师的知识传给较弱或同等级学生。这篇论文把方向反过来:学生远强于教师,而且标签错误不是均匀噪声,而是教师在具体难题上系统性犯错。作者借用了弱监督、半监督学习和熵最小化等思路,但研究对象是“大能力鸿沟”。[§2]

方法

三组模型把“学会了什么”分开

研究先用真实标签微调小模型,得到弱监督者;再让它为留出的样本生成弱标签,用这些标签微调更大的强学生。最后,研究者用真实标签微调同一个强模型,得到可比较的“强上限”。这让实验能区分弱教师水平、弱监督后的学生水平和强模型充分监督后的水平。[§3]

PGR 衡量补回了多少能力差距

性能差距恢复比例(PGR)回答一个直观问题:从弱教师到强上限之间的差距,强学生靠弱标签补回了多少?PGR 为 0,表示学生没有超过教师;PGR 为 1,表示追平强上限。这个指标方便比较不同规模组合,但它依赖实验中可见的真实标签;未来面对真正超人任务时,研究者未必能直接算它。[§3]

两种改进分别减少抄错和跨越难度

置信度辅助损失鼓励强学生对自己的预测更确定,即使它与弱标签冲突。直觉是让模型吸收教师想教的概念,但少抄教师的错误。逐级引导则不让最弱模型一步监督最强模型,而是经由两个中间规模模型、连续三轮传递标签。[§4.3.1;§4.3.2]

证据与局限

三类任务给出了三种不同答案

研究覆盖 22 个二分类 NLP 数据集、国际象棋最佳着法生成,以及一个用于 ChatGPT 的内部偏好比较数据集。朴素微调下,学生在几乎所有模型规模组合中都超过弱教师。NLP 的最大学生常补回 50% 以上差距;国际象棋在师生差距较小时可超过 40%,但差距扩大后反而恶化;奖励模型通常约为 10%,几乎从不超过 20%。[§4.1;§4.2,图3]

最亮眼的数字来自置信度损失

在最小弱教师监督最大强学生的 NLP 组合中,置信度辅助损失把 22 个任务的中位 PGR 从约 25% 提到近 80%。论文还发现,它会降低学生与教师错误答案的一致率,符合“少抄错误”的解释。不过这只是与机制一致的证据,不足以证明模型每次分歧都因为找到了真实概念。[§4.3.2,图5;§5.1.2,图8]

这个实验可能比未来真实监督更容易

第一,当前强模型未专门学过如何模仿弱模型,甚至模型越大越不容易拟合弱教师的错误;未来超强模型可能非常擅长预测并迎合人类判断。第二,NLP 任务或相近内容可能已进入预训练数据,使相关能力更容易被唤出。第三,奖励建模实验只测偏好预测准确率,没有继续用强化学习反复优化奖励模型;高压优化下是否稳健仍未知。[§5.1.3;§6.1;§4.1;§6.2.1]

实际意义

对产品团队,最有用的是“不要默认弱标签等于能力上限”

当专家标注昂贵或不完整时,强模型可能仍能从较弱反馈中学得比反馈者更好的分类器。可这篇论文不支持把弱监督直接用于高风险自动决策。更稳妥的做法是保留一小组高质量评估集,分别测教师、学生和可达到的强基线,并按任务检查失效,而不是只看平均提升。这是基于论文实验设计的实践解读,不是作者给出的部署建议。[解释;§3;§4.3]

对研究团队,下一步是让实验更像真正的人类监督

关键验证包括:让真实的低能力人类监督更强模型;减少预训练泄漏;扩展到复杂生成任务;以及把学到的奖励模型放进强化学习,观察优化压力下是否失真。最终需要的不只是更高 PGR,还要能在没有真实标签时判断模型何时可靠、为什么可靠。[§6.2]

核对笔记

  • 模型范围: 文中的模型来自 GPT-4 家族,覆盖约 7 个数量级的预训练算力;它们并不是公开产品名为 GPT-2、GPT-3、GPT-3.5 的那些模型。“GPT-2 级”“GPT-3.5 级”描述的是大致能力水平。[§1,脚注1]
  • 数据范围: NLP 是公开基准的二分类改写;国际象棋预测最佳第一步;ChatGPT 奖励建模数据为专有数据,外部读者无法完整复核该部分。[§4.1;附录A]
  • 保留问题: PGR 需要真实标签定义强上限;方法没有跨三类任务稳定奏效;论文没有证明弱监督可以安全控制未来的超人模型。[§3;§4.3;§6]

关于这篇论文的三个关键问题

弱到强泛化:用弱监督唤出强模型的能力 解决了什么问题?

知识蒸馏和伪标签训练也会让教师给学生打标签,但常见目标是把强教师的知识传给较弱或同等级学生。这篇论文把方向反过来:学生远强于教师,而且标签错误不是均匀噪声,而是教师在具体难题上系统性犯错。作者借用了弱监督、半监督学习和熵最小化等思路,但研究对象是“大能力鸿沟”。[§2]

弱到强泛化:用弱监督唤出强模型的能力 的核心结论有哪些证据?

研究覆盖 22 个二分类 NLP 数据集、国际象棋最佳着法生成,以及一个用于 ChatGPT 的内部偏好比较数据集。朴素微调下,学生在几乎所有模型规模组合中都超过弱教师。NLP 的最大学生常补回 50% 以上差距;国际象棋在师生差距较小时可超过 40%,但差距扩大后反而恶化;奖励模型通常约为 10%,几乎从不超过 20%。[§4.1;§4.2,图3]

阅读 弱到强泛化:用弱监督唤出强模型的能力 时最需要注意什么局限?

第一,当前强模型未专门学过如何模仿弱模型,甚至模型越大越不容易拟合弱教师的错误;未来超强模型可能非常擅长预测并迎合人类判断。第二,NLP 任务或相近内容可能已进入预训练数据,使相关能力更容易被唤出。第三,奖励建模实验只测偏好预测准确率,没有继续用强化学习反复优化奖励模型;高压优化下是否稳健仍未知。[§5.1.3;§6.1;§4.1;§6.2.1]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro