返回报告库

AI / Technology

弱到强泛化用弱监督唤出强模型的能力

关于这篇论文的三个关键问题

弱到强泛化:用弱监督唤出强模型的能力 解决了什么问题?

知识蒸馏和伪标签训练也会让教师给学生打标签,但常见目标是把强教师的知识传给较弱或同等级学生。这篇论文把方向反过来:学生远强于教师,而且标签错误不是均匀噪声,而是教师在具体难题上系统性犯错。作者借用了弱监督、半监督学习和熵最小化等思路,但研究对象是“大能力鸿沟”。[§2]

弱到强泛化:用弱监督唤出强模型的能力 的核心结论有哪些证据?

研究覆盖 22 个二分类 NLP 数据集、国际象棋最佳着法生成,以及一个用于 ChatGPT 的内部偏好比较数据集。朴素微调下,学生在几乎所有模型规模组合中都超过弱教师。NLP 的最大学生常补回 50% 以上差距;国际象棋在师生差距较小时可超过 40%,但差距扩大后反而恶化;奖励模型通常约为 10%,几乎从不超过 20%。[§4.1;§4.2,图3]

阅读 弱到强泛化:用弱监督唤出强模型的能力 时最需要注意什么局限?

第一,当前强模型未专门学过如何模仿弱模型,甚至模型越大越不容易拟合弱教师的错误;未来超强模型可能非常擅长预测并迎合人类判断。第二,NLP 任务或相近内容可能已进入预训练数据,使相关能力更容易被唤出。第三,奖励建模实验只测偏好预测准确率,没有继续用强化学习反复优化奖励模型;高压优化下是否稳健仍未知。[§5.1.3;§6.1;§4.1;§6.2.1]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro