返回报告库

AI / Technology

从人类反馈中学习摘要

关于这篇论文的三个关键问题

从人类反馈中学习摘要 解决了什么问题?

常见监督训练会奖励模型复现人工摘要,ROUGE 则看生成文本与参考文本有多少重合。但一篇好摘要可能换一种说法;一篇坏摘要也可能因为复制了很多词而拿到高分。更麻烦的是,最大似然训练对“捏造事实”和“换了一个近义词”没有直接的轻重区分。论文把这个差距视为核心问题:训练目标只是我们真正关心的摘要质量的代理。来源:摘要、§1

从人类反馈中学习摘要 的核心结论有哪些证据?

标注者还按覆盖度、准确性、连贯性和总体质量做 7 分评价。6.7B PPO 模型有 45% 的摘要拿到总体 7/7;6.7B 监督基线为 20%,人工参考为 23%。只在 Reddit 上训练的人类反馈模型迁移到 CNN/DM 新闻后,也接近专门在新闻摘要上微调的 6.7B 模型。不过两类摘要的长度分布差异很大,新闻迁移结果不宜当成完全同条件的正面对决。来源:§4.1、§4.2、图 3–4

阅读 从人类反馈中学习摘要 时最需要注意什么局限?

标注者还按覆盖度、准确性、连贯性和总体质量做 7 分评价。6.7B PPO 模型有 45% 的摘要拿到总体 7/7;6.7B 监督基线为 20%,人工参考为 23%。只在 Reddit 上训练的人类反馈模型迁移到 CNN/DM 新闻后,也接近专门在新闻摘要上微调的 6.7B 模型。不过两类摘要的长度分布差异很大,新闻迁移结果不宜当成完全同条件的正面对决。来源:§4.1、§4.2、图 3–4

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro