返回报告库

AI / Technology

语言模型是无监督的多任务学习者

关于这篇论文的三个关键问题

语言模型是无监督的多任务学习者 解决了什么问题?

当时的典型 NLP 系统,需要为翻译、阅读理解、摘要等任务分别收集标注数据、设计目标并训练。它们在指定分布上可以很强,却容易对输入分布或任务表述的小变化变得脆弱。作者认为,单任务、单领域训练是这种泛化不足的重要来源;如果通用系统需要成百上千种任务,继续手工扩展标注集与目标会非常昂贵。[来源:第 1 节,pp. 1–2]

语言模型是无监督的多任务学习者 的核心结论有哪些证据?

在 CNN/Daily Mail 摘要上,带 TL;DR: 提示的平均 ROUGE 为 21.40,只是略高于随机抽取三句的 20.98;去掉提示后再降 6.4 分。英译法仅 5 BLEU;法译英为 11.5 BLEU,仍远低于当时最佳无监督方法的 33.5。Natural Questions 的精确匹配率只有 4.1%,而检索结合抽取式问答系统在 30%–50% 区间。[来源:表 4、第 3.6–3.8 节,pp. 6–7]

阅读 语言模型是无监督的多任务学习者 时最需要注意什么局限?

WebText 来自公开网页,因此训练文本可能与测试集重叠。论文用 8-gram 检查发现,常见语言模型测试集与 WebText 训练集平均约有 3.2% 重叠。CoQA 新闻域约 15% 的文档在 WebText 中,作者估计这让总分增加约 0.5–1.0 F1;LAMBADA 去除所有有重叠的样本后,困惑度从 8.6 变为 8.7、准确率从 63.2% 变为 62.9%。这说明重叠对报告结果有小而一致的帮助,也说明当时的去重方法只能作为近似检查。[来源:第 4 节,pp. 8–9]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro