AI / Technology
语言模型是无监督的多任务学习者
两种训练范式:逐任务标注与从多样网页文本中学习
图 1|教学重绘。上方是当时主流的逐任务监督路线;下方是论文探索的路线:同一个语言模型从多样文本学习,再由上下文引出任务行为。图示为解释性概括,不是论文原图。
一句话概括:这篇论文把“先预训练、再为每个任务微调”的边界往前推了一步——它证明了单纯扩大数据多样性和模型容量,就能让语言模型在没有任务专用训练的情况下显露多种能力,但这些能力远不均衡。
从自然文本示范到多种零样本行为
图 2|机制示意。训练阶段没有显式任务标签:自然文本被编码后用于训练同一个 Transformer;推理阶段,上下文提示让同一模型续写成翻译、问答或摘要。
模型训练时始终做同一件事:根据前文预测下一个符号。作者的关键推断是,网页里本来就存在诸如“英文句子—法文句子”“文档—问题—答案”等序列;为了更好地预测这些序列,模型必须部分学会其中的任务关系。测试时,再把文档、示例对或 TL;DR: 之类的任务线索放入上下文,引导模型生成所需形式。这个解释得到实验支持,但论文没有证明模型形成了抽象、稳定的任务表示。[来源:第 2 节与第 3.5–3.8 节,pp. 2–7]
零样本能力跨任务不均衡,并需检查三类风险
图 3|概念图,不是数值图。不同赛道表示不同任务的零样本表现差异;放大镜对应论文中必须检查的三件事:训练—测试重叠、提示形式敏感性,以及结果对模型容量的依赖。
WebText 来自公开网页,因此训练文本可能与测试集重叠。论文用 8-gram 检查发现,常见语言模型测试集与 WebText 训练集平均约有 3.2% 重叠。CoQA 新闻域约 15% 的文档在 WebText 中,作者估计这让总分增加约 0.5–1.0 F1;LAMBADA 去除所有有重叠的样本后,困惑度从 8.6 变为 8.7、准确率从 63.2% 变为 62.9%。这说明重叠对报告结果有小而一致的帮助,也说明当时的去重方法只能作为近似检查。[来源:第 4 节,pp. 8–9]
研究附录
官方题名: Language Models are Unsupervised Multitask Learners
作者: Alec Radford、Jeffrey Wu、Rewon Child、David Luan、Dario Amodei、Ilya Sutskever
发布机构与年份: OpenAI,2019
主源: 论文 PDF(24 页)
核心结论
三个值得记住的点
- 任务可以藏在语言里。 翻译对照、问答对话、文章摘要等结构本来就散落在网页文本中;足够大的语言模型为了预测下一个词,可能顺带学会识别并续写这些结构。[来源:第 2 节,pp. 2–3]
- 关键变化是“不再为每项任务单独训练”。 GPT-2 只在 WebText 上做语言建模,测试时不改参数或架构,仅靠文档、示例或短提示引出翻译、问答、摘要等行为。[来源:第 1–3 节,pp. 2–7]
- 这是方向性证据,不是通用智能的完成证明。 零样本阅读理解已有竞争力,但摘要、翻译和开放问答仍弱;论文明确说实际可用性还很远。[来源:第 6 节,p. 9]
一句话概括:这篇论文把“先预训练、再为每个任务微调”的边界往前推了一步——它证明了单纯扩大数据多样性和模型容量,就能让语言模型在没有任务专用训练的情况下显露多种能力,但这些能力远不均衡。
问题
窄专家为何难以泛化
当时的典型 NLP 系统,需要为翻译、阅读理解、摘要等任务分别收集标注数据、设计目标并训练。它们在指定分布上可以很强,却容易对输入分布或任务表述的小变化变得脆弱。作者认为,单任务、单领域训练是这种泛化不足的重要来源;如果通用系统需要成百上千种任务,继续手工扩展标注集与目标会非常昂贵。[来源:第 1 节,pp. 1–2]
论文真正追问什么
作者的问题不是“生成文本是否流畅”,而是:互联网里的自然语言是否已经包含足够多的任务示范,使一个高容量语言模型仅靠预测后续文本,就能在零样本条件下执行这些任务? 这里的“零样本”指测试目标任务时,不使用该任务的训练样本做参数更新,也不更换架构。[来源:第 2 节,pp. 2–3]
方法
WebText:用人的筛选信号提高网页质量
团队没有直接使用噪声较大的全量 Common Crawl,而是抓取 Reddit 上至少获得 3 karma 的外链,把用户投票当作粗略的质量筛选信号。论文使用的初版 WebText 经过去重和启发式清洗后,含略多于 800 万篇文档、40 GB 文本;链接截止到 2017 年 12 月,并移除了 Wikipedia 文档以减少与常见评测集的重叠。[来源:第 2.1 节,p. 3]
一个训练目标,多种潜在任务
模型训练时始终做同一件事:根据前文预测下一个符号。作者的关键推断是,网页里本来就存在诸如“英文句子—法文句子”“文档—问题—答案”等序列;为了更好地预测这些序列,模型必须部分学会其中的任务关系。测试时,再把文档、示例对或 TL;DR: 之类的任务线索放入上下文,引导模型生成所需形式。这个解释得到实验支持,但论文没有证明模型形成了抽象、稳定的任务表示。[来源:第 2 节与第 3.5–3.8 节,pp. 2–7]
GPT-2 的规模与输入表示
论文训练了四种 Transformer,参数量分别约为 117M、345M、762M、1542M;最大模型 GPT-2 有 48 层、隐藏维度 1600。它使用字节级 BPE,词表 50,257,上下文长度从早期 GPT 的 512 增至 1024 tokens。字节级表示让模型原则上能处理任意 Unicode 字符串;作者同时报告,四个模型都仍未充分拟合 WebText,模型变大时多项零样本成绩继续改善。[来源:第 2.2–3 节,pp. 4–5]
证据与局限
最有力的证据:能力随规模出现并跨任务迁移
- 在语言建模评测中,GPT-2 未针对目标数据集训练或微调,却在论文所测的 8 个数据集中有 7 个达到当时最佳结果。[来源:表 3 与第 3.1 节,p. 5]
- 在 CoQA 阅读理解开发集上,它取得 55 F1,没有使用基线系统训练所用的 127,000+ 人工问答对,却达到或超过 4 个基线中的 3 个;但监督式 BERT 系统接近 89 F1,而且错误检查显示 GPT-2 常依赖简单抽取启发式。[来源:第 3.5 节,p. 6]
- 在 LAMBADA 长距离预测中,加入终词约束过滤后准确率为 63.24%;Winograd Schema Challenge 为 70.70%,但后者只有 273 个样本,论文也提醒谨慎解读。[来源:第 3.3–3.4 节,pp. 5–6]
这些结果共同支持“容量是零样本迁移的重要条件”,但不同任务、提示和评分规则不能被压成一个统一的能力分数。
反例同样重要:会做不等于做好
在 CNN/Daily Mail 摘要上,带 TL;DR: 提示的平均 ROUGE 为 21.40,只是略高于随机抽取三句的 20.98;去掉提示后再降 6.4 分。英译法仅 5 BLEU;法译英为 11.5 BLEU,仍远低于当时最佳无监督方法的 33.5。Natural Questions 的精确匹配率只有 4.1%,而检索结合抽取式问答系统在 30%–50% 区间。[来源:表 4、第 3.6–3.8 节,pp. 6–7]
数据重叠与评测不确定性
WebText 来自公开网页,因此训练文本可能与测试集重叠。论文用 8-gram 检查发现,常见语言模型测试集与 WebText 训练集平均约有 3.2% 重叠。CoQA 新闻域约 15% 的文档在 WebText 中,作者估计这让总分增加约 0.5–1.0 F1;LAMBADA 去除所有有重叠的样本后,困惑度从 8.6 变为 8.7、准确率从 63.2% 变为 62.9%。这说明重叠对报告结果有小而一致的帮助,也说明当时的去重方法只能作为近似检查。[来源:第 4 节,pp. 8–9]
实际意义
对产品与研究的启发
这项工作的产品意义是一种接口变化:任务不一定要被写进新的模型头或专用训练流程,也可以由自然语言上下文临时指定。它为后来的“提示一个通用模型完成多种任务”提供了早期、清晰的实验证据。这里是基于论文结果的解释,不是作者对具体产品形态的承诺。
更可操作的结论是:若要复用这种路线,应同时投资于数据覆盖、模型容量、上下文设计和逐任务评测;不能只看生成样例是否顺畅。尤其要保留简单基线、检查数据污染,并报告提示变化后的结果。
阅读边界与复核问题
这篇论文建立的是 2019 年条件下的零样本基线,不证明模型理解了任务、不证明能力对新分布稳定,也没有回答微调后的上限、训练成本、安全性或偏见问题。论文还明确承认,许多实际任务上 GPT-2 可能不比随机更好。[来源:第 6 节,p. 9]
复核这类主张时,可以继续问四个问题:目标测试集是否可能出现在预训练数据中?提示格式改变后成绩是否保持?提升来自更大模型、更多数据,还是特定解码与过滤规则?与监督式、检索式和简单启发式基线相比,差距究竟多大?
术语速查
- 语言建模(language modeling):根据已有序列预测后续符号的概率。
- 零样本迁移(zero-shot transfer):不使用目标任务训练样本更新参数,直接在该任务上评测。
- 字节级 BPE:从字节出发合并常见片段的分词方式,兼顾开放字符覆盖与较短序列。
- 困惑度(perplexity):衡量语言模型预测不确定性的指标;在同一评测设定下通常越低越好。
- F1 / BLEU / ROUGE:分别常用于问答、翻译与摘要的自动评测;不同指标之间不能直接横向比较。
关于这篇论文的三个关键问题
语言模型是无监督的多任务学习者 解决了什么问题?
当时的典型 NLP 系统,需要为翻译、阅读理解、摘要等任务分别收集标注数据、设计目标并训练。它们在指定分布上可以很强,却容易对输入分布或任务表述的小变化变得脆弱。作者认为,单任务、单领域训练是这种泛化不足的重要来源;如果通用系统需要成百上千种任务,继续手工扩展标注集与目标会非常昂贵。[来源:第 1 节,pp. 1–2]
语言模型是无监督的多任务学习者 的核心结论有哪些证据?
在 CNN/Daily Mail 摘要上,带 TL;DR: 提示的平均 ROUGE 为 21.40,只是略高于随机抽取三句的 20.98;去掉提示后再降 6.4 分。英译法仅 5 BLEU;法译英为 11.5 BLEU,仍远低于当时最佳无监督方法的 33.5。Natural Questions 的精确匹配率只有 4.1%,而检索结合抽取式问答系统在 30%–50% 区间。[来源:表 4、第 3.6–3.8 节,pp. 6–7]
阅读 语言模型是无监督的多任务学习者 时最需要注意什么局限?
WebText 来自公开网页,因此训练文本可能与测试集重叠。论文用 8-gram 检查发现,常见语言模型测试集与 WebText 训练集平均约有 3.2% 重叠。CoQA 新闻域约 15% 的文档在 WebText 中,作者估计这让总分增加约 0.5–1.0 F1;LAMBADA 去除所有有重叠的样本后,困惑度从 8.6 变为 8.7、准确率从 63.2% 变为 62.9%。这说明重叠对报告结果有小而一致的帮助,也说明当时的去重方法只能作为近似检查。[来源:第 4 节,pp. 8–9]