返回报告库

AI / Technology

用统一的文本到文本 Transformer 探索迁移学习的极限

多种 NLP 任务统一为文本到文本的流程

图 1|教学性重绘。任务前缀告诉模型要做什么,答案一律由文本 token 表达。依据:第 2.4 节。

这篇论文问的不是“再造一个模型”,而是:如果把任务形式和实验条件统一,哪些迁移学习选择真正有用,它们配合规模能走多远?

T5 连续片段破坏的预训练流程

图 2|教学性重绘。形状代表不同哨兵标记,用来对齐输入缺口与目标中的缺失片段。依据:第 3.1.4、3.3.4 节。

最终预训练目标破坏原文中 15% 的 token,遮住连续片段,平均长度为 3。每个缺口用不同的“哨兵标记”替代;解码器只生成缺失片段,不重写全文。实验中它表现略好,目标序列更短,计算也稍省。来源:第 3.3.2–3.3.4 节,表 5–7,PDF 第 21–23 页

T5 实验证据的边界

图 3|教学性重绘。左侧是直接经验证据,右侧是作者在展望中保留的问题;分界线防止把基准成功外推成更广泛结论。

来源:第 4.2 节,PDF 第 41–43 页

研究附录

官方原题Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
作者:Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, Peter J. Liu
出版:JMLR 21(140):1–67, 2020;arXiv:1910.10683
一手来源JMLR 论文页 · 论文 PDF

核心结论

  1. 统一接口:翻译、分类、问答、摘要都改写成“输入文本,生成文本”,因而能在同一套模型和损失函数下比较迁移学习方案。
  2. 先系统实验,再扩大规模:作者逐项比较架构、预训练目标、无标注数据、迁移方式和规模,最后组合出 T5 配方。论文明说,它主要是对现有技术的调查、探索和经验比较,不是宣称一个全新方法。来源:第 1 节,PDF 第 2 页
  3. 效果强,代价也大:11B 版本在 24 个任务中有 18 个达到当时最佳,但预训练超过 1 万亿 token;作者本人也把巨型模型的不便和知识获取效率列为未解问题。来源:第 3.7、4.2 节,PDF 第 37、41–42 页

一句话主线

这篇论文问的不是“再造一个模型”,而是:如果把任务形式和实验条件统一,哪些迁移学习选择真正有用,它们配合规模能走多远?

问题

不同任务像在用不同尺子

当时的分类常接专用分类头,问答可能预测文本跨度,翻译和摘要则生成序列。架构、目标和输出形式一起变,很难判断改进到底来自哪里。T5 因此先固定基线,再每次主要改一类因素。来源:第 1、3.1 节

要比的不只是模型

作者比较五类选择:Transformer 架构、无监督目标、无标注语料、任务混合方式,以及模型大小与训练时长。评估覆盖 GLUE、SuperGLUE、CNN/Daily Mail、SQuAD,以及 WMT 英译德、法、罗马尼亚语任务。来源:第 2.3、3.2–3.6 节,PDF 第 6–35 页

方法

把标签也当作文本

每个样本都是一对文本字符串。翻译输入可以带“英译德”任务前缀,输出是德文;情感分类输出不再是隐藏类别 ID,而是“positive”这样的文本。这不代表任务变成同一件事;统一的是交互协议来源:第 2.4 节,PDF 第 7–8 页

用连续缺口学习补全

最终预训练目标破坏原文中 15% 的 token,遮住连续片段,平均长度为 3。每个缺口用不同的“哨兵标记”替代;解码器只生成缺失片段,不重写全文。实验中它表现略好,目标序列更短,计算也稍省。来源:第 3.3.2–3.3.4 节,表 5–7,PDF 第 21–23 页

从对照试验组合出 T5

基线实验中,编码器—解码器配合去噪目标在所有任务上表现最好(表 2)。过滤后的 C4 为 745GB,去掉启发式过滤的 6.1TB 版本反而在每个任务上更差(表 8)。最终配方是标准编码器—解码器、C4、连续片段破坏,先多任务预训练再分别微调,参数规模从 60M 到 11B。来源:表 2、8;第 3.7 节

证据与局限

最强证据是广度

T5-11B 在 24 个任务中有 18 个达到当时最佳。测试集上,GLUE 平均分 90.3;SuperGLUE 从此前最佳 84.6 升到 88.9;CNN/Daily Mail 的 ROUGE-1/2/L 为 43.52/21.55/40.69。但三个 WMT 翻译任务的 BLEU 均未超过表中的此前最佳:“很多任务领先”不等于“所有任务通吃”。来源:第 3.7 节,表 14,PDF 第 37–39 页

规模不是全部解释

表 15 是关键对照:基线模型从约 340 亿 token 延长到 1 万亿 token,GLUE 从 83.28 升到 84.80;同为 Base 规模、使用完整 T5 配方则达到 85.97,并在表中其他每项下游评估上也超过长训练基线。这支持“训得更久不是唯一原因”;但 11B 最终结果仍是配方和规模一起变,不能归因于某个单独因素。来源:表 15,PDF 第 39–40 页

论文没有证明什么

  • 没有证明训练高效:最大模型需要约 1 万亿预训练 token;作者直接质疑连续片段去噪是否是教会模型通用知识的高效方法。
  • 没有证明跨语言通用:预训练主要是英文,作者承认翻译没有达到当时最佳,并把语言无关模型列为后续方向。
  • 没有给出任务相似性的一般理论:域内无标注数据有时更好,但论文主要依靠数据来源做直观判断,没有可预测迁移效果的形式化尺度。

来源:第 4.2 节,PDF 第 41–43 页

实际意义

对产品和工程的启示

对产品来说,文本到文本接口的价值是降低任务接入的异构性:新任务更像是定义输入模板、输出语义和数据,而不是重做一个模型头。这是对论文机制的工程解读,不是作者对任何具体产品的效果承诺。

统一接口也不会自动统一成功标准。分类要限定合法标签,摘要要查事实性,问答要处理无答案情形,生成任务还要管理解码成本。工程上可共享模型和训练管线,但仍应保留任务级评估与风险门槛。

复现或继续研究时先问

  1. 对照是否只改了一类因素,还是数据量、参数量和训步同时变了?
  2. 报告的是验证集还是测试集?低资源任务的多次运行方差是否保留?
  3. 预训练数据与下游数据的领域重合,是否解释了主要收益?
  4. 把准确率与训练、推理成本一起算,结论是否仍成立?

术语与来源索引

  • Text-to-text:输入和输出都用文本 token 序列表示,不是指所有任务的业务语义相同。
  • C4:Colossal Clean Crawled Corpus,从 Common Crawl 英文网页文本经启发式清洗而来;论文表 8 标为 745GB。
  • 分数口径:大多数对照表用验证集;最终表 14 除 SQuAD 使用验证集外,其余报告测试集。低资源任务存在较大运行间方差,作者提醒谨慎比较 GLUE/SuperGLUE 聚合分数。来源:第 3.1.7 节,PDF 第 13–14 页

不确定性:表 14 的“此前最佳”截止日期是 2019 年 10 月 24 日,只能还原当时的比较,不代表当下排名。

关于这篇论文的三个关键问题

用统一的文本到文本 Transformer 探索迁移学习的极限 解决了什么问题?

当时的分类常接专用分类头,问答可能预测文本跨度,翻译和摘要则生成序列。架构、目标和输出形式一起变,很难判断改进到底来自哪里。T5 因此先固定基线,再每次主要改一类因素。来源:第 1、3.1 节

用统一的文本到文本 Transformer 探索迁移学习的极限 的核心结论有哪些证据?

T5-11B 在 24 个任务中有 18 个达到当时最佳。测试集上,GLUE 平均分 90.3;SuperGLUE 从此前最佳 84.6 升到 88.9;CNN/Daily Mail 的 ROUGE-1/2/L 为 43.52/21.55/40.69。但三个 WMT 翻译任务的 BLEU 均未超过表中的此前最佳:“很多任务领先”不等于“所有任务通吃”。来源:第 3.7 节,表 14,PDF 第 37–39 页

阅读 用统一的文本到文本 Transformer 探索迁移学习的极限 时最需要注意什么局限?

T5-11B 在 24 个任务中有 18 个达到当时最佳。测试集上,GLUE 平均分 90.3;SuperGLUE 从此前最佳 84.6 升到 88.9;CNN/Daily Mail 的 ROUGE-1/2/L 为 43.52/21.55/40.69。但三个 WMT 翻译任务的 BLEU 均未超过表中的此前最佳:“很多任务领先”不等于“所有任务通吃”。来源:第 3.7 节,表 14,PDF 第 37–39 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro