返回报告库

AI / Technology

用统一的文本到文本 Transformer 探索迁移学习的极限

关于这篇论文的三个关键问题

用统一的文本到文本 Transformer 探索迁移学习的极限 解决了什么问题?

当时的分类常接专用分类头,问答可能预测文本跨度,翻译和摘要则生成序列。架构、目标和输出形式一起变,很难判断改进到底来自哪里。T5 因此先固定基线,再每次主要改一类因素。来源:第 1、3.1 节

用统一的文本到文本 Transformer 探索迁移学习的极限 的核心结论有哪些证据?

T5-11B 在 24 个任务中有 18 个达到当时最佳。测试集上,GLUE 平均分 90.3;SuperGLUE 从此前最佳 84.6 升到 88.9;CNN/Daily Mail 的 ROUGE-1/2/L 为 43.52/21.55/40.69。但三个 WMT 翻译任务的 BLEU 均未超过表中的此前最佳:“很多任务领先”不等于“所有任务通吃”。来源:第 3.7 节,表 14,PDF 第 37–39 页

阅读 用统一的文本到文本 Transformer 探索迁移学习的极限 时最需要注意什么局限?

T5-11B 在 24 个任务中有 18 个达到当时最佳。测试集上,GLUE 平均分 90.3;SuperGLUE 从此前最佳 84.6 升到 88.9;CNN/Daily Mail 的 ROUGE-1/2/L 为 43.52/21.55/40.69。但三个 WMT 翻译任务的 BLEU 均未超过表中的此前最佳:“很多任务领先”不等于“所有任务通吃”。来源:第 3.7 节,表 14,PDF 第 37–39 页

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro