返回报告库

AI / Technology

BERT让同一个语言模型同时看见词的左边与右边

关于这篇论文的三个关键问题

BERT:让同一个语言模型同时看见词的左边与右边 解决了什么问题?

当时的预训练迁移主要有两条路:ELMo 把独立训练的左向和右向表示作为特征塞进任务专用网络;OpenAI GPT 则预训练一个从左向右读的 Transformer,再整体微调。论文认为,两者都没让同一深层网络在每一层同时融合左右信息。对问答这类逐词定位任务,这个限制尤其直接:判断某个词是不是答案,往往既要看问题,也要看它前后的段落内容。来源:论文 §§1–2、附录 A.4

BERT:让同一个语言模型同时看见词的左边与右边 的核心结论有哪些证据?

还要保留四个边界:第一,预训练语料是 BooksCorpus 的 8 亿词与英文 Wikipedia 的 25 亿词,论文没有据此证明跨语言能力;第二,结论来自指定基准和当时榜单,不等于开放环境中的可靠理解;第三,BERTLARGE 的预训练用了 64 块 TPU 芯片、耗时 4 天,复制“训练方法”不等于复制“训练门槛”;第四,自注意力成本随序列长度平方增长,论文为提速让 90% 的训练步只用 128 长度,最后 10% 才用 512。来源:论文 §3.1、附录 A.2

阅读 BERT:让同一个语言模型同时看见词的左边与右边 时最需要注意什么局限?

消融实验是更强的机制证据:在相同预训练数据、微调方案和超参数下,左到右模型在论文选取的五项任务上都弱于双向 MLM;去掉 NSP 也会降低 QNLI、MNLI 和 SQuAD 1.1。不过,这仍不是完美隔离:论文自己列出 BERT 与 GPT 在语料规模、批大小、特殊标记引入时机和微调学习率选择上的差异,因此不能把排行榜上的全部差距都简单归因于“双向”。来源:论文 §5.1、Table 5、附录 A.4

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro