返回报告库

AI / NLP / Architecture

Transformer 原论文重读它真正消除的不是顺序,而是训练中的递归依赖

关于这篇论文的三个关键问题

Transformer 原论文重读:它真正消除的不是顺序,而是训练中的递归依赖 解决了什么问题?

图 0:Transformer 的关键变化不是把序列变成“无序集合”,而是把必须沿时间步传递的递归链,改造成可以用矩阵并行计算的全局关系。

Transformer 原论文重读:它真正消除的不是顺序,而是训练中的递归依赖 的核心结论有哪些证据?

Transformer Big 在 WMT 2014 英德翻译上达到 28.4 BLEU,比论文列出的此前最佳 Ensemble 高出超过 2 BLEU。Base 模型达到 27.3。

阅读 Transformer 原论文重读:它真正消除的不是顺序,而是训练中的递归依赖 时最需要注意什么局限?

Self-Attention 的优势不是“计算量永远更低”。它的核心优势是顺序操作数和最大路径长度都变成常数;代价是注意力矩阵对序列长度 n 呈平方增长。论文也明确说,当 n < d 时 Self-Attention 通常比 Recurrent Layer 更快,这在当时的机器翻译句子表示中常见,但不能外推成“任意长度都更便宜”。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro