レポート一覧へ

AI / Technology

注意機構だけで十分

この論文についての3つの重要な質問

注意機構だけで十分はどの課題を扱いますか?

さらに、全点を比べる Self-Attention は長い系列でメモリと計算が二乗増加する。論文は局所範囲へ制限する案を将来課題として挙げただけで、長文問題を解決してはいない。注意分布に構文・意味らしいパターンが見えるという観察もあるが、注意重みが説明として十分だという因果的な検証ではない。(論文 §4)

注意機構だけで十分の中心的な主張を支える根拠は何ですか?

一つの大きな注意計算だけでなく、Query・Key・Value を複数の低次元空間へ射影し、それぞれで注意を並列計算して結合する。基本モデルは 8ヘッド で、各ヘッドの Key と Value は 64次元。これにより、異なる位置や表現部分空間の関係を同時に扱える。実際に各ヘッドが必ず特定の文法役割を持つ、という意味ではない。再帰も畳み込みもないため語順は自動では伝わらず、入力埋め込みに異なる周波数の sin・cos で作る位置符号を加える。学習型位置埋め込みとの比較はほぼ同等だった。(論文 §3.2.2・§3.5・Table 3)

注意機構だけで十分を読むときに注意すべき限界は何ですか?

訓練コストは、GPU時間と著者らが仮定した各GPUの持続性能を掛けた推定 FLOPs で比較されている。したがって「当時の比較条件で大幅に低コスト」は支持されるが、現代のハードウェアや実装へその倍率をそのまま移すことはできない。(論文 §5.2・§6.1)

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード