レポート一覧へ

AI / Technology

LoRA大規模言語モデルを低ランク更新で適応する

この論文についての3つの重要な質問

LoRA:大規模言語モデルを低ランク更新で適応するはどの課題を扱いますか?

この論文の主実験では、自己注意の投影行列のうち主にqueryとvalueへLoRAを適用し、MLPは凍結した。LoRA自体は密結合層一般に使える設計だが、MLP、LayerNorm、biasへの適用は十分に調べておらず、将来課題としている。[論文 §4.2]

LoRA:大規模言語モデルを低ランク更新で適応するの中心的な主張を支える根拠は何ですか?

論文が比較する代表例は、Transformerブロックに小さな層を足すアダプター と、入力側に学習可能な表現を加えるprefix tuning だ。アダプターは直列の計算を増やすため、とくに小バッチのオンライン推論で遅延を増やしうる。prefix tuningは利用可能な系列長を削り、最適化も不安定になりうる、と著者らは述べる。GPT-2 Mediumの測定では、短い系列・バッチ1でアダプターの遅延増加が最大30.3%だった。[論文 §3, Table 1, Appendix B]

LoRA:大規模言語モデルを低ランク更新で適応するを読むときに注意すべき限界は何ですか?

GPT-3 175Bでは、queryとvalueにLoRAを適用した設定で、チェックポイントが350GBから35MBへ約1万分の1になった。学習時VRAMは1.2TBから350GB、学習スループットはV100 1基あたり32.5から43.1 tokens/sへ上がったと報告されている。一方、配備時には共有する350GBの基盤モデル自体が依然必要である。[論文 §4.2, footnotes 4–5]

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード