返回报告库

AI / Technology

LoRA给大模型的改动装进“小插件”

关于这篇论文的三个关键问题

LoRA:给大模型的改动装进“小插件” 解决了什么问题?

全量微调会为每个任务学习一个与原模型同维度的参数变化 ΔΦ。对 GPT‑3 175B,这意味着每个任务都可能带来一套约 1750 亿参数的独立模型。论文把现有高效适配路线概括为两类:adapter 在 Transformer 层间插入串行模块,可能增加在线推理延迟;prefix/prompt 类方法占用可用于任务输入的序列长度,而且优化表现可能不随参数量单调改善。来源:论文第 2–3 节,第 3 页。

LoRA:给大模型的改动装进“小插件” 的核心结论有哪些证据?

作者报告的典型波动约为:WikiSQL ±0.5%、MNLI-m ±0.1%、SAMSum 三项分别 ±0.2/±0.2/±0.1;由于 GPT‑3 训练成本高,论文没有为表中每个条目分别给出随机种子统计。因此,“LoRA 全面胜过全量微调”应谨慎理解为:在这三个验证集及该实验配置下,结果持平或更高。来源:论文第 5.5 节,第 8 页。

阅读 LoRA:给大模型的改动装进“小插件” 时最需要注意什么局限?

在 GPT‑3 的 WikiSQL 与 MultiNLI 实验中,同时适配 Wq、Wv 时,r=1 已有竞争力:WikiSQL 为 73.4,r=8 为 73.8;MultiNLI 为 91.3 与 91.6。论文还比较 r=8 与 r=64 学到的子空间,发现最主要奇异向量方向显著重叠,并据此解释小秩为何奏效。来源:论文表 6,第 10 页;第 7.2 节分析,第 11 页。这仍是经验解释,不等于低秩假设已被理论证明。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro