AI / Technology
GPT-3把“教会模型”改成“在提示里示范”
论文:Tom B. Brown 等,Language Models are Few-Shot Learners,2020(arXiv v4)
阅读定位:这篇论文证明的是一种有潜力但不稳定的新使用范式,不是“通用智能已经解决”。
一、先记住这三点
- 变化在使用方式。 过去通常要为新任务准备大量标注数据并更新模型参数;GPT-3 尝试只在输入里写任务说明、放少量示例,参数保持不变,模型直接续写答案。这叫上下文学习(in-context learning)。[摘要,第 1 页;§2,第 6–7 页]
- 规模让这种方式明显变强。 作者训练了 8 个规模从 1.25 亿到 1750 亿参数的模型;在论文汇总的 42 个准确率类基准上,少样本表现随模型增大提升得比零样本更快。不过,这个汇总只用于观察趋势,作者明确说它不是严谨的单一基准。[图 1.3 与正文,第 4–5 页;表 2.1,第 8 页]
- 强不等于稳。 GPT-3 在部分问答、翻译和文本生成任务上很强,却在 ANLI、RACE、QuAC 等任务上仍然吃力;网页训练数据还可能混入测试题。论文展示了方向,也留下可靠性、污染、偏见和成本问题。[§1,第 5–6 页;§4–6,第 30–40 页]
图 1|读图重点:上方通过更新参数适配一个任务;下方只改变上下文,模型参数不变。这是教学性重绘,不是论文原图。依据:§2,第 6–7 页。
二、问题:为什么每个任务都重新训练不够理想
当时主流做法是“预训练 + 微调”:先在海量文本上学通用表示,再用某个任务的成千上万乃至数十万条标注样本更新参数。效果往往很好,但每来一个新任务,都要重新收集数据、训练和维护一个版本;窄任务数据还可能诱导模型抓住捷径,离开训练分布后失效。[§1,第 3 页;§2,第 6 页]
论文把问题压缩成一句话:能否让一个已经预训练好的语言模型,仅凭自然语言说明和几个例子,就识别当前任务并开始做题? GPT-2 已出现这种迹象,但早期结果仍远落后于微调方法,例如当时的上下文学习方法在 Natural Questions 上只有 4%,在 CoQA 上为 55 F1。[§1,第 4 页]
三、方法:参数不动,任务进入上下文
GPT-3 仍是自回归 Transformer:读入前文,逐 token 预测后文。最大的版本有 1750 亿参数、96 层、2048-token 上下文窗口;作者还训练了 7 个更小版本,所有 8 个模型各训练 3000 亿 token,用来观察规模变化。[表 2.1 与 §2.1,第 8 页]
评测时,作者区分三种输入方式:零样本 只给任务说明;单样本 再给一个完整示例;少样本 放入上下文能容纳的多个示例,通常为 10–100 个。三种方式都不做梯度更新,也不微调。所谓“学习”,发生在一次前向计算的激活与上下文中,而不是写回模型参数。[§1,第 5 页;§2,第 6–7 页]
图 2|任务说明、示例和新问题被拼进同一段上下文;锁表示权重不更新。示例只提供模式,模型仍通过预测后续 token 产生答案。依据:图 1.1 说明与 §2,第 3、6–7 页。
为什么规模可能有用?论文的解释是:预训练让模型在参数中积累许多语言模式;推理时,它再利用上下文识别“现在要做哪种映射”。实验观察到,模型越大,加入示例带来的收益往往越明显。这里应保持克制:这支持“规模与上下文适应能力相关”,但并没有完全揭示模型是在真正学习新规则,还是在识别训练中见过的相似模式。[§1,第 4–6 页;脚注 1,第 4 页]
四、证据与边界:亮点是趋势,不是全面胜利
最直观的结果来自封闭式问答:CoQA 从零样本 81.5 F1、单样本 84.0 F1 到少样本 85.0 F1;TriviaQA 从 64.3%、68.0% 到 71.2%,其中少样本结果在论文采用的“闭卷”设定下达到当时最佳。[§1,第 5 页;§3.2,第 14–15 页] 更广泛地,作者在两打以上 NLP 数据集和若干合成任务上评测,并在 42 个以准确率计分的基准汇总中观察到:零样本随规模稳定改善,而少样本改善更快。[§1,第 5 页;图 1.3,第 5 页]
但不能把这些数字概括成“GPT-3 普遍超过专门模型”。论文自己列出三类限制:
- 任务表现不均。 ANLI 自然语言推断,以及 RACE、QuAC 阅读理解仍然困难;有些任务即使规模扩大也没有出现理想表现。[§1,第 5 页;§5,第 34 页]
- 测试污染难以排除。 作者用 n-gram 重叠检查训练集与基准,但后来发现过滤长文档的程序错误;因重训成本过高,没有重新训练,部分高度重叠的基准被剔除。重叠检测也会有误报和漏报。[§4,第 30–33 页;附录 C,第 43–45 页]
- 代价和社会风险真实存在。 论文估算 1750 亿参数模型训练约用 3.14×10²³ FLOPs;同时讨论了误用、偏见、公平性和能源消耗。论文中的下游成绩不能抵消这些风险。[附录 D,表 D.1,第 46 页;§6,第 35–40 页]
图 3|规模扩大与更强的上下文利用能力在实验中相关,但不同任务不均、数据污染和计算成本仍在。箭头表示论文观察与研究框架,不代表已证明单一因果。依据:图 1.3、§4–6、附录 D。
五、实践意义:它改变了产品原型方式,也改变了评测责任
对产品团队而言,最直接的意义是:一个新任务可以先从“写说明 + 给几个高质量示例”开始验证,而不必立即建设标注集和训练管线。这里是产品解释,不是作者直接给出的部署建议。它降低的是试验门槛,不是质量保障成本:示例顺序、措辞和抽样都会影响结果,关键场景仍需独立测试集、错误分类、污染排查和人工兜底。
更长远的贡献,是把研究问题从“每项任务能否训练一个模型”推进到“一个模型能否从上下文迅速识别任务”。论文最值得继承的不是某个榜单数字,而是它的对照框架:同一模型家族、多个规模、零/单/少样本三种条件、跨任务评测。最大未决问题也同样清楚:上下文中的适应到底来自可泛化的规则学习,还是大规模预训练后的模式检索;这种能力在分布变化和高风险场景下是否可靠?
研究附录:证据账本、术语与复核问题
证据账本
| 项目 | 论文中的证据 | 位置 | 本文如何使用 |
|---|---|---|---|
| 核心变化 | 所有任务均无梯度更新;用文本说明和示例指定任务 | 摘要;§2 | 定义上下文学习与微调的差别 |
| 模型与训练 | 8 个模型,1.25 亿至 1750 亿参数;均训练 3000 亿 token;最大模型 96 层、上下文 2048 token | 表 2.1;§2.1 | 说明规模实验设计,不把参数量当能力证明 |
| 少样本数量 | 通常 10–100 个示例,以能放入上下文为限 | §1 | 解释论文语境中的“few-shot” |
| 强证据 | CoQA 81.5/84.0/85.0 F1;TriviaQA 64.3/68.0/71.2% | §1;§3.2 | 展示零/单/少样本递进的具体例子 |
| 汇总趋势 | 42 个准确率类基准;少样本随规模提升更快 | 图 1.3 | 只作启发式趋势,不当作统一总分 |
| 失败任务 | ANLI、RACE、QuAC | §1;§5 | 反驳“全面胜利”的误读 |
| 污染不确定性 | n-gram 检测;长文档过滤 bug;因成本未重训 | §4;附录 C | 作为结果可信度边界 |
| 计算量 | GPT-3 175B 约 3.14×10²³ FLOPs | 表 D.1 | 说明训练成本量级 |
术语
- 预训练:先从大规模文本中学习通用的下一个 token 预测能力。
- 微调:在特定任务数据上继续训练并更新参数。
- 上下文学习:不更新参数,只通过当前输入中的说明和示例表现出任务适应。
- 零样本 / 单样本 / 少样本:推理时分别提供 0、1、多个完整示例;零样本仍可包含任务说明。
- 闭卷问答:作答时不检索外部文档,答案只能来自模型参数和当前提示。
不确定与冲突
- “少样本达到当时最佳”只适用于论文明确标注的具体数据集与设定,不能外推到所有 NLP 任务。
- 论文说污染对多数数据集影响较小,但过滤 bug、检测阈值和网页来源使“完全没有泄漏”无法成立。
- 论文展示规模与表现的系统关联,但没有隔离规模、数据构成和训练计算量各自的因果贡献。
- 论文发表于 2020 年;本文只解释该论文当时的实验,不拿后续模型表现反向改写原结论。
建议复核的四个问题
- 每个关键结果用的是公开测试集、私有测试集,还是开发集?论文在部分私有测试集上因模型太大而报告开发集结果。[§2.4,第 10 页]
- 示例的选择、顺序与提示措辞改变后,均值和方差如何变化?
- 去除与训练语料可能重叠的样本后,结论是否仍成立?
- 与微调方法比较时,数据量、算力、检索能力和测试协议是否真正可比?
来源
关于这篇论文的三个关键问题
GPT-3:把“教会模型”改成“在提示里示范” 解决了什么问题?
当时主流做法是“预训练 + 微调”:先在海量文本上学通用表示,再用某个任务的成千上万乃至数十万条标注样本更新参数。效果往往很好,但每来一个新任务,都要重新收集数据、训练和维护一个版本;窄任务数据还可能诱导模型抓住捷径,离开训练分布后失效。[§1,第 3 页;§2,第 6 页]
GPT-3:把“教会模型”改成“在提示里示范” 的核心结论有哪些证据?
最直观的结果来自封闭式问答:CoQA 从零样本 81.5 F1、单样本 84.0 F1 到少样本 85.0 F1;TriviaQA 从 64.3%、68.0% 到 71.2%,其中少样本结果在论文采用的“闭卷”设定下达到当时最佳。[§1,第 5 页;§3.2,第 14–15 页] 更广泛地,作者在两打以上 NLP 数据集和若干合成任务上评测,并在 42 个以准确率计分的基准汇总中观察到:零样本随规模稳定改善,而少样本改善更快。[§1,第 5 页;图 1.3,第 5 页]
阅读 GPT-3:把“教会模型”改成“在提示里示范” 时最需要注意什么局限?
但不能把这些数字概括成“GPT-3 普遍超过专门模型”。论文自己列出三类限制: