返回报告库

AI / Technology

GPT-3把“教会模型”改成“在提示里示范”

论文:Tom B. Brown 等,Language Models are Few-Shot Learners,2020(arXiv v4)
阅读定位:这篇论文证明的是一种有潜力但不稳定的新使用范式,不是“通用智能已经解决”。

一、先记住这三点

  1. 变化在使用方式。 过去通常要为新任务准备大量标注数据并更新模型参数;GPT-3 尝试只在输入里写任务说明、放少量示例,参数保持不变,模型直接续写答案。这叫上下文学习(in-context learning)。[摘要,第 1 页;§2,第 6–7 页]
  2. 规模让这种方式明显变强。 作者训练了 8 个规模从 1.25 亿到 1750 亿参数的模型;在论文汇总的 42 个准确率类基准上,少样本表现随模型增大提升得比零样本更快。不过,这个汇总只用于观察趋势,作者明确说它不是严谨的单一基准。[图 1.3 与正文,第 4–5 页;表 2.1,第 8 页]
  3. 强不等于稳。 GPT-3 在部分问答、翻译和文本生成任务上很强,却在 ANLI、RACE、QuAC 等任务上仍然吃力;网页训练数据还可能混入测试题。论文展示了方向,也留下可靠性、污染、偏见和成本问题。[§1,第 5–6 页;§4–6,第 30–40 页]

图 1|读图重点:上方通过更新参数适配一个任务;下方只改变上下文,模型参数不变。这是教学性重绘,不是论文原图。依据:§2,第 6–7 页。

二、问题:为什么每个任务都重新训练不够理想

当时主流做法是“预训练 + 微调”:先在海量文本上学通用表示,再用某个任务的成千上万乃至数十万条标注样本更新参数。效果往往很好,但每来一个新任务,都要重新收集数据、训练和维护一个版本;窄任务数据还可能诱导模型抓住捷径,离开训练分布后失效。[§1,第 3 页;§2,第 6 页]

论文把问题压缩成一句话:能否让一个已经预训练好的语言模型,仅凭自然语言说明和几个例子,就识别当前任务并开始做题? GPT-2 已出现这种迹象,但早期结果仍远落后于微调方法,例如当时的上下文学习方法在 Natural Questions 上只有 4%,在 CoQA 上为 55 F1。[§1,第 4 页]

三、方法:参数不动,任务进入上下文

GPT-3 仍是自回归 Transformer:读入前文,逐 token 预测后文。最大的版本有 1750 亿参数、96 层、2048-token 上下文窗口;作者还训练了 7 个更小版本,所有 8 个模型各训练 3000 亿 token,用来观察规模变化。[表 2.1 与 §2.1,第 8 页]

评测时,作者区分三种输入方式:零样本 只给任务说明;单样本 再给一个完整示例;少样本 放入上下文能容纳的多个示例,通常为 10–100 个。三种方式都不做梯度更新,也不微调。所谓“学习”,发生在一次前向计算的激活与上下文中,而不是写回模型参数。[§1,第 5 页;§2,第 6–7 页]

图 2|任务说明、示例和新问题被拼进同一段上下文;锁表示权重不更新。示例只提供模式,模型仍通过预测后续 token 产生答案。依据:图 1.1 说明与 §2,第 3、6–7 页。

为什么规模可能有用?论文的解释是:预训练让模型在参数中积累许多语言模式;推理时,它再利用上下文识别“现在要做哪种映射”。实验观察到,模型越大,加入示例带来的收益往往越明显。这里应保持克制:这支持“规模与上下文适应能力相关”,但并没有完全揭示模型是在真正学习新规则,还是在识别训练中见过的相似模式。[§1,第 4–6 页;脚注 1,第 4 页]

四、证据与边界:亮点是趋势,不是全面胜利

最直观的结果来自封闭式问答:CoQA 从零样本 81.5 F1、单样本 84.0 F1 到少样本 85.0 F1;TriviaQA 从 64.3%68.0%71.2%,其中少样本结果在论文采用的“闭卷”设定下达到当时最佳。[§1,第 5 页;§3.2,第 14–15 页] 更广泛地,作者在两打以上 NLP 数据集和若干合成任务上评测,并在 42 个以准确率计分的基准汇总中观察到:零样本随规模稳定改善,而少样本改善更快。[§1,第 5 页;图 1.3,第 5 页]

但不能把这些数字概括成“GPT-3 普遍超过专门模型”。论文自己列出三类限制:

  • 任务表现不均。 ANLI 自然语言推断,以及 RACE、QuAC 阅读理解仍然困难;有些任务即使规模扩大也没有出现理想表现。[§1,第 5 页;§5,第 34 页]
  • 测试污染难以排除。 作者用 n-gram 重叠检查训练集与基准,但后来发现过滤长文档的程序错误;因重训成本过高,没有重新训练,部分高度重叠的基准被剔除。重叠检测也会有误报和漏报。[§4,第 30–33 页;附录 C,第 43–45 页]
  • 代价和社会风险真实存在。 论文估算 1750 亿参数模型训练约用 3.14×10²³ FLOPs;同时讨论了误用、偏见、公平性和能源消耗。论文中的下游成绩不能抵消这些风险。[附录 D,表 D.1,第 46 页;§6,第 35–40 页]

图 3|规模扩大与更强的上下文利用能力在实验中相关,但不同任务不均、数据污染和计算成本仍在。箭头表示论文观察与研究框架,不代表已证明单一因果。依据:图 1.3、§4–6、附录 D。

五、实践意义:它改变了产品原型方式,也改变了评测责任

对产品团队而言,最直接的意义是:一个新任务可以先从“写说明 + 给几个高质量示例”开始验证,而不必立即建设标注集和训练管线。这里是产品解释,不是作者直接给出的部署建议。它降低的是试验门槛,不是质量保障成本:示例顺序、措辞和抽样都会影响结果,关键场景仍需独立测试集、错误分类、污染排查和人工兜底。

更长远的贡献,是把研究问题从“每项任务能否训练一个模型”推进到“一个模型能否从上下文迅速识别任务”。论文最值得继承的不是某个榜单数字,而是它的对照框架:同一模型家族、多个规模、零/单/少样本三种条件、跨任务评测。最大未决问题也同样清楚:上下文中的适应到底来自可泛化的规则学习,还是大规模预训练后的模式检索;这种能力在分布变化和高风险场景下是否可靠?


研究附录:证据账本、术语与复核问题

证据账本

项目论文中的证据位置本文如何使用
核心变化所有任务均无梯度更新;用文本说明和示例指定任务摘要;§2定义上下文学习与微调的差别
模型与训练8 个模型,1.25 亿至 1750 亿参数;均训练 3000 亿 token;最大模型 96 层、上下文 2048 token表 2.1;§2.1说明规模实验设计,不把参数量当能力证明
少样本数量通常 10–100 个示例,以能放入上下文为限§1解释论文语境中的“few-shot”
强证据CoQA 81.5/84.0/85.0 F1;TriviaQA 64.3/68.0/71.2%§1;§3.2展示零/单/少样本递进的具体例子
汇总趋势42 个准确率类基准;少样本随规模提升更快图 1.3只作启发式趋势,不当作统一总分
失败任务ANLI、RACE、QuAC§1;§5反驳“全面胜利”的误读
污染不确定性n-gram 检测;长文档过滤 bug;因成本未重训§4;附录 C作为结果可信度边界
计算量GPT-3 175B 约 3.14×10²³ FLOPs表 D.1说明训练成本量级

术语

  • 预训练:先从大规模文本中学习通用的下一个 token 预测能力。
  • 微调:在特定任务数据上继续训练并更新参数。
  • 上下文学习:不更新参数,只通过当前输入中的说明和示例表现出任务适应。
  • 零样本 / 单样本 / 少样本:推理时分别提供 0、1、多个完整示例;零样本仍可包含任务说明。
  • 闭卷问答:作答时不检索外部文档,答案只能来自模型参数和当前提示。

不确定与冲突

  • “少样本达到当时最佳”只适用于论文明确标注的具体数据集与设定,不能外推到所有 NLP 任务。
  • 论文说污染对多数数据集影响较小,但过滤 bug、检测阈值和网页来源使“完全没有泄漏”无法成立。
  • 论文展示规模与表现的系统关联,但没有隔离规模、数据构成和训练计算量各自的因果贡献。
  • 论文发表于 2020 年;本文只解释该论文当时的实验,不拿后续模型表现反向改写原结论。

建议复核的四个问题

  1. 每个关键结果用的是公开测试集、私有测试集,还是开发集?论文在部分私有测试集上因模型太大而报告开发集结果。[§2.4,第 10 页]
  2. 示例的选择、顺序与提示措辞改变后,均值和方差如何变化?
  3. 去除与训练语料可能重叠的样本后,结论是否仍成立?
  4. 与微调方法比较时,数据量、算力、检索能力和测试协议是否真正可比?

来源

关于这篇论文的三个关键问题

GPT-3:把“教会模型”改成“在提示里示范” 解决了什么问题?

当时主流做法是“预训练 + 微调”:先在海量文本上学通用表示,再用某个任务的成千上万乃至数十万条标注样本更新参数。效果往往很好,但每来一个新任务,都要重新收集数据、训练和维护一个版本;窄任务数据还可能诱导模型抓住捷径,离开训练分布后失效。[§1,第 3 页;§2,第 6 页]

GPT-3:把“教会模型”改成“在提示里示范” 的核心结论有哪些证据?

最直观的结果来自封闭式问答:CoQA 从零样本 81.5 F1、单样本 84.0 F1 到少样本 85.0 F1;TriviaQA 从 64.3%、68.0% 到 71.2%,其中少样本结果在论文采用的“闭卷”设定下达到当时最佳。[§1,第 5 页;§3.2,第 14–15 页] 更广泛地,作者在两打以上 NLP 数据集和若干合成任务上评测,并在 42 个以准确率计分的基准汇总中观察到:零样本随规模稳定改善,而少样本改善更快。[§1,第 5 页;图 1.3,第 5 页]

阅读 GPT-3:把“教会模型”改成“在提示里示范” 时最需要注意什么局限?

但不能把这些数字概括成“GPT-3 普遍超过专门模型”。论文自己列出三类限制:

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro