返回报告库

AI / Technology

GPT-3把“教会模型”改成“在提示里示范”

关于这篇论文的三个关键问题

GPT-3:把“教会模型”改成“在提示里示范” 解决了什么问题?

当时主流做法是“预训练 + 微调”:先在海量文本上学通用表示,再用某个任务的成千上万乃至数十万条标注样本更新参数。效果往往很好,但每来一个新任务,都要重新收集数据、训练和维护一个版本;窄任务数据还可能诱导模型抓住捷径,离开训练分布后失效。[§1,第 3 页;§2,第 6 页]

GPT-3:把“教会模型”改成“在提示里示范” 的核心结论有哪些证据?

最直观的结果来自封闭式问答:CoQA 从零样本 81.5 F1、单样本 84.0 F1 到少样本 85.0 F1;TriviaQA 从 64.3%、68.0% 到 71.2%,其中少样本结果在论文采用的“闭卷”设定下达到当时最佳。[§1,第 5 页;§3.2,第 14–15 页] 更广泛地,作者在两打以上 NLP 数据集和若干合成任务上评测,并在 42 个以准确率计分的基准汇总中观察到:零样本随规模稳定改善,而少样本改善更快。[§1,第 5 页;图 1.3,第 5 页]

阅读 GPT-3:把“教会模型”改成“在提示里示范” 时最需要注意什么局限?

但不能把这些数字概括成“GPT-3 普遍超过专门模型”。论文自己列出三类限制:

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro