AI / Technology
GPT-4 技术报告能力跃迁之后,边界仍在哪里?
图像与文本共同进入模型,最终生成文本
图 1|报告中的“多模态”指图像与文本输入、文本输出。它不是能生成所有媒体的通用系统。
- 输入变宽了。 GPT-4 能同时接收图像和文本,再输出文本;在多项专业考试、语言基准和编程任务上,它明显超过 GPT-3.5。
- 训练变得更可预判。 团队用计算量最多只有 GPT-4 千分之一的小模型,提前预测最终损失和部分 HumanEval 表现。
- 边界没有消失。 模型仍会编造事实、犯推理错误、接受错误前提,后训练还会削弱置信度与正确率的匹配;安全缓解只能降低风险,不能清零风险。[来源:摘要;§3;§5–6]
考试能力与现实可靠性并不等价
图 2|会做很多考试题,与能在信息不全、后果复杂的现实环境中稳定工作,是两件事。
专业考试和标准基准给出了可比较的分数,却只覆盖受控任务。报告在模拟统一律师资格考试中给 GPT-4 记为 298/400,约第 90 百分位;GPT-3.5 是 213/400,约第 10 百分位。这个差距说明能力跃迁真实存在,但不能直接推出模型在医疗、法律或生产系统里同样可靠。[来源:§4,表 1]
由小规模训练外推大模型表现
图 3|小模型不是被拼成大模型;它们提供趋势,用来预估一次昂贵的大训练。
超大模型很难边训边反复调参。团队因此把问题改成:能否先训练一组规模较小、方法一致的模型,再从它们的趋势预测最终大模型?这既是工程问题,也是安全问题,因为部署团队希望在训练结束前就对能力有基本预期。[来源:§3]
预训练与人类反馈形成两阶段训练
图 4|预训练建立广泛能力,人类反馈主要调整回答方式与行为边界。
预训练后,团队用基于人类反馈的强化学习(RLHF)微调行为。它主要改善指令遵循、事实性和安全表现,却不是“补上所有知识与推理漏洞”。报告指出,考试能力主要来自预训练;在测试的选择题中,基础模型和 RLHF 模型平均表现相近。[来源:§4;§6;附录 B]
专家红队、安全训练与部署监测构成循环
图 5|安全不是一次训练完成的状态,而是发现失误、修正、监测、再发现的循环。
在九组内部对抗性事实评测中,GPT-4 比当时最新 GPT-3.5 高 19 个百分点。它回应违规请求的倾向下降 82%,对敏感请求遵守政策的比例提高 29%;在 RealToxicityPrompts 上生成有毒内容的比例从 6.48% 降到 0.73%。这些是风险下降的证据,不是风险消失的证明,报告仍确认越狱可以诱导违规输出。[来源:§5–6,图 6、9]
能力扩大、风险共存,高风险路径加入人工复核
图 6|最稳妥的产品设计不是假设模型永不出错,而是给高风险路径加证据、权限和人工复核。
适合交给模型的是草拟、改写、分类、探索方案和有明确验收标准的代码辅助。医疗、法律、财务、安全与关键生产决策则需要外部资料、规则校验和人类签字。能力越强,流畅错误越容易被误信,所以审核强度应由出错后果决定,而不是由回答语气决定。这是基于报告限制做出的实践解释。[依据:§5–6]
研究附录
官方标题: GPT-4 Technical Report
作者: OpenAI 等|版本: arXiv v6(2024-03-04)|论文: arXiv:2303.08774
一句话定位: 这份报告展示了 GPT-4 的多模态能力、可预测扩展方法与安全缓解措施,同时明确提醒:更高的考试分数并不等于稳定、透明或无风险。
核心结论
三句话记住这篇报告
- 输入变宽了。 GPT-4 能同时接收图像和文本,再输出文本;在多项专业考试、语言基准和编程任务上,它明显超过 GPT-3.5。
- 训练变得更可预判。 团队用计算量最多只有 GPT-4 千分之一的小模型,提前预测最终损失和部分 HumanEval 表现。
- 边界没有消失。 模型仍会编造事实、犯推理错误、接受错误前提,后训练还会削弱置信度与正确率的匹配;安全缓解只能降低风险,不能清零风险。[来源:摘要;§3;§5–6]
问题
旧尺子能测出进步,却测不完真实世界
专业考试和标准基准给出了可比较的分数,却只覆盖受控任务。报告在模拟统一律师资格考试中给 GPT-4 记为 298/400,约第 90 百分位;GPT-3.5 是 213/400,约第 10 百分位。这个差距说明能力跃迁真实存在,但不能直接推出模型在医疗、法律或生产系统里同样可靠。[来源:§4,表 1]
大训练只跑一次,如何提前知道会得到什么?
超大模型很难边训边反复调参。团队因此把问题改成:能否先训练一组规模较小、方法一致的模型,再从它们的趋势预测最终大模型?这既是工程问题,也是安全问题,因为部署团队希望在训练结束前就对能力有基本预期。[来源:§3]
方法
预训练负责能力底座
GPT-4 是 Transformer 风格模型,先在公开数据和第三方授权数据上学习预测文档中的下一个 token。它接收任意交错的图像与文本,并生成文本。报告没有公开参数量、硬件、训练计算量、数据集构造和具体架构,因此读者能看到系统行为,却无法从报告复现核心训练。[来源:§2;§4.1]
人类反馈负责把回答往用户意图拉
预训练后,团队用基于人类反馈的强化学习(RLHF)微调行为。它主要改善指令遵循、事实性和安全表现,却不是“补上所有知识与推理漏洞”。报告指出,考试能力主要来自预训练;在测试的选择题中,基础模型和 RLHF 模型平均表现相近。[来源:§4;§6;附录 B]
缩放规律让最终结果在训练前可估
团队用同一方法训练小模型,再用幂律拟合趋势。内部代码数据上的最终损失预测,与 GPT-4 实际结果高度接近;HumanEval 的多数难度分桶也预测得较准。不过,单题表现可能随规模变差,某些“涌现”或反向缩放能力仍难预测。[来源:§3.1–3.2,图 1–3]
证据与局限
最强证据来自多类任务的一致提升
GPT-4 在 MMLU 得到 86.4%,GPT-3.5 为 70.0%;HumanEval 为 67.0% 对 48.1%;GSM-8K 为 92.0% 对 57.1%。在翻译后的 MMLU 中,它在 26 种语言中的 24 种超过当时英语基准的最好成绩。多组任务同时提升,比单个演示更能说明能力变强。[来源:§4,表 2;图 5]
| 证据 | GPT-4 | GPT-3.5 | 阅读时要记住 |
|---|---|---|---|
| MMLU | 86.4% | 70.0% | 57 个学科的五样本选择题 |
| HumanEval | 67.0% | 48.1% | 零样本 Python 函数生成 |
| GSM-8K | 92.0% | 57.1% | 使用思维链;部分训练题进入预训练混合数据 |
| 模拟统一律师资格考试 | 298/400 | 213/400 | 约第 90 百分位对第 10 百分位 |
安全指标改善,不代表模型已经安全
在九组内部对抗性事实评测中,GPT-4 比当时最新 GPT-3.5 高 19 个百分点。它回应违规请求的倾向下降 82%,对敏感请求遵守政策的比例提高 29%;在 RealToxicityPrompts 上生成有毒内容的比例从 6.48% 降到 0.73%。这些是风险下降的证据,不是风险消失的证明,报告仍确认越狱可以诱导违规输出。[来源:§5–6,图 6、9]
这份报告明确没有证明什么
它没有公开足够细节供外部复现,也没有证明标准考试能代表真实工作质量。训练数据的多数截止于 2021 年 9 月,模型不会从使用经验中持续学习。它仍会产生幻觉、犯简单推理错误、写出带漏洞的代码,并可能自信地答错;后训练还显著损害了 MMLU 子集上的校准。视觉能力也只给出有限的初步结果。[来源:§2;§4.1;§5]
实际意义
低风险任务可以放权,高风险结果必须复核
适合交给模型的是草拟、改写、分类、探索方案和有明确验收标准的代码辅助。医疗、法律、财务、安全与关键生产决策则需要外部资料、规则校验和人类签字。能力越强,流畅错误越容易被误信,所以审核强度应由出错后果决定,而不是由回答语气决定。这是基于报告限制做出的实践解释。[依据:§5–6]
评估产品时,别只看平均分
至少同时测四件事:正常任务成功率、关键失败类型、面对错误前提时是否会纠正、失败后能否被监测和恢复。上线前还应针对真实用户输入做红队测试,并把新失败样本送回评估集。报告的安全循环支持这种持续治理思路,但没有给出适用于所有产品的统一阈值。[依据:§6]
研究附录:来源、前作与待验证问题
- 主要来源: arXiv 摘要与版本信息;论文 HTML 全文。
- 直接采用的技术脉络: Transformer 架构(Vaswani et al., 2017)、神经语言模型缩放定律(Kaplan et al., 2020;Henighan et al., 2020)、人类反馈强化学习(Christiano et al., 2017)和 InstructGPT(Ouyang et al., 2022)。[来源:§2–3;参考文献 39–42、63]
- 复核问题 1: 未公开模型规模、训练计算和数据构造时,外部研究者能复现哪些核心结论?
- 复核问题 2: 翻译版 MMLU 的机器翻译质量,会怎样影响跨语言比较?
- 复核问题 3: 后训练提高事实性却降低校准,产品应如何同时优化“答得更好”和“知道自己可能错”?
- 不确定性: 报告中的多项安全数字来自内部评测,外部读者无法仅凭本文独立复核完整数据与标注流程。
关于这篇论文的三个关键问题
GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 解决了什么问题?
图 3|小模型不是被拼成大模型;它们提供趋势,用来预估一次昂贵的大训练。
GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 的核心结论有哪些证据?
GPT-4 在 MMLU 得到 86.4%,GPT-3.5 为 70.0%;HumanEval 为 67.0% 对 48.1%;GSM-8K 为 92.0% 对 57.1%。在翻译后的 MMLU 中,它在 26 种语言中的 24 种超过当时英语基准的最好成绩。多组任务同时提升,比单个演示更能说明能力变强。[来源:§4,表 2;图 5]
阅读 GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 时最需要注意什么局限?
在九组内部对抗性事实评测中,GPT-4 比当时最新 GPT-3.5 高 19 个百分点。它回应违规请求的倾向下降 82%,对敏感请求遵守政策的比例提高 29%;在 RealToxicityPrompts 上生成有毒内容的比例从 6.48% 降到 0.73%。这些是风险下降的证据,不是风险消失的证明,报告仍确认越狱可以诱导违规输出。[来源:§5–6,图 6、9]