返回报告库

AI / Technology

GPT-4 技术报告能力跃迁之后,边界仍在哪里?

关于这篇论文的三个关键问题

GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 解决了什么问题?

图 3|小模型不是被拼成大模型;它们提供趋势,用来预估一次昂贵的大训练。

GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 的核心结论有哪些证据?

GPT-4 在 MMLU 得到 86.4%,GPT-3.5 为 70.0%;HumanEval 为 67.0% 对 48.1%;GSM-8K 为 92.0% 对 57.1%。在翻译后的 MMLU 中,它在 26 种语言中的 24 种超过当时英语基准的最好成绩。多组任务同时提升,比单个演示更能说明能力变强。[来源:§4,表 2;图 5]

阅读 GPT-4 技术报告:能力跃迁之后,边界仍在哪里? 时最需要注意什么局限?

在九组内部对抗性事实评测中,GPT-4 比当时最新 GPT-3.5 高 19 个百分点。它回应违规请求的倾向下降 82%,对敏感请求遵守政策的比例提高 29%;在 RealToxicityPrompts 上生成有毒内容的比例从 6.48% 降到 0.73%。这些是风险下降的证据,不是风险消失的证明,报告仍确认越狱可以诱导违规输出。[来源:§5–6,图 6、9]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro