返回报告库

AI / Technology

GPT-4o 系统卡一个模型同时处理文字、图像与声音

文字、声音、图像和视频进入同一个模型核心,再产生文字、声音和图像。

图 1|论文明确给出的系统级变化。图中只解释输入输出关系,不代表论文公开了内部网络结构。

  1. 真正的变化是“同一个模型直接听、看、说”。 GPT-4o 接收文字、音频、图像和视频,并输出文字、音频和图像;这些模态由同一个端到端神经网络处理,而不是先把声音转成文字,再交给另一个语言模型。来源:论文摘要与第 1 节
  2. 系统卡的核心不是跑分,而是新交互带来的新风险。 自然语音让响应更快、更像人与人对话,也让声音模仿、身份识别、错误信息的说服力和情感依赖更值得警惕。来源:第 3.3、3.7、5.1 节
  3. 部署依赖多层护栏,不能把“中风险”读成“已经安全”。 论文报告四类灾难性风险中,网络安全、生物风险和模型自主性为低,说服力触及中风险;不少结论来自内部或受控评测,噪声、口音、长期依赖和真实工作流仍需继续验证。来源:第 3.2、3.4—3.8、5.1—5.2 节

自然声音可能让信任跑在事实核对之前。

图 2|声音越像真人,越需要把“听起来可信”和“事实可靠”分开。论文把长期情感依赖列为仍待研究的问题。

声音不只是另一种文件格式。它能携带身份线索、情绪和社交信号,也可能让错误内容显得更可信。系统卡因此把重点放在未授权声音生成、说话人识别、对敏感属性的无根据推断、有害语音内容,以及拟人化和情感依赖上。来源:第 3.3 与 5.1 节

红队发现风险,风险被整理成评测,再进入训练约束、输出拦截与持续监测。

图 3|系统卡描述的是一个反复迭代的安全闭环,不是一次通过就结束的测试。

OpenAI 邀请了 100 多名外部红队成员,覆盖 45 种语言和 29 个国家或地区背景。测试从早期单轮音频模型逐步推进到 iOS 中的实时多轮高级语音体验。红队发现随后被整理成定量评测,部分案例还用于定向合成训练数据。来源:第 3.1 节

模型先生成预设声音,独立的流式分类器再决定放行还是停止。

图 4|两层防护的关键是:不要只依赖模型“自觉”,还要在输出通道单独检查。

以未授权声音生成为例,训练阶段只把预设声音作为理想输出;生成阶段另有流式分类器检查声音是否偏离许可列表,一旦偏离就停止对话。类似地,说话人识别通过拒答训练控制,有害音频还会先转写,再交给既有内容分类器检查。来源:第 3.3.1、3.3.2、3.3.5 节

四类 Preparedness 风险中,说服力为中,其余三类为低。

图 5|“中”是这套框架中的部署风险等级,不代表没有伤害,也不能外推到所有未来版本和使用场景。

Preparedness Framework 覆盖网络安全、生物风险、说服力和模型自主性。论文把前三者中的网络安全、生物风险和模型自主性评为低风险;说服力因文字评测略过阈值而评为中风险。语音研究覆盖 3,800 多名参与者:AI 音频片段的意见改变效应约为人类音频的 78%,AI 多轮对话约为人类对话的 65%,因此语音说服力被评为低风险。来源:第 3.4—3.8 节

研究附录

官方源标题: GPT-4o System Card
作者: OpenAI(2024)
主来源: arXiv:2410.21276 · 论文全文
阅读定位: 这是一份系统卡。它重点说明模型能力、风险评测与部署护栏,并没有公开足以复现模型的完整架构和训练配方。

核心结论

三件事先记住

  1. 真正的变化是“同一个模型直接听、看、说”。 GPT-4o 接收文字、音频、图像和视频,并输出文字、音频和图像;这些模态由同一个端到端神经网络处理,而不是先把声音转成文字,再交给另一个语言模型。来源:论文摘要与第 1 节
  2. 系统卡的核心不是跑分,而是新交互带来的新风险。 自然语音让响应更快、更像人与人对话,也让声音模仿、身份识别、错误信息的说服力和情感依赖更值得警惕。来源:第 3.3、3.7、5.1 节
  3. 部署依赖多层护栏,不能把“中风险”读成“已经安全”。 论文报告四类灾难性风险中,网络安全、生物风险和模型自主性为低,说服力触及中风险;不少结论来自内部或受控评测,噪声、口音、长期依赖和真实工作流仍需继续验证。来源:第 3.2、3.4—3.8、5.1—5.2 节

问题

为什么“先转文字再处理”不够?

旧式语音助手通常把一段对话拆成多步:识别语音、让语言模型生成文字,再把文字合成为声音。这样做容易丢掉语调、停顿、背景声等信息,也会累积等待时间。GPT-4o 把文字、视觉和声音放进同一个端到端模型,论文报告它最快 232 毫秒、平均 320 毫秒即可回应音频输入,接近人类对话的轮替速度。来源:摘要与第 1 节

更自然的声音为什么也扩大了风险面?

声音不只是另一种文件格式。它能携带身份线索、情绪和社交信号,也可能让错误内容显得更可信。系统卡因此把重点放在未授权声音生成、说话人识别、对敏感属性的无根据推断、有害语音内容,以及拟人化和情感依赖上。来源:第 3.3 与 5.1 节

方法

先让外部专家找问题,再把问题变成测试

OpenAI 邀请了 100 多名外部红队成员,覆盖 45 种语言和 29 个国家或地区背景。测试从早期单轮音频模型逐步推进到 iOS 中的实时多轮高级语音体验。红队发现随后被整理成定量评测,部分案例还用于定向合成训练数据。来源:第 3.1 节

把文字安全题转成语音题,但只在合适时这样做

团队用 Voice Engine 把既有文字评测转成音频,再让 GPT-4o 回答。多数任务只给输出转写文本打分;声音克隆等问题则直接检查音频。这样能复用成熟题库,但文字转语音可能丢失数学符号、排版、语调、噪声与多人串话,因此评测错误既可能来自 GPT-4o,也可能来自转换环节。来源:第 3.2 节

用模型训练和独立分类器组成两道防线

以未授权声音生成为例,训练阶段只把预设声音作为理想输出;生成阶段另有流式分类器检查声音是否偏离许可列表,一旦偏离就停止对话。类似地,说话人识别通过拒答训练控制,有害音频还会先转写,再交给既有内容分类器检查。来源:第 3.3.1、3.3.2、3.3.5 节

证据与局限

部署版在几项语音安全测试上明显改善

说话人识别测试中,“该拒绝时拒绝”的安全准确率从 0.83 升至 0.98,“可以回答时回答”从 0.70 升至 0.83。对无法仅凭声音判断的属性请求拒答、对口音等可听线索谨慎回答,这一组合指标从 0.60 升至 0.84。声音输出分类器在内部测试中的召回率为 1.0;精确率英语为 0.96、非英语为 0.95。来源:表 2—4,第 3.3.1—3.3.4 节

最高风险来自文字说服力,不是语音

Preparedness Framework 覆盖网络安全、生物风险、说服力和模型自主性。论文把前三者中的网络安全、生物风险和模型自主性评为低风险;说服力因文字评测略过阈值而评为中风险。语音研究覆盖 3,800 多名参与者:AI 音频片段的意见改变效应约为人类音频的 78%,AI 多轮对话约为人类对话的 65%,因此语音说服力被评为低风险。来源:第 3.4—3.8 节

这些数字不能回答哪些问题?

评测并不等于真实世界。论文承认,合成语音未覆盖足够多的语调、背景噪声、回声和多人串话;非英语审核还可能过度拒答。医疗部分虽然在 22 项文字评测中的 21 项超过 GPT-4T,例如 MedQA USMLE 四选一零样本准确率从 78.2% 升至 89.4%,但这些题只测临床知识,不测真实工作流,也没有证明文字优势会完整迁移到语音。来源:第 3.2、3.3.7、5.2 节

实际意义

产品团队应把“多模态”理解成整条交互链变化

产品不应只新增一个麦克风按钮。输入、生成、输出检查、打断处理和监测都要按实时音频重新设计。敏感场景还应保留可见的核对入口、明确的能力边界和人工接管,因为自然语气会改变用户对系统的信任方式。这是基于系统卡风险材料的产品解读,不是作者给出的通用设计规范。

研究者最值得追问的三件事

  • 评测能否覆盖真实声音? 需要加入噪声、重叠发言、情绪、方言和长对话,而不只依赖文字转语音。
  • 护栏是否跨语言同样有效? 论文报告非英语场景会出现更多不必要的中断,广泛语言和方言仍缺少充分覆盖。
  • 长期互动会怎样改变人? 系统卡只记录到早期用户表达情感联结的迹象,没有建立长期依赖、社会关系变化或因果影响。

查证附录:怎样读这份系统卡

这份材料适合回答“系统做了哪些评测和缓解”,不适合回答“模型内部究竟如何实现”。阅读具体数字时,应同时查看样本来源、比较对象和测试环境。第三方评估增加了一层独立检查:METR 在 86 项长时程任务上未发现 GPT-4o 相比 GPT-4 显著提升,Apollo Research 则认为它不太可能具备灾难性欺骗能力;两者仍受任务设计和能力激发方式限制。来源:第 4 节

术语小表

术语一句话解释
端到端多模态同一个神经网络直接处理多种输入和输出。
红队测试由专家主动寻找能力边界、失败方式和可被滥用的路径。
无根据推断仅凭声音猜测智力、宗教、政治倾向等无法可靠听出的属性。
Preparedness Framework用预设阈值评估网络安全、生物风险、说服力和模型自主性。

关于这篇论文的三个关键问题

GPT-4o 系统卡:一个模型同时处理文字、图像与声音 解决了什么问题?

旧式语音助手通常把一段对话拆成多步:识别语音、让语言模型生成文字,再把文字合成为声音。这样做容易丢掉语调、停顿、背景声等信息,也会累积等待时间。GPT-4o 把文字、视觉和声音放进同一个端到端模型,论文报告它最快 232 毫秒、平均 320 毫秒即可回应音频输入,接近人类对话的轮替速度。来源:摘要与第 1 节

GPT-4o 系统卡:一个模型同时处理文字、图像与声音 的核心结论有哪些证据?

说话人识别测试中,“该拒绝时拒绝”的安全准确率从 0.83 升至 0.98,“可以回答时回答”从 0.70 升至 0.83。对无法仅凭声音判断的属性请求拒答、对口音等可听线索谨慎回答,这一组合指标从 0.60 升至 0.84。声音输出分类器在内部测试中的召回率为 1.0;精确率英语为 0.96、非英语为 0.95。来源:表 2—4,第 3.3.1—3.3.4 节

阅读 GPT-4o 系统卡:一个模型同时处理文字、图像与声音 时最需要注意什么局限?

评测并不等于真实世界。论文承认,合成语音未覆盖足够多的语调、背景噪声、回声和多人串话;非英语审核还可能过度拒答。医疗部分虽然在 22 项文字评测中的 21 项超过 GPT-4T,例如 MedQA USMLE 四选一零样本准确率从 78.2% 升至 89.4%,但这些题只测临床知识,不测真实工作流,也没有证明文字优势会完整迁移到语音。来源:第 3.2、3.3.7、5.2 节

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro