返回报告库

AI / Technology

GPT-4o 系统卡一个模型同时处理文字、图像与声音

关于这篇论文的三个关键问题

GPT-4o 系统卡:一个模型同时处理文字、图像与声音 解决了什么问题?

旧式语音助手通常把一段对话拆成多步:识别语音、让语言模型生成文字,再把文字合成为声音。这样做容易丢掉语调、停顿、背景声等信息,也会累积等待时间。GPT-4o 把文字、视觉和声音放进同一个端到端模型,论文报告它最快 232 毫秒、平均 320 毫秒即可回应音频输入,接近人类对话的轮替速度。来源:摘要与第 1 节

GPT-4o 系统卡:一个模型同时处理文字、图像与声音 的核心结论有哪些证据?

说话人识别测试中,“该拒绝时拒绝”的安全准确率从 0.83 升至 0.98,“可以回答时回答”从 0.70 升至 0.83。对无法仅凭声音判断的属性请求拒答、对口音等可听线索谨慎回答,这一组合指标从 0.60 升至 0.84。声音输出分类器在内部测试中的召回率为 1.0;精确率英语为 0.96、非英语为 0.95。来源:表 2—4,第 3.3.1—3.3.4 节

阅读 GPT-4o 系统卡:一个模型同时处理文字、图像与声音 时最需要注意什么局限?

评测并不等于真实世界。论文承认,合成语音未覆盖足够多的语调、背景噪声、回声和多人串话;非英语审核还可能过度拒答。医疗部分虽然在 22 项文字评测中的 21 项超过 GPT-4T,例如 MedQA USMLE 四选一零样本准确率从 78.2% 升至 89.4%,但这些题只测临床知识,不测真实工作流,也没有证明文字优势会完整迁移到语音。来源:第 3.2、3.3.7、5.2 节

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro