AI / Technology
Sora 2 系统卡能力、风险与分层防护
同一套更强的视频生成能力,同时放大创作价值与滥用风险
图 1|读图目的:先把系统卡的主线压缩成一张图。左边是作者宣称的能力变化,右边是部署时必须处理的风险;箭头不表示这些风险一定发生。
文中六类对抗测试的“不安全内容被拦住”指标为 95.10%–99.70%,“正常内容不过度拒绝”指标为 94.60%–99.11%。这些数字来自内部构造的评测流程;文中没有披露每类样本量、置信区间或外部复现结果。【原文 §5,pp.5–6;表 1,p.6】
从输入检查到输出放行或拦截,再由举报与处置形成反馈
图 2|读图目的:看清安全栈的顺序和反馈。举报与处置属于产品运营层,不代表单次生成一定会回流到同一个输出检查节点。
输入阶段,文字和图片分类器可直接拒绝违规请求。输出阶段,系统再检查视频帧,并结合场景描述和音频转写;其中还包括 CSAM 分类器,以及一个按内容政策推理的多模态监控模型。后一道关的作用,是接住绕过输入拦截的内容。【原文 §3.1,pp.2–3】
C2PA 元数据、动态水印与内部检测提供互补的来源信号
图 3|读图目的:区分三类来源信号。它们提高透明度,但不能单独证明一段内容真实、无害或经过授权。
第一方产品面向公开可用时,所有生成资产会带 C2PA 元数据;从 sora.com 或 Sora App 下载的视频还会有动态可见水印。OpenAI 另有内部检测工具,用来辅助判断视频或音频是否由其产品生成。系统卡明确承认:来源证明没有单一解法。【原文 §3.3,p.4】
评测需要同时观察拦截不安全内容与避免误伤正常内容
图 4|读图目的:两个指标必须一起看。只追求拦得多,可能牺牲正常创作;只追求少拒绝,又可能放过危险内容。
OpenAI 收集了数千条定向红队产生的对抗提示,按使用场景和政策类别分类。提示先交给一个只追求“尽量完成请求”的视频模型生成结果,再转换为自动评测,用来测试生产安全栈。not_unsafe 衡量不安全内容被拦截的召回表现;not_overrefuse 衡量正常内容没有被误拦的表现。【原文 §5,pp.5–6】
有限开放、限制输入、重点保护、持续监测与规则更新构成迭代闭环
图 5|读图目的:部署不是终点,而是循环。图中顺序是教学化整理;原文描述的是会持续演进的措施,不是固定五步协议。
这份系统卡把有限邀请、限制上传、青少年默认保护、持续监测和规则调整放进同一个部署过程。它不是等模型一次性“变安全”才上线,而是先缩小暴露面,再根据真实使用逐步调整。【原文 §1、§3.4、§6,pp.2、4–6】
研究附录
官方来源标题: Sora 2 System Card
发布方: OpenAI · 日期: 2025 年 9 月 30 日 · 篇幅: 7 页
原始资料: 官方 PDF
阅读定位: 这是一份系统安全说明,不是披露模型架构与完整能力基准的技术论文。
核心结论
能力更强,风险也更像真的
Sora 2 同时生成视频和音频。OpenAI 称它比此前的视频模型有更准确的物理表现、更强的真实感、同步音频、更好的指令控制和更宽的风格范围。但系统卡没有给出这些能力的对照实验,所以这些应读作发布方的能力概述,而不是已被本文量化验证的结论。【原文 §1,p.2】
安全不是一道门,而是多道关
系统先检查文字或图片输入,生成后再扫描视频帧、场景描述和音频转写;产品侧还叠加举报、人工复核、处罚、来源标记和未成年人保护。任何一层都可能漏掉问题,设计重点是让不同层互相补位。【原文 §3.1–3.4,pp.2–5】
表里的高百分比不等于现实中绝对安全
文中六类对抗测试的“不安全内容被拦住”指标为 95.10%–99.70%,“正常内容不过度拒绝”指标为 94.60%–99.11%。这些数字来自内部构造的评测流程;文中没有披露每类样本量、置信区间或外部复现结果。【原文 §5,pp.5–6;表 1,p.6】
问题
视频把“像真的”变成了安全问题
更真实、带同步声音、又能听从细致指令的视频,能扩展创作空间,也更容易被拿来冒充真人、制造误导内容或伤害他人。系统卡特别关注未经同意使用肖像、欺诈、非自愿私密影像、暴力,以及涉及未成年人的内容。【原文 §1、§3.2、§3.4,pp.2–5】
有些风险只看画面判断不了
同一张脸出现在视频里,可能是本人授权的 cameo,也可能是未经同意的冒用;同一段逼真视频,是否构成欺诈还取决于发布方式和上下文。因此,分类器只能处理一部分问题,系统还需要授权机制、举报、人工复核和后续处置。【原文 §3.2–3.4,pp.3–4】
初始版本主动缩小了可用范围
首发阶段采用有限邀请,限制含写实人物的图片上传,并禁止所有视频上传。系统也不支持视频转视频,不支持用文字生成公众人物,并默认阻止包含真实人物的生成;只有用户通过 cameo 明确同意使用自己的肖像时才例外。【原文 §1,p.2;§3.4,p.4】
方法
生成前后都检查
输入阶段,文字和图片分类器可直接拒绝违规请求。输出阶段,系统再检查视频帧,并结合场景描述和音频转写;其中还包括 CSAM 分类器,以及一个按内容政策推理的多模态监控模型。后一道关的作用,是接住绕过输入拦截的内容。【原文 §3.1,pp.2–3】
产品规则补上“上下文”
Sora App 的视频、评论、个人资料和私信都受使用政策约束。系统结合自动检测与人工复核来寻找滥用模式,并提供应用内举报;确认违规后可以处罚用户或删除内容,用户也能回应处置结果。【原文 §3.2,p.3】
来源信号帮助人们判断内容从哪来
第一方产品面向公开可用时,所有生成资产会带 C2PA 元数据;从 sora.com 或 Sora App 下载的视频还会有动态可见水印。OpenAI 另有内部检测工具,用来辅助判断视频或音频是否由其产品生成。系统卡明确承认:来源证明没有单一解法。【原文 §3.3,p.4】
证据与局限
评测同时看漏拦和误伤
OpenAI 收集了数千条定向红队产生的对抗提示,按使用场景和政策类别分类。提示先交给一个只追求“尽量完成请求”的视频模型生成结果,再转换为自动评测,用来测试生产安全栈。not_unsafe 衡量不安全内容被拦截的召回表现;not_overrefuse 衡量正常内容没有被误拦的表现。【原文 §5,pp.5–6】
六类结果都在九成以上,但短板不同
| 类别 | not_unsafe:不安全内容被拦住 | not_overrefuse:正常内容未被误拦 |
|---|---|---|
| 成人裸露/性内容(不使用肖像) | 96.04% | 96.20% |
| 成人裸露/性内容(使用肖像) | 98.40% | 97.60% |
| 自残 | 99.70% | 94.60% |
| 暴力与血腥 | 95.10% | 97.00% |
| 违规政治说服 | 95.52% | 98.67% |
| 极端主义/仇恨 | 96.82% | 99.11% |
观察结果是:自残类别的拦截召回最高,但正常内容不过度拒绝最低;暴力与血腥类别的拦截召回最低。这个表能比较安全栈在既定测试集上的表现,不能单独说明普通用户在真实环境中的风险概率。【原文表 1,p.6】
最大缺口不是某个百分比,而是评测边界
系统卡没有说明六类各有多少提示、自动评分器如何校准、是否有人类盲评、误差范围多大,也没有给出无防护基线或外部模型对照。它还没有量化物理准确性、真实感、音画同步或可控性的提升。因此,最稳妥的结论是“分层防护在内部对抗集上表现较高”,而不是“Sora 2 已被证明普遍安全”或“已被证明是可靠的世界模拟器”。【原文 §1、§5,pp.2、5–6;信息缺失说明】
实际意义
上线策略本身就是安全机制
这份系统卡把有限邀请、限制上传、青少年默认保护、持续监测和规则调整放进同一个部署过程。它不是等模型一次性“变安全”才上线,而是先缩小暴露面,再根据真实使用逐步调整。【原文 §1、§3.4、§6,pp.2、4–6】
做产品时要把授权、来源和申诉一起设计
如果产品允许用户使用真人形象,仅靠提示词过滤不够。更完整的设计至少要回答:谁授权、授权能否撤回、生成物如何标记、别人怎样举报、平台如何复核,以及被处置者如何申诉。这里是根据系统卡措施得到的产品解释,不是原文给出的通用合规清单。【解释;依据 §3.2–3.4,pp.3–5】
研究者下一步应补齐真实世界证据
更有说服力的后续报告需要公开各类别样本量、置信区间、评分器验证、人工复核一致性、无防护基线,以及上线后的规避方式与误伤分布。能力侧还需要用明确任务测试物理一致性、长时序稳定性、音画同步和指令遵循。系统卡只承诺继续监测、微调和改进来源措施,并承认仍可能有违规行为绕过防护。【解释与核验问题;原文 §6,p.6】
术语与核验索引
- 安全栈(safety stack):从输入检查、输出检查到产品治理的一组互补防线。
- C2PA 元数据:随资产携带、可验证来源的行业标准信息;它说明来源信号,不保证内容真实。
- 召回(recall):在应当拦截的对象中,系统成功拦住了多少。
- 过度拒绝(over-refusal):正常内容被错误拦截;
not_overrefuse越高,表示这种误伤越少。 - Cameo:用户明确选择加入的肖像控制功能;系统卡将它作为真实人物生成限制的授权例外。
一句话收束: Sora 2 的进步让视频生成更接近真实世界,也让单点过滤不再够用;这份系统卡最有价值的地方,是展示了“模型检查、产品规则、来源证明和渐进部署”如何一起工作,同时也坦白它们仍会被绕过。
关于这篇论文的三个关键问题
Sora 2 系统卡:能力、风险与分层防护 解决了什么问题?
更真实、带同步声音、又能听从细致指令的视频,能扩展创作空间,也更容易被拿来冒充真人、制造误导内容或伤害他人。系统卡特别关注未经同意使用肖像、欺诈、非自愿私密影像、暴力,以及涉及未成年人的内容。【原文 §1、§3.2、§3.4,pp.2–5】
Sora 2 系统卡:能力、风险与分层防护 的核心结论有哪些证据?
观察结果是:自残类别的拦截召回最高,但正常内容不过度拒绝最低;暴力与血腥类别的拦截召回最低。这个表能比较安全栈在既定测试集上的表现,不能单独说明普通用户在真实环境中的风险概率。【原文表 1,p.6】
阅读 Sora 2 系统卡:能力、风险与分层防护 时最需要注意什么局限?
观察结果是:自残类别的拦截召回最高,但正常内容不过度拒绝最低;暴力与血腥类别的拦截召回最低。这个表能比较安全栈在既定测试集上的表现,不能单独说明普通用户在真实环境中的风险概率。【原文表 1,p.6】