返回报告库

AI / Technology

一次点击,为什么能“抠出”几乎任何东西?

任务、模型与数据引擎形成闭环

图 1|原创教学图。任务规定接口,SAM 执行分割,数据引擎持续扩充训练掩码;这三个部分共同构成论文的贡献。依据:论文图 1 与 §1、§4;本图未复刻论文原图。

一句话说,这篇论文解决的是:能否把图像分割做成一个可提示、可组合、无需为每个新场景重新训练的通用能力? 它给出的改变是:同时设计一种任务、一个模型和一套数据生产机制,而不是只换一个网络结构。

一个点可能对应局部、物体或整体

图 2|原创教学图。单点提示本身可能缺少层级信息;SAM 为同一提示预测多个候选掩码并给出置信度。依据:§2、§3 与论文图 3 的文字结论;人物与构图均为新创作。

论文先把目标重新定义为“提示分割任务”:给出任何指向目标的提示,模型返回至少一个合理掩码。这里的“合理”很重要——一个点落在衣服上,既可能指拉链、衣服,也可能指穿衣服的人。若训练只允许一个答案,模型容易把多个可能区域平均成一个谁都不像的结果。(来源:§2、§3 “Resolving ambiguity”)

三阶段数据引擎

图 3|原创教学图。人工参与逐步减少,模型与数据通过回流训练互相增强。依据:§4;图中没有表达具体数量,数量证据见下一节。

真正把规模做起来的是三阶段数据引擎:先由模型辅助专业标注员;再让模型预填明显对象、标注员补遗漏;最后在图上铺规则点阵,自动生成候选掩码,再按置信度、稳定性和去重规则筛选。新掩码用于多次重训模型,模型变好后又能更快地产生数据。(来源:§4)

研究附录

论文:Alexander Kirillov 等,Segment Anything(2023)
原文arXiv 摘要页 · PDF

一、先记住这三点

  1. SAM 把分割从“为每种任务训练一个模型”,改成“给一个提示,就返回一个合理掩码”。 提示可以是点、框或已有掩码;同一模型因此能被接到许多新流程里。(来源:§2)
  2. 它的关键不只是大模型,而是可重复利用的结构与数据飞轮。 图像只编码一次,之后轻量解码器响应不同提示;模型又反过来帮助生产更多训练掩码。(来源:§3–§4)
  3. 论文最有力的证据是跨 23 个数据集的单点测试与 11 亿掩码的数据规模;最大风险则是“通用”不等于“处处最好”。 细结构、清晰边界、文本提示、重型图像编码器和专业领域仍有明显限制。(来源:§5、§7.1、§8)

一句话说,这篇论文解决的是:能否把图像分割做成一个可提示、可组合、无需为每个新场景重新训练的通用能力? 它给出的改变是:同时设计一种任务、一个模型和一套数据生产机制,而不是只换一个网络结构。

二、问题:分割为什么很难变成“通用接口”?

图像分割要为每个像素判断它属于哪个区域。过去的系统通常围绕固定任务和固定标签训练:交互式分割、实例分割、语义分割各有自己的输入与输出。换一个数据分布或任务,往往要重新标注和训练。与此同时,互联网天然有大量文字和图片,却没有同等规模的像素级掩码;通用模型需要的数据,恰恰是最昂贵的部分。(来源:§1、§2、§4)

论文先把目标重新定义为“提示分割任务”:给出任何指向目标的提示,模型返回至少一个合理掩码。这里的“合理”很重要——一个点落在衣服上,既可能指拉链、衣服,也可能指穿衣服的人。若训练只允许一个答案,模型容易把多个可能区域平均成一个谁都不像的结果。(来源:§2、§3 “Resolving ambiguity”)

三、方法:先看图一次,再快速回答许多提示

SAM 的工作流可以拆成三个模块。第一,较重的图像编码器把整张图变成可复用的特征;第二,提示编码器把前景/背景点、框或掩码变成提示特征;第三,轻量掩码解码器融合两者,输出掩码和质量估计。因为最贵的图像编码只运行一次,同一张图可以连续接受不同提示。论文报告:在预先算好图像特征后,提示编码器和掩码解码器可在浏览器 CPU 上约 50 ms 产生结果;这不等于整套系统从原图开始都能 50 ms 完成。(来源:§3 “Efficiency”;附录 A)

为处理歧义,SAM 默认对一个提示输出 3 个候选掩码,大致覆盖“整体—部分—子部分”,并预测每个候选的 IoU 置信度。训练时只对与标注最匹配的候选反向传播。这个设计让“模糊提示”不必被强行压成唯一答案。(来源:§3 “Resolving ambiguity”)

真正把规模做起来的是三阶段数据引擎:先由模型辅助专业标注员;再让模型预填明显对象、标注员补遗漏;最后在图上铺规则点阵,自动生成候选掩码,再按置信度、稳定性和去重规则筛选。新掩码用于多次重训模型,模型变好后又能更快地产生数据。(来源:§4)

四、证据与边界:规模很大,结论要分层看

论文最终得到 SA-1B:1100 万张 获许可并做隐私处理的图像、11 亿个 掩码,平均每图约 100 个;其中 99.1% 的掩码由全自动阶段生成。作者随机抽取 500 张图、约 5 万个掩码让专业标注员修正后比较:自动掩码与修正版中,94% 的 IoU 超过 90%,97% 超过 75%。这是数据质量的直接抽样证据,但不是对所有图像、所有细粒度类别的逐一人工认证。(来源:§5 “Masks” 与 “Mask quality”;论文图 2)

最能说明泛化能力的实验,是对 23 个 不同分布的分割数据集只给一个前景点。按自动 mIoU,SAM 在 16/23 个数据集上超过强交互分割基线 RITM,单个数据集差值范围也包含明显负值;若事后从 SAM 的 3 个候选中挑与真值最接近者,则 23 个数据集全部超过 RITM。人工评分中,SAM 的平均质量约在 7–9/10,高于 RITM。这里的“oracle”选择需要真值,不能当成真实部署性能;它主要证明多候选中经常已有好答案,而置信度排序仍有改进空间。(来源:§7.1、论文图 9)

边界同样清楚:SAM 会漏掉细结构,偶尔产生小型断裂伪影,边界不如会放大局部的高计算量方法锐利;提示点很多时,专用交互分割方法预计更强。重型图像编码器使整体处理并非实时;文本到掩码只是探索性结果;怎样用简单提示完成语义分割或全景分割仍不明确;专业领域工具也可能胜出。(来源:§8 “Limitations”)

公平性结论也不宜扩大。作者在感知性别、年龄和肤色分组上没有发现大多数显著差异,但肤色实验使用专有数据集,置信区间较宽;衣物分割还观察到与感知性别有关的偏差迹象。数据覆盖上,非洲、拉丁美洲与加勒比地区、低收入国家在所有对比数据集中仍不足。(来源:§6、表 1–2;附录 C)

五、实际意义:把它当作“分割组件”,不是万能视觉系统

对产品团队,SAM 最有价值的定位是一个可组合的区域生成接口:上游检测器给框、用户给点、注视追踪给坐标,SAM 返回候选区域。它适合加速标注、抠图、交互编辑和为其他视觉模块提供对象区域。论文所说的 zero-shot,是测试数据集和任务未用于这套下游适配;它不意味着模型从未见过相似视觉概念,也不意味着无需任何上游组件。(来源:§2 “Zero-shot transfer”、§7)

落地前应回答四个问题:你的目标是否需要明确语义,而不只是区域?小物体与细边界的错误成本多高?图像编码的延迟和算力能否接受?多候选掩码由用户、规则还是另一个模型选择?如果这些问题没有答案,“能分任何东西”很容易被误读成“能理解任何东西”。后一句是基于论文能力边界的产品解释,不是作者的实验结论。


研究附录:证据账本与核验问题

主张论文证据位置判断
提示可用点、框、掩码;论文也初步探索文本§2、§3作者定义与实现
预计算图像特征后,提示到掩码约 50 ms§1、§3;附录 A有条件的运行时结果,不代表端到端实时
SA-1B 有 1100 万图像、11 亿掩码摘要、§5、图 2数据集规模陈述
94% 自动掩码与人工修正版 IoU > 90%§5 “Mask quality”500 图/5 万掩码抽样
单点 mIoU 在 16/23 数据集超过 RITM§7.1、图 9最强的跨数据集自动指标证据之一
oracle 在 23/23 数据集超过 RITM§7.1、图 9使用真值挑候选,不可直接部署
SAM 是“基础模型”§8 结论作者明确说是否获得这一地位仍待社区使用检验

仍需核验的问题

  • 在具体业务数据上,置信度排序能否稳定选中三个候选中的正确掩码?
  • 自动掩码质量抽样是否覆盖长尾、小目标、透明物体和专业影像?
  • 端到端延迟、显存与吞吐量在目标硬件上是多少?
  • 作为更大系统的一部分时,上游检测、提示生成和下游决策会引入哪些群体差异?

术语小表

  • 掩码(mask):逐像素标出目标区域的二值或概率图。
  • IoU:预测区域与真值区域的交集面积除以并集面积;越高通常越接近标注。
  • zero-shot transfer:不针对目标数据集重新训练 SAM,而用提示或外部组件把能力迁移到新任务。
  • oracle:借助真值挑选最佳候选的分析上限,不是可直接部署的方法。

来源说明:全文以论文 v1(2023-04-05)为主要依据。所有数值均按论文原文保留;“产品解释”已与作者主张分开标注。三张配图均由内置 ImageGen 分别生成,为新创作教学图,不复用论文图像。

关于这篇论文的三个关键问题

一次点击,为什么能“抠出”几乎任何东西? 解决了什么问题?

图像分割要为每个像素判断它属于哪个区域。过去的系统通常围绕固定任务和固定标签训练:交互式分割、实例分割、语义分割各有自己的输入与输出。换一个数据分布或任务,往往要重新标注和训练。与此同时,互联网天然有大量文字和图片,却没有同等规模的像素级掩码;通用模型需要的数据,恰恰是最昂贵的部分。(来源:§1、§2、§4)

一次点击,为什么能“抠出”几乎任何东西? 的核心结论有哪些证据?

公平性结论也不宜扩大。作者在感知性别、年龄和肤色分组上没有发现大多数显著差异,但肤色实验使用专有数据集,置信区间较宽;衣物分割还观察到与感知性别有关的偏差迹象。数据覆盖上,非洲、拉丁美洲与加勒比地区、低收入国家在所有对比数据集中仍不足。(来源:§6、表 1–2;附录 C)

阅读 一次点击,为什么能“抠出”几乎任何东西? 时最需要注意什么局限?

最能说明泛化能力的实验,是对 23 个 不同分布的分割数据集只给一个前景点。按自动 mIoU,SAM 在 16/23 个数据集上超过强交互分割基线 RITM,单个数据集差值范围也包含明显负值;若事后从 SAM 的 3 个候选中挑与真值最接近者,则 23 个数据集全部超过 RITM。人工评分中,SAM 的平均质量约在 7–9/10,高于 RITM。这里的“oracle”选择需要真值,不能当成真实部署性能;它主要证明多候选中经常已有好答案,而置信度排序仍有改进空间。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro