返回报告库

AI / Technology

一次点击,为什么能“抠出”几乎任何东西?

关于这篇论文的三个关键问题

一次点击,为什么能“抠出”几乎任何东西? 解决了什么问题?

图像分割要为每个像素判断它属于哪个区域。过去的系统通常围绕固定任务和固定标签训练:交互式分割、实例分割、语义分割各有自己的输入与输出。换一个数据分布或任务,往往要重新标注和训练。与此同时,互联网天然有大量文字和图片,却没有同等规模的像素级掩码;通用模型需要的数据,恰恰是最昂贵的部分。(来源:§1、§2、§4)

一次点击,为什么能“抠出”几乎任何东西? 的核心结论有哪些证据?

公平性结论也不宜扩大。作者在感知性别、年龄和肤色分组上没有发现大多数显著差异,但肤色实验使用专有数据集,置信区间较宽;衣物分割还观察到与感知性别有关的偏差迹象。数据覆盖上,非洲、拉丁美洲与加勒比地区、低收入国家在所有对比数据集中仍不足。(来源:§6、表 1–2;附录 C)

阅读 一次点击,为什么能“抠出”几乎任何东西? 时最需要注意什么局限?

最能说明泛化能力的实验,是对 23 个 不同分布的分割数据集只给一个前景点。按自动 mIoU,SAM 在 16/23 个数据集上超过强交互分割基线 RITM,单个数据集差值范围也包含明显负值;若事后从 SAM 的 3 个候选中挑与真值最接近者,则 23 个数据集全部超过 RITM。人工评分中,SAM 的平均质量约在 7–9/10,高于 RITM。这里的“oracle”选择需要真值,不能当成真实部署性能;它主要证明多候选中经常已有好答案,而置信度排序仍有改进空间。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro