返回报告库

AI / Technology

CLIP把图片分类改写成“图文配对”

论文:Alec Radford 等,Learning Transferable Visual Models From Natural Language Supervision(2021)
一句话问题:视觉模型怎样摆脱预先固定的标签表,在没有下游训练样本时也能按自然语言识别图片?

一、先记住这三点

  1. 变化不只是“数据更多”。 CLIP 不再训练一个只能输出固定类别的分类头,而是同时训练图像编码器与文本编码器,让正确图文对靠近、错误配对远离。这样,文字本身就能在推理时定义新类别。来源:论文 §2.3、图 1
  2. 零样本能力来自一个可复用的配对接口。 预训练使用 4 亿个互联网图文对;测试时,把候选类别写成短句,与图片逐一比较相似度,不需要用目标数据集再训练。来源:论文 §2.2、§3.1.2
  3. 它证明了一条路线,不等于解决了通用视觉。 最佳模型在 ImageNet 零样本分类达到 76.2%,但细粒度分类、计数、真正分布外输入、数据与算力成本,以及偏差与类别设计仍是明显边界。来源:论文表 1、§6–7

最强证据: 零样本 CLIP 在 27 个数据集中有 16 个胜过基于 ResNet-50 特征训练的全监督线性分类器;在 ImageNet 上达到 76.2%,与原始 ResNet-50 相当,却没有使用 ImageNet 的 128 万张训练图。来源:论文图 5、表 1

最大未解风险: “广泛见过”并不等于真正泛化。论文估算,要仅靠现有缩放趋势追上整体任务的当时最佳水平,计算量还需约增大 1000 倍;而互联网数据中的偏差也会随灵活的类别设计进入应用。来源:论文 §6–7

二、问题:固定标签把视觉能力锁在训练集里

传统图像分类通常先规定一张标签表,例如 1000 个 ImageNet 类别,再让模型从大量人工标注图片中学习。要识别新概念,就得收集新标签、训练新分类器。此前的弱监督方法虽然利用网页标签扩大数据,但仍常把输出限制在预先设计的 1000 或 18,291 个类别中。自然语言能表达更开放的概念,难点是怎样把这种噪声大、形式多变的监督有效扩展到海量数据。来源:论文 §1

CLIP 的关键判断是:不必生成一整段精确描述,只需学会“这段文字是不是和这张图配对”。论文报告,与生成图注的基线相比,词袋预测学习 ImageNet 零样本能力快约 3 倍;再换成对比目标,效率又提高约 4 倍。这里比较的是论文实验中的学习效率,不是所有生成模型与对比模型的一般定律。来源:论文图 2、§2.3

图 1|新绘教学图。它减轻的理解负担:为何“配对”能同时训练视觉与语言接口。图中的三条具体描述只是教学示例,不是论文数据。机制依据:论文 §2.3、图 1。

三、方法:先学共享空间,再让文字临时生成分类器

训练数据。 作者从公开互联网来源构建 WebImageText(WIT):4 亿个图文对。检索过程使用 50 万个查询词,并对每个查询最多纳入 2 万个图文对,以扩大概念覆盖。数据没有按传统高质量标注集那样精细清洗,因此规模带来覆盖,也带来噪声和社会偏差。来源:论文 §2.2、§6

训练目标。 一个批次里有 (N) 对图文。图像编码器和文本编码器分别输出向量,模型计算所有 (N\times N) 个余弦相似度,用对称交叉熵提高真实配对的分数、降低错误配对的分数。论文实际使用的批量大小为 32,768,相当于每一步都提供大量“这张图不对应那些文字”的负例。来源:论文 §2.3、§2.5

零样本推理。 面对一个新分类任务,先把每个类别放进提示模板,例如 “A photo of a {label}.”,文本编码器由这些句子生成类别向量;再将图片向量与所有类别向量比较,选相似度最高者。类别表可以替换,编码器不必重训。论文还使用任务定制提示和提示集成:在 ImageNet 上,默认模板带来 1.3 个百分点,80 个提示的集成再带来 3.5 个百分点,合计接近 5 个百分点。这也说明结果对文字设计并非完全不敏感。来源:论文 §3.1.2–3.1.4

图 2|新绘教学图。它减轻的理解负担:为什么换一组文字候选,就能定义一个新分类任务。图中飞机只是示意,不对应某个论文样本。机制依据:论文 §3.1.2。

四、证据与边界:跨任务有效,但不是无条件泛化

证据论文结果应该怎样读
ImageNet 零样本 top-176.2%从早期 Visual N-Grams 的 11.5% 大幅提高,并匹配原始 ResNet-50;但两者数据、模型与算力均未受控,不是纯方法消融。
27 数据集对比16/27 获胜零样本 CLIP 胜过“ResNet-50 特征 + 全监督线性分类器”的次数略过半;这个基线并非各任务当时最佳模型。
自然分布偏移鲁棒性差距最多缩小 75%相对同等 ImageNet 精度模型,CLIP 的有效鲁棒性更高;论文不能分离零样本设置、数据多样性和语言监督各自的因果贡献。
训练集重叠检测中位 2.2%,平均 3.2%检测到的重叠通常只让总体准确率变化不超过 0.1%;但检测器无法在 4 亿样本上证明完全召回。

表中数值分别来自论文表 1、图 5、图 13 和 §5。论文全文

边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6

图 3|新绘教学图。它减轻的理解负担:把“规模带来覆盖”与“覆盖不等于真正分布外泛化”同时放进一个画面。图中对象是概念隐喻,不是结果图。依据:论文 §6–7。

五、实践意义:它更像一个可编程视觉接口

对产品团队而言,CLIP 最重要的变化是把分类任务从“收集数据并重训模型”部分转移为“用语言定义候选概念并验证”。这适合做开放词表检索、内容路由、弱标签生成或原型验证;这是基于机制的产品解释,不是作者对任何具体生产系统的效果承诺。

上线前至少要做四件事:用真实业务分布独立评测;把提示模板和候选类别表视为模型的一部分并做版本管理;分别检查难例、分布外样本与人口子群;为高风险判断设置人工复核。尤其不能把“零样本”理解为“无需验证”:论文开发过程反复查看完整验证集,主要的 27 数据集集合也与 CLIP 的开发和能力有所共同适配。来源:论文 §6

附录:证据账本、术语与核验问题

证据账本

项目记录来源
论文身份Radford 等,arXiv:2103.00020,2021 年 2 月提交摘要页
预训练数据WIT;4 亿图文对;50 万查询;每查询最多 2 万对§2.2
模型族5 个 ResNet、3 个 Vision Transformer;均训练 32 epoch§2.4–2.5
训练批量32,768§2.5
最佳默认模型ViT-L/14@336px;额外以 336 像素训练 1 epoch§2.5
ImageNet零样本 top-1 76.2%,top-5 95%;未使用其 128 万训练样本表 1、§3.1.3
提示影响默认模板 +1.3 个百分点;80 提示集成再 +3.5;合计近 +5§3.1.4、图 4
跨数据集基线27 个数据集上胜 16 个图 5、§3.1.5
重叠35 个数据集;9 个无检测重叠;中位 2.2%,均值 3.2%;最大估计增益 0.6%§5、图 17
主要限制估算需约 1000 倍算力达整体 SOTA;细粒度、计数、真正 OOD、少样本与偏差问题未解§6–7

不确定性与冲突处理

  • “匹配原始 ResNet-50”只适用于 ImageNet 指标,不代表所有任务等价。
  • Visual N-Grams 与 CLIP 的 11.5% 对 76.2% 比较混合了约 10 倍数据、近 100 倍单次预测算力和作者估计超过 1000 倍训练算力等差异;不能据此把全部提升归因于对比学习。
  • 重叠分析依赖近重复检测器,作者明确说无法在 4 亿训练样本上验证其召回率;污染影响可能被低估或被子集难度差异掩盖。
  • 论文只给出模型训练的硬件与天数,未给出本文可直接换算且稳定可比的能耗或碳排数字,因此不推测。

术语

  • 自然语言监督(natural language supervision):把图片旁的文字当作训练信号,而非先整理成固定人工标签。
  • 对比学习(contrastive learning):提高正确配对的相似度,同时降低错误配对的相似度。
  • 零样本迁移(zero-shot transfer):不使用目标数据集的训练样本,仅凭任务/类别文字直接预测。
  • 线性探针(linear probe):冻结表征模型,只在其特征上训练一个线性分类器,用于衡量表征质量。
  • 分布外(out-of-distribution, OOD):输入与训练时覆盖的数据形态显著不同。

复现或采购前应核验

  1. 不做提示集成时,业务指标下降多少?提示更换是否改变子群误差?
  2. 训练语料与业务测试集是否存在重复、近重复或时间泄漏?
  3. 失败来自视觉表征、文字歧义、候选类别缺失,还是相似度阈值?
  4. 与同等算力、同等预训练数据和同等模型规模的基线相比,增益还剩多少?
  5. 在真正新增、训练期之后采集的数据上,鲁棒性结论是否仍成立?

来源

关于这篇论文的三个关键问题

CLIP:把图片分类改写成“图文配对” 解决了什么问题?

传统图像分类通常先规定一张标签表,例如 1000 个 ImageNet 类别,再让模型从大量人工标注图片中学习。要识别新概念,就得收集新标签、训练新分类器。此前的弱监督方法虽然利用网页标签扩大数据,但仍常把输出限制在预先设计的 1000 或 18,291 个类别中。自然语言能表达更开放的概念,难点是怎样把这种噪声大、形式多变的监督有效扩展到海量数据。来源:论文 §1

CLIP:把图片分类改写成“图文配对” 的核心结论有哪些证据?

边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6

阅读 CLIP:把图片分类改写成“图文配对” 时最需要注意什么局限?

边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro