AI / Technology
CLIP把图片分类改写成“图文配对”
论文:Alec Radford 等,Learning Transferable Visual Models From Natural Language Supervision(2021)
一句话问题:视觉模型怎样摆脱预先固定的标签表,在没有下游训练样本时也能按自然语言识别图片?
一、先记住这三点
- 变化不只是“数据更多”。 CLIP 不再训练一个只能输出固定类别的分类头,而是同时训练图像编码器与文本编码器,让正确图文对靠近、错误配对远离。这样,文字本身就能在推理时定义新类别。来源:论文 §2.3、图 1
- 零样本能力来自一个可复用的配对接口。 预训练使用 4 亿个互联网图文对;测试时,把候选类别写成短句,与图片逐一比较相似度,不需要用目标数据集再训练。来源:论文 §2.2、§3.1.2
- 它证明了一条路线,不等于解决了通用视觉。 最佳模型在 ImageNet 零样本分类达到 76.2%,但细粒度分类、计数、真正分布外输入、数据与算力成本,以及偏差与类别设计仍是明显边界。来源:论文表 1、§6–7
最强证据: 零样本 CLIP 在 27 个数据集中有 16 个胜过基于 ResNet-50 特征训练的全监督线性分类器;在 ImageNet 上达到 76.2%,与原始 ResNet-50 相当,却没有使用 ImageNet 的 128 万张训练图。来源:论文图 5、表 1
最大未解风险: “广泛见过”并不等于真正泛化。论文估算,要仅靠现有缩放趋势追上整体任务的当时最佳水平,计算量还需约增大 1000 倍;而互联网数据中的偏差也会随灵活的类别设计进入应用。来源:论文 §6–7
二、问题:固定标签把视觉能力锁在训练集里
传统图像分类通常先规定一张标签表,例如 1000 个 ImageNet 类别,再让模型从大量人工标注图片中学习。要识别新概念,就得收集新标签、训练新分类器。此前的弱监督方法虽然利用网页标签扩大数据,但仍常把输出限制在预先设计的 1000 或 18,291 个类别中。自然语言能表达更开放的概念,难点是怎样把这种噪声大、形式多变的监督有效扩展到海量数据。来源:论文 §1
CLIP 的关键判断是:不必生成一整段精确描述,只需学会“这段文字是不是和这张图配对”。论文报告,与生成图注的基线相比,词袋预测学习 ImageNet 零样本能力快约 3 倍;再换成对比目标,效率又提高约 4 倍。这里比较的是论文实验中的学习效率,不是所有生成模型与对比模型的一般定律。来源:论文图 2、§2.3
图 1|新绘教学图。它减轻的理解负担:为何“配对”能同时训练视觉与语言接口。图中的三条具体描述只是教学示例,不是论文数据。机制依据:论文 §2.3、图 1。
三、方法:先学共享空间,再让文字临时生成分类器
训练数据。 作者从公开互联网来源构建 WebImageText(WIT):4 亿个图文对。检索过程使用 50 万个查询词,并对每个查询最多纳入 2 万个图文对,以扩大概念覆盖。数据没有按传统高质量标注集那样精细清洗,因此规模带来覆盖,也带来噪声和社会偏差。来源:论文 §2.2、§6
训练目标。 一个批次里有 (N) 对图文。图像编码器和文本编码器分别输出向量,模型计算所有 (N\times N) 个余弦相似度,用对称交叉熵提高真实配对的分数、降低错误配对的分数。论文实际使用的批量大小为 32,768,相当于每一步都提供大量“这张图不对应那些文字”的负例。来源:论文 §2.3、§2.5
零样本推理。 面对一个新分类任务,先把每个类别放进提示模板,例如 “A photo of a {label}.”,文本编码器由这些句子生成类别向量;再将图片向量与所有类别向量比较,选相似度最高者。类别表可以替换,编码器不必重训。论文还使用任务定制提示和提示集成:在 ImageNet 上,默认模板带来 1.3 个百分点,80 个提示的集成再带来 3.5 个百分点,合计接近 5 个百分点。这也说明结果对文字设计并非完全不敏感。来源:论文 §3.1.2–3.1.4
图 2|新绘教学图。它减轻的理解负担:为什么换一组文字候选,就能定义一个新分类任务。图中飞机只是示意,不对应某个论文样本。机制依据:论文 §3.1.2。
四、证据与边界:跨任务有效,但不是无条件泛化
| 证据 | 论文结果 | 应该怎样读 |
|---|---|---|
| ImageNet 零样本 top-1 | 76.2% | 从早期 Visual N-Grams 的 11.5% 大幅提高,并匹配原始 ResNet-50;但两者数据、模型与算力均未受控,不是纯方法消融。 |
| 27 数据集对比 | 16/27 获胜 | 零样本 CLIP 胜过“ResNet-50 特征 + 全监督线性分类器”的次数略过半;这个基线并非各任务当时最佳模型。 |
| 自然分布偏移 | 鲁棒性差距最多缩小 75% | 相对同等 ImageNet 精度模型,CLIP 的有效鲁棒性更高;论文不能分离零样本设置、数据多样性和语言监督各自的因果贡献。 |
| 训练集重叠检测 | 中位 2.2%,平均 3.2% | 检测到的重叠通常只让总体准确率变化不超过 0.1%;但检测器无法在 4 亿样本上证明完全召回。 |
表中数值分别来自论文表 1、图 5、图 13 和 §5。论文全文
边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6
图 3|新绘教学图。它减轻的理解负担:把“规模带来覆盖”与“覆盖不等于真正分布外泛化”同时放进一个画面。图中对象是概念隐喻,不是结果图。依据:论文 §6–7。
五、实践意义:它更像一个可编程视觉接口
对产品团队而言,CLIP 最重要的变化是把分类任务从“收集数据并重训模型”部分转移为“用语言定义候选概念并验证”。这适合做开放词表检索、内容路由、弱标签生成或原型验证;这是基于机制的产品解释,不是作者对任何具体生产系统的效果承诺。
上线前至少要做四件事:用真实业务分布独立评测;把提示模板和候选类别表视为模型的一部分并做版本管理;分别检查难例、分布外样本与人口子群;为高风险判断设置人工复核。尤其不能把“零样本”理解为“无需验证”:论文开发过程反复查看完整验证集,主要的 27 数据集集合也与 CLIP 的开发和能力有所共同适配。来源:论文 §6
附录:证据账本、术语与核验问题
证据账本
| 项目 | 记录 | 来源 |
|---|---|---|
| 论文身份 | Radford 等,arXiv:2103.00020,2021 年 2 月提交 | 摘要页 |
| 预训练数据 | WIT;4 亿图文对;50 万查询;每查询最多 2 万对 | §2.2 |
| 模型族 | 5 个 ResNet、3 个 Vision Transformer;均训练 32 epoch | §2.4–2.5 |
| 训练批量 | 32,768 | §2.5 |
| 最佳默认模型 | ViT-L/14@336px;额外以 336 像素训练 1 epoch | §2.5 |
| ImageNet | 零样本 top-1 76.2%,top-5 95%;未使用其 128 万训练样本 | 表 1、§3.1.3 |
| 提示影响 | 默认模板 +1.3 个百分点;80 提示集成再 +3.5;合计近 +5 | §3.1.4、图 4 |
| 跨数据集基线 | 27 个数据集上胜 16 个 | 图 5、§3.1.5 |
| 重叠 | 35 个数据集;9 个无检测重叠;中位 2.2%,均值 3.2%;最大估计增益 0.6% | §5、图 17 |
| 主要限制 | 估算需约 1000 倍算力达整体 SOTA;细粒度、计数、真正 OOD、少样本与偏差问题未解 | §6–7 |
不确定性与冲突处理
- “匹配原始 ResNet-50”只适用于 ImageNet 指标,不代表所有任务等价。
- Visual N-Grams 与 CLIP 的 11.5% 对 76.2% 比较混合了约 10 倍数据、近 100 倍单次预测算力和作者估计超过 1000 倍训练算力等差异;不能据此把全部提升归因于对比学习。
- 重叠分析依赖近重复检测器,作者明确说无法在 4 亿训练样本上验证其召回率;污染影响可能被低估或被子集难度差异掩盖。
- 论文只给出模型训练的硬件与天数,未给出本文可直接换算且稳定可比的能耗或碳排数字,因此不推测。
术语
- 自然语言监督(natural language supervision):把图片旁的文字当作训练信号,而非先整理成固定人工标签。
- 对比学习(contrastive learning):提高正确配对的相似度,同时降低错误配对的相似度。
- 零样本迁移(zero-shot transfer):不使用目标数据集的训练样本,仅凭任务/类别文字直接预测。
- 线性探针(linear probe):冻结表征模型,只在其特征上训练一个线性分类器,用于衡量表征质量。
- 分布外(out-of-distribution, OOD):输入与训练时覆盖的数据形态显著不同。
复现或采购前应核验
- 不做提示集成时,业务指标下降多少?提示更换是否改变子群误差?
- 训练语料与业务测试集是否存在重复、近重复或时间泄漏?
- 失败来自视觉表征、文字歧义、候选类别缺失,还是相似度阈值?
- 与同等算力、同等预训练数据和同等模型规模的基线相比,增益还剩多少?
- 在真正新增、训练期之后采集的数据上,鲁棒性结论是否仍成立?
来源
关于这篇论文的三个关键问题
CLIP:把图片分类改写成“图文配对” 解决了什么问题?
传统图像分类通常先规定一张标签表,例如 1000 个 ImageNet 类别,再让模型从大量人工标注图片中学习。要识别新概念,就得收集新标签、训练新分类器。此前的弱监督方法虽然利用网页标签扩大数据,但仍常把输出限制在预先设计的 1000 或 18,291 个类别中。自然语言能表达更开放的概念,难点是怎样把这种噪声大、形式多变的监督有效扩展到海量数据。来源:论文 §1
CLIP:把图片分类改写成“图文配对” 的核心结论有哪些证据?
边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6
阅读 CLIP:把图片分类改写成“图文配对” 时最需要注意什么局限?
边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6