返回报告库

AI / Technology

CLIP把图片分类改写成“图文配对”

关于这篇论文的三个关键问题

CLIP:把图片分类改写成“图文配对” 解决了什么问题?

传统图像分类通常先规定一张标签表,例如 1000 个 ImageNet 类别,再让模型从大量人工标注图片中学习。要识别新概念,就得收集新标签、训练新分类器。此前的弱监督方法虽然利用网页标签扩大数据,但仍常把输出限制在预先设计的 1000 或 18,291 个类别中。自然语言能表达更开放的概念,难点是怎样把这种噪声大、形式多变的监督有效扩展到海量数据。来源:论文 §1

CLIP:把图片分类改写成“图文配对” 的核心结论有哪些证据?

边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6

阅读 CLIP:把图片分类改写成“图文配对” 时最需要注意什么局限?

边界同样具体:CLIP 在汽车型号、花卉种类、飞机变体等细粒度任务上可能明显落后专用模型,也不擅长计数;对训练分布里罕见的任务,表现可接近随机。它在 MNIST 手写数字上只有 88%,甚至低于直接对像素做逻辑回归的简单基线。最大的 ResNet 版本用 592 张 V100 训练 18 天;最大的 ViT 用 256 张 V100 训练 12 天。32 个 epoch 共看过约 128 亿次图片,论文用“一秒一张也要 405 年”说明其数据效率问题。来源:论文 §2.5、§6

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro