レポート一覧へ

AI / Technology

自然言語による教師信号から、転用できる視覚モデルを学ぶ

固定ラベル方式とCLIPの違い

図1(新規作成): 従来方式では新クラスに追加データと再学習が必要になりやすい。CLIPはクラスを言葉で指定できる。ただし、出力の妥当性確認は別途必要である。

画像に付随する語句から視覚表現を学ぶ発想自体は新しくない。Visual N-Gramsなどの先行研究もゼロショット転用を試したが、ImageNet精度は11.5%だった。著者らが重視した差は、画像と言葉の対応を学ぶ目的関数の効率と、ウェブ規模のデータである。[論文 §1、Table 1]

CLIPの対照学習

図2(新規作成): 青い画像表現と緑のテキスト表現を同じ空間へ写し、正しい組を近づけ、誤った組を遠ざける。

CLIP(Contrastive Language–Image Pre-training)は、画像エンコーダとテキストエンコーダを同時に学習する。1つのミニバッチ内で、各画像と各テキストの組合せのコサイン類似度を計算し、本当の組の類似度が高く、違う組の類似度が低くなるよう対称なクロスエントロピー損失を最小化する。文章そのものを一語ずつ生成するのではなく、どの文章がどの画像と組になるか を当てるため、著者らの比較では、bag-of-words予測よりさらに4倍効率がよかった。[論文 Figure 2、§2.3、擬似コード Figure 3]

言葉から作るゼロショット分類

図3(新規作成): クラス候補と言葉をテキスト表現に変え、未知画像の画像表現に最も近い候補を選ぶ。

推論時には候補クラスを、たとえば「a photo of a dog」のような文章にしてテキスト表現へ変える。入力画像の表現と各候補の類似度を比べ、最も近いものを答えにする。複数の言い回しを平均するプロンプト・アンサンブルは、文脈なしのクラス名だけを使う場合に比べ、36データセット平均でほぼ5ポイント改善した。[論文 §3.1.2、§3.1.4、Figure 4]

研究付録

原題: Learning Transferable Visual Models From Natural Language Supervision
著者: Alec Radford, Jong Wook Kim, Chris Hallacy ほか(OpenAI)
公開: arXiv:2103.00020、2021年2月26日
一次資料: 論文ページ / PDF

要点

3つでつかむCLIP

  1. 画像と言葉を同じ物差しで比べられるようにした。 4億組の画像とテキストを使い、正しい組を近く、誤った組を遠くに置くよう学習する。[論文 Abstract、§2.2–2.3]
  2. 新しい分類を、追加学習なしで言葉から作れる。 「犬」「車」といった候補を文章にし、入力画像に最も近い候補を選ぶ。これがゼロショット分類である。[論文 Figure 1、§3.1.1]
  3. 広く使えるが、万能ではない。 ImageNetでは追加のImageNet学習例なしに76.2%のtop-1精度を得た一方、数え上げ、細かな車種・花・航空機の区別、真に未知の分布では弱い。[論文 Table 1、§6]

ひと言でいえば、CLIPの変化は、画像分類器の「答えの候補」を学習時に固定する代わりに、言葉で後から指定できる比較問題へ変えたこと にある。

問題

固定ラベルの壁

従来の画像分類では、たとえば1000クラスを先に決め、そのクラス名付き画像で分類器を訓練する。新しい概念を足すには、ふつう新しいラベル付きデータと再学習が要る。この方式は精度を出しやすい反面、「訓練時に決めた答え」から外へ出にくい。論文は、自然言語なら固定クラスよりはるかに多様な視覚概念を表せる、と問題を置く。[論文 Abstract、§1]

先行研究に足りなかったもの

画像に付随する語句から視覚表現を学ぶ発想自体は新しくない。Visual N-Gramsなどの先行研究もゼロショット転用を試したが、ImageNet精度は11.5%だった。著者らが重視した差は、画像と言葉の対応を学ぶ目的関数の効率と、ウェブ規模のデータである。[論文 §1、Table 1]

方法

正しい画像と言葉を近づける

CLIP(Contrastive Language–Image Pre-training)は、画像エンコーダとテキストエンコーダを同時に学習する。1つのミニバッチ内で、各画像と各テキストの組合せのコサイン類似度を計算し、本当の組の類似度が高く、違う組の類似度が低くなるよう対称なクロスエントロピー損失を最小化する。文章そのものを一語ずつ生成するのではなく、どの文章がどの画像と組になるか を当てるため、著者らの比較では、bag-of-words予測よりさらに4倍効率がよかった。[論文 Figure 2、§2.3、擬似コード Figure 3]

4億組を教師にする

著者らは、インターネット上の公開情報源から4億の画像・テキスト組を集め、WIT(WebImageText)を構築した。幅広い概念を覆うため50万件の検索語を使い、1検索語あたり最大2万組におおむね均衡化した。これは人手で整えた正解ラベルではなく、画像の周辺に自然に存在する文章を教師信号として使う設計である。[論文 §2.2]

言葉から分類器を組み立てる

推論時には候補クラスを、たとえば「a photo of a dog」のような文章にしてテキスト表現へ変える。入力画像の表現と各候補の類似度を比べ、最も近いものを答えにする。複数の言い回しを平均するプロンプト・アンサンブルは、文脈なしのクラス名だけを使う場合に比べ、36データセット平均でほぼ5ポイント改善した。[論文 §3.1.2、§3.1.4、Figure 4]

証拠と限界

何が強い証拠か

最も分かりやすい結果は、最大モデルのゼロショットCLIPがImageNetでtop-1 76.2%、top-5 95% を得て、ImageNetの128万枚の訓練例を直接使わずに元のResNet-50の精度へ並んだことだ。[論文 Abstract、Table 1]

評価範囲も一つのベンチマークに限らない。OCR、動画の行動認識、地理推定、細分類など30超の既存データセットを調べた。27データセットで、ゼロショットCLIPはResNet-50特徴に線形分類器を載せた教師ありベースラインに16件で勝った。ただし勝敗の幅は大きく、平均値だけで万能と読むべきではない。[論文 §3.1.5、Figure 5]

訓練データと評価データの重複も検査している。35データセット中9件では重複を検出せず、推定された重複による全体精度の最大上昇はBirdsnapの0.6ポイントだった。ただし著者自身、重複検出の誤りや分布差が過学習の影響を隠しうると述べる。[論文 §5、Figure 17]

どこで弱いか

  • 細かな車種・花・航空機の種類、物体数のカウント、最寄りの車までの距離のような課題で弱い。未知課題にはほぼ偶然レベルのものも多い。[論文 §6]
  • 真に訓練分布外の入力には脆い。MNISTは88%で、生の画素にロジスティック回帰をかける単純な基準にも負けた。[論文 §6]
  • ゼロショットで選べるのは、与えた候補クラスの中だけである。自由文を生成する画像キャプションとは異なる。[論文 §6]
  • 最大のRN50x64は592基のV100で18日、最大Vision Transformerは256基のV100で12日を要した。著者らの外挿では、当時の総合SOTAへ届くには約1000倍の計算増が必要で、現行ハードウェアでは非現実的だった。[論文 §2.5、§6]
  • 未整理のウェブ画像・テキストから社会的バイアスを学ぶ。クラスの切り方や言葉選びで結果も変わるため、用途ごとの評価なしに人物分類や監視へ使えるとはいえない。[論文 §6–7.1]

不確実性として残ること

WITの内容は十分には公開・記述されておらず、再現性やデータ由来の偏りを第三者が完全に監査できない。主要27データセットもCLIPの開発と能力に合わせて選ばれた面があると著者ら自身が認めている。また、この論文の結果は「自然言語で指定すれば現場で安全に動く」ことを証明していない。[論文 §5–7]

実務的な意味

向いている使い方

ここからは論文結果を踏まえた実務上の解釈 である。CLIPは、分類候補が頻繁に変わる画像検索、粗いタグ付け、候補抽出、少量データしかない試作の土台に向く。特に「まず言葉で探し、最後は人や別モデルが確認する」構成なら、ゼロから専用分類器を作る前の探索コストを下げやすい。一方、高精度な計数、微細な型番判定、医療・採用・監視のような高リスク判断を、そのまま任せる根拠にはならない。

導入前に確かめること

  1. 実際の入力分布と、現場で使うクラス名・文章で評価する。
  2. 言い回しを変えたときの予測変動と、属性別の誤りを測る。
  3. 「候補外」「低信頼」「判断不能」を扱う逃げ道を設ける。
  4. 専用の教師ありモデル、人手確認、検索後の再ランキングと比較する。

結論は単純だ。CLIPの価値は「何でも見分ける完成品」ではなく、画像の概念を言葉で呼び出せる汎用の接続部 を示したことにある。その柔軟さと、データ・計算量・バイアス・分布外性能という負債をセットで評価する必要がある。

読み返すための用語と出典

  • 対照学習(contrastive learning): 正しい組を近づけ、誤った組を遠ざける学習。
  • ゼロショット(zero-shot): 対象データセット固有の訓練例を使わず、ここでは自然言語のクラス記述から予測する設定。
  • 線形プローブ(linear probe): 学習済み特徴を固定し、その上に単純な線形分類器を訓練して表現の質を測る方法。
  • 一次資料: Radford et al., 2021, arXiv:2103.00020 本文PDF。数値と限界は本文、表、図のページ表記に基づく。

この論文についての3つの重要な質問

自然言語による教師信号から、転用できる視覚モデルを学ぶはどの課題を扱いますか?

ひと言でいえば、CLIPの変化は、画像分類器の「答えの候補」を学習時に固定する代わりに、言葉で後から指定できる比較問題へ変えたこと にある。

自然言語による教師信号から、転用できる視覚モデルを学ぶの中心的な主張を支える根拠は何ですか?

画像に付随する語句から視覚表現を学ぶ発想自体は新しくない。Visual N-Gramsなどの先行研究もゼロショット転用を試したが、ImageNet精度は11.5%だった。著者らが重視した差は、画像と言葉の対応を学ぶ目的関数の効率と、ウェブ規模のデータである。[論文 §1、Table 1]

自然言語による教師信号から、転用できる視覚モデルを学ぶを読むときに注意すべき限界は何ですか?

評価範囲も一つのベンチマークに限らない。OCR、動画の行動認識、地理推定、細分類など30超の既存データセットを調べた。27データセットで、ゼロショットCLIPはResNet-50特徴に線形分類器を載せた教師ありベースラインに16件で勝った。ただし勝敗の幅は大きく、平均値だけで万能と読むべきではない。[論文 §3.1.5、Figure 5]

本日はあと2本の新しいレポートを無料で読めますProなら無制限に読め、毎月10本の新しい論文解説を生成できます。Proにアップグレード