AI / Technology
視覚指示チューニング
画像注釈を3種類の指示応答データへ変換する流れ
図1 — 既存の画像注釈を記号表現にし、言語モデルで3種類の指示応答へ再編集する。画像そのものはGPT-4への入力ではない。出典: 論文 §3・表1。図は説明用の新規作成。
著者らの発想は、画像指示データを人手で一から大量収集するのではなく、既存のCOCO画像に付いた複数キャプションと物体のバウンディングボックスを、GPT-4が読める記号表現として渡すことだった。GPT-4自身は画像を見ていない。見えているのは、画像を言葉と座標に置き換えた情報だけである。この制約を明示することが、方法の理解にもデータ品質の評価にも重要だ。論文 §3・表1
LLaVAの二段階学習
図2 — 段階1は線形変換だけを学習し、段階2は線形変換とVicunaを学習する。CLIPは両段階で固定。出典: 論文 §4.1–4.2。図は説明用の新規作成。
段階1では、CC3Mから絞った595K組を使い、CLIPとVicunaを固定して線形層だけを1エポック学習する。これは画像特徴を言語モデルが読める形へそろえる工程だ。段階2ではCLIPを固定したまま、線形層とVicunaを158K件の指示データで3エポック微調整する。学習には8基のA100を使い、事前学習は4時間以内、指示微調整は10時間以内だった。論文 §4.2、付録C
指示追従の成功と、画像全体の関係を結べない失敗
図3 — 指示に沿う能力が伸びても、別々の物体を誤って一つの概念に結ぶ失敗は残る。右側は論文の冷蔵庫例を抽象化したもの。出典: 論文 §5.1 Limitations。図は説明用の新規作成。
論文中の冷蔵庫例では、イチゴとヨーグルトが別々にあるだけなのに「イチゴ味のヨーグルトがある」と答えた。著者らは、画像を互いに切れたパッチの袋のように捉え、全体の意味関係をつかめない場合があると述べる。高解像度の細部、多言語の文字、幻覚、基盤モデル由来の偏り、医療など重大用途での事実性も未解決であり、GPT-4評価の頑健性も将来検証としている。論文 §5.1 Limitations、付録A
研究付録
原題: Visual Instruction Tuning
著者: Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee
公開: arXiv:2304.08485v2(2023年12月11日改訂)/NeurIPS 2023 Oral
一次資料: arXiv概要 ・ 論文本文
要点
まず覚えたい3点
- 画像対話モデルを育てるボトルネックを、モデル構造よりデータ作りから解いた。 既存の画像キャプションと物体の位置情報を文章に変え、言語だけを扱うGPT-4に渡すことで、画像に関する対話・詳しい説明・複雑な推論の教師データを158K件作った。
- 画像と文章の橋は意外に単純だった。 凍結したCLIP画像エンコーダの出力を線形層でVicunaの単語空間へ写し、まず両者を接続し、その後に指示応答を学ばせる。この二段階学習で、画像を見ながら質問の意図に沿って答えるLLaVAを構築した。
- 成果は大きいが、評価にも教師と同じGPT-4が入る。 LLaVA-Bench(COCO)ではGPT-4基準の相対スコア85.1、ScienceQAではLLaVA単体90.92%、GPT-4との判定型アンサンブルで92.53%だった。ただし、細部の知覚、幻覚、評価者依存は未解決である。
ひとことで言うと
この論文は、画像を理解できる大規模言語モデルを作るには、巨大で複雑な接続機構だけでなく、「画像についてどう頼み、どう答えるか」を教える合成指示データが効く ことを示した初期の実証研究である。論文 §1, §3–5
問題
画像と言葉のペアだけでは「頼み方」を学べない
当時すでに画像と短い説明文の組は大量にあった。しかし、それだけでは「何が変わっている?」「詳しく説明して」「この状況から何が起きそう?」といった、目的の異なる依頼への応じ方を学びにくい。既存の視覚モデルは分類・検出・キャプション生成など個別タスクには強くても、自然言語を共通の操作盤として使う対話性と適応性が限られていた。論文 §1, §3
新規収集より、既存データの「再編集」
著者らの発想は、画像指示データを人手で一から大量収集するのではなく、既存のCOCO画像に付いた複数キャプションと物体のバウンディングボックスを、GPT-4が読める記号表現として渡すことだった。GPT-4自身は画像を見ていない。見えているのは、画像を言葉と座標に置き換えた情報だけである。この制約を明示することが、方法の理解にもデータ品質の評価にも重要だ。論文 §3・表1
方法
158K件を3種類に分けて作る
生成したデータは、会話58K件、詳しい説明23K件、複雑な推論77K件の計158K件である。会話は物体・数・行動・位置関係など、答えが明確な問いを扱う。詳しい説明は画像全体を豊かに言語化し、複雑な推論は見えている内容から筋道を立てて答える。少数の人手作成例を見本としてGPT-4に与え、その形式を展開した。論文 §3
CLIPとVicunaを一本の線形層でつなぐ
画像側は事前学習済みCLIP ViT-L/14、言語側はVicunaを使う。CLIPの画像特徴を、学習可能な線形射影でVicunaの単語埋め込みと同じ次元の「視覚トークン」に変換する。複雑な融合機構ではなく細い橋を選んだため、著者らはデータ中心の実験を速く回せた。一方で、より高度な接続方式が有効かは将来課題として残している。論文 §4.1
二段階で「見える」と「応じる」を合わせる
段階1では、CC3Mから絞った595K組を使い、CLIPとVicunaを固定して線形層だけを1エポック学習する。これは画像特徴を言語モデルが読める形へそろえる工程だ。段階2ではCLIPを固定したまま、線形層とVicunaを158K件の指示データで3エポック微調整する。学習には8基のA100を使い、事前学習は4時間以内、指示微調整は10時間以内だった。論文 §4.2、付録C
証拠と限界
最も強い数字は何か
| 評価 | 結果 | 何を意味するか |
|---|---|---|
| LLaVA-Bench(COCO、90問) | 85.1 | 正解キャプション等を読むGPT-4を100とした相対スコア。指示学習なしは21.5 |
| LLaVA-Bench(In-the-Wild、60問) | 67.3 | BLIP-2は38.1、OpenFlamingoは19.1。複雑な推論では81.7 |
| ScienceQA | 90.92% | LLaVA単体。比較対象の当時の最高値は91.68% |
| ScienceQA + GPT-4判定 | 92.53% | LLaVAとテキスト版GPT-4の答えが違うとき、GPT-4が最終回答を選ぶ |
COCOのアブレーションでは、指示学習なし21.5から全データ使用85.1へ上がった。またScienceQAでは、事前学習を省くと90.92%から85.81%へ5.11ポイント落ちた。したがって、この論文が最も直接に支えるのは「視覚指示データと特徴整合の二段階が、この設定では性能に寄与した」という主張である。論文 表4、表7–8
数字を読むときの注意
85.1は通常の正答率ではない。候補回答と、正解の画像説明を読んだテキスト版GPT-4の回答を、さらにGPT-4が1〜10点で採点した相対値である。データ生成・参照回答・採点に同系統のモデルが関わるため、好みや誤りが共有される可能性を排除できない。COCO版は30画像90問、In-the-Wild版は24画像60問と小規模でもある。92.53%もLLaVA単体ではなく、GPT-4を最終判定に使ったアンサンブルの結果だ。論文 §5.1–5.2、表4–7
見えている弱点
論文中の冷蔵庫例では、イチゴとヨーグルトが別々にあるだけなのに「イチゴ味のヨーグルトがある」と答えた。著者らは、画像を互いに切れたパッチの袋のように捉え、全体の意味関係をつかめない場合があると述べる。高解像度の細部、多言語の文字、幻覚、基盤モデル由来の偏り、医療など重大用途での事実性も未解決であり、GPT-4評価の頑健性も将来検証としている。論文 §5.1 Limitations、付録A
実務的な意味
プロダクトに引き直すと
ここから得られる実務上の示唆は、モデルを大きくする前に、利用者が実際にする依頼の型をデータとして設計する価値がある、ということだ。たとえば「短く説明」「根拠を挙げて比較」「異常箇所を指摘」のような利用場面を分ければ、同じ画像基盤でも応答の幅を育てられる。ただしこれは本稿の解釈であり、論文が特定の製品ROIや本番品質を検証したわけではない。
導入前に確かめたいこと
- 自社画像を言葉や座標へ変換したとき、重要な細部や関係が落ちないか。
- 合成データの教師と評価者を同じモデルにせず、人手評価や独立した評価器でも再確認できるか。
- 正答率だけでなく、幻覚、細粒度認識、文字読み取り、偏りを実利用の失敗コストに合わせて測れるか。
- 画像エンコーダを固定する設計で足りるか、それとも領域固有画像への適応が必要か。
用語・出典メモ
- Visual instruction tuning(視覚指示チューニング): 画像と自然言語の依頼に対し、意図に沿った応答を生成するようモデルを微調整すること。
- LLaVA: Large Language and Vision Assistant。CLIP、線形射影、Vicunaをつないだ本論文のモデル。
- 相対スコア85.1: GPT-4が付けた回答品質スコアを、正解の画像説明を読めるテキスト版GPT-4のスコアに対して正規化した値。正答率85.1%ではない。
- 不確実性: 合成データ158K件の品質を独立した人手で網羅的に監査した結果、広範な実世界タスクでの一般化、安全性、本番運用コストは本論文からは確定できない。
この論文についての3つの重要な質問
視覚指示チューニングはどの課題を扱いますか?
画像側は事前学習済みCLIP ViT-L/14、言語側はVicunaを使う。CLIPの画像特徴を、学習可能な線形射影でVicunaの単語埋め込みと同じ次元の「視覚トークン」に変換する。複雑な融合機構ではなく細い橋を選んだため、著者らはデータ中心の実験を速く回せた。一方で、より高度な接続方式が有効かは将来課題として残している。論文 §4.1
視覚指示チューニングの中心的な主張を支える根拠は何ですか?
COCOのアブレーションでは、指示学習なし21.5から全データ使用85.1へ上がった。またScienceQAでは、事前学習を省くと90.92%から85.81%へ5.11ポイント落ちた。したがって、この論文が最も直接に支えるのは「視覚指示データと特徴整合の二段階が、この設定では性能に寄与した」という主張である。論文 表4、表7–8
視覚指示チューニングを読むときに注意すべき限界は何ですか?
85.1は通常の正答率ではない。候補回答と、正解の画像説明を読んだテキスト版GPT-4の回答を、さらにGPT-4が1〜10点で採点した相対値である。データ生成・参照回答・採点に同系統のモデルが関わるため、好みや誤りが共有される可能性を排除できない。COCO版は30画像90問、In-the-Wild版は24画像60問と小規模でもある。92.53%もLLaVA単体ではなく、GPT-4を最終判定に使ったアンサンブルの結果だ。論文 §5.1–5.2、表4–7