返回报告库

AI / Technology

让模型不只“看图说话”LLaVA 与视觉指令微调

视觉指令数据生成流程:图像被转成字幕和目标框,文本教师再生成对话、详述与推理样本。

图 1|原创教学示意。它解释信息流,不复刻论文图。精确数据见上文。

作者取 COCO 图像已有的多条字幕和目标框,把它们作为图片的符号化描述交给文本版 GPT‑4。教师据此生成三类样本:多轮对话、单轮详细描述、单轮复杂推理。最终共 158K 条:58K 对话、23K 详述、77K 推理;数据涉及约 80K 张独特图像。这里要特别区分:GPT‑4 在数据生成时没有直接看到图片,它看到的是字幕与目标位置等文字表示。[来源:论文 §3,第 3–4 页;§5.1,第 6 页]

LLaVA 的信息流与两阶段训练

图 2|原创教学示意。蓝色流程表示推理信息流;阶段条表示训练状态。

阶段一使用过滤后的 595K 个 CC3M 图文对,只训练投影层;视觉编码器和语言模型都冻结。这相当于先调通视觉到语言的接口。阶段二继续冻结视觉编码器,同时更新投影层和语言模型:聊天版本使用 158K 指令样本;ScienceQA 版本则把问题与上下文作为指令、把推理与答案作为目标。[来源:论文 §4.2,第 5 页]

证据边界:实验支持指令跟随、跨模态对齐和科学问答表现,但视觉幻觉、评测依赖、偏…

图 3|原创证据边界图。它不表示数值大小;精确结果见表 1 与正文。

但这些结果不能自动推出“模型可靠理解任意图片”。LLaVA-Bench(COCO)只有 30 张图、90 个问题;候选回答由文本 GPT‑4 打分,而参考回答也由文本 GPT‑4 基于人工文字描述生成,存在同源评测偏差的可能。ScienceQA 的 92.53% 又是 LLaVA 与 GPT‑4 组合系统的结果,不能归给 LLaVA 单模型。作者也明确列出视觉幻觉、偏见、细粒度视觉理解、评测稳健性与规模化能耗等风险。[来源:论文 §5.1–5.2,第 6–9 页;附录 A,第 14 页]

研究附录

论文:Haotian Liu 等,Visual Instruction Tuning,NeurIPS 2023 Oral,arXiv v2(2023-12-11)。摘要页 · 论文 PDF

一、先记住这三点

  1. 真正的新意在数据形式。 作者把现成的图像—文字对改造成“看图后按指令回答”的训练样本,让模型学习的不只是描述图片,而是根据问题切换任务。[来源:论文 §3,第 3–4 页]
  2. 模型靠一座很小的桥接层把视觉接入语言。 冻结的 CLIP 视觉编码器先提取特征,线性投影层把它们变成 Vicuna 能接收的“视觉词元”,再与用户指令一起生成回答。[来源:论文 §4.1,第 4 页]
  3. 结果证明了方向可行,却不是通用可靠性的证明。 完整指令数据在 LLaVA-Bench(COCO)得到相对 GPT‑4 参考答案的 85.1 分;ScienceQA 上 LLaVA 单独为 90.92%,与文本 GPT‑4 作为裁判组合后为 92.53%。但评测依赖 GPT‑4,视觉幻觉、细粒度理解、偏见和规模化成本仍未被充分检验。[来源:论文表 4、表 7;附录 A,第 14 页]

一句话带走: 这篇论文把“语言模型的指令微调”搬到图像—语言场景,并用一条简单的数据与模型管线展示:视觉助手的能力,既来自模型连接方式,也强烈取决于它被教过怎样回答。

二、问题:会描述图片,不等于会按要求做事

当时不少视觉语言模型已经能为图片写字幕,或在特定任务上分类、检测、分割,但任务往往由模型结构预先限定,交互接口也较固定。用户若改问“哪里不寻常”“为什么会这样”或“请分步骤解释”,模型可能仍只复述画面。论文要解决的问题是:如何让一个端到端视觉语言模型,把自然语言当作统一任务接口,针对同一张图执行不同指令?[来源:论文 §1,第 1–2 页]

关键障碍不是完全没有图文数据,而是缺少大规模的“图像 + 用户指令 + 合适回答”数据。人工逐条编写既贵,也难覆盖对话、细节描述和推理等不同意图。[来源:论文 §3,第 3 页]

三、方法:先改造教材,再训练“视觉翻译桥”

1. 文本教师不看像素,也能帮助编写视觉教材

作者取 COCO 图像已有的多条字幕和目标框,把它们作为图片的符号化描述交给文本版 GPT‑4。教师据此生成三类样本:多轮对话、单轮详细描述、单轮复杂推理。最终共 158K 条:58K 对话、23K 详述、77K 推理;数据涉及约 80K 张独特图像。这里要特别区分:GPT‑4 在数据生成时没有直接看到图片,它看到的是字幕与目标位置等文字表示。[来源:论文 §3,第 3–4 页;§5.1,第 6 页]

2. 一层线性投影,把视觉特征翻译成语言模型可读的词元

LLaVA 使用预训练 CLIP ViT‑L/14 提取图像的网格特征,再用可训练矩阵 W 做线性投影,使视觉特征与 Vicuna 的词嵌入维度一致。投影后的视觉词元与用户指令共同送入语言模型,模型只对助手回答部分计算自回归训练损失。[来源:论文 §4.1–4.2,第 4–5 页]

3. 两阶段训练,先对齐接口,再教会遵循指令

阶段一使用过滤后的 595K 个 CC3M 图文对,只训练投影层;视觉编码器和语言模型都冻结。这相当于先调通视觉到语言的接口。阶段二继续冻结视觉编码器,同时更新投影层和语言模型:聊天版本使用 158K 指令样本;ScienceQA 版本则把问题与上下文作为指令、把推理与答案作为目标。[来源:论文 §4.2,第 5 页]

四、证据与边界:提升明显,但尺子本身也要审视

最有说服力的证据:拿掉指令微调,表现大幅下降

在 LLaVA-Bench(COCO)的 90 个问题上,完整数据版本总相对分为 85.1;只用对话数据为 73.8;完全不做指令微调仅为 21.5。加入详述和复杂推理数据后,不仅对应能力提高,对话表现也上升。这个消融比几张漂亮案例更能支持论文的核心因果主张:数据的指令形式与类型确实重要。[来源:论文表 4,第 7 页]

LLaVA-Bench(COCO)训练设置对话详述复杂推理总分
完整数据83.175.396.585.1
仅对话76.559.884.973.8
无指令微调22.024.018.521.5

表 1|相对分以文本 GPT‑4 参考回答为基准;GPT‑4 同时担任评分者,分数不是准确率。[来源:论文表 4,第 7 页]

ScienceQA 提供了另一类证据。LLaVA 单模型准确率为 90.92%,接近论文引用的当时 MM‑CoT Large 的 91.68%;让文本 GPT‑4 在答案冲突时结合两边结果再裁决,组合达到 92.53%。预训练消融也很关键:跳过阶段一后从 90.92% 降至 85.81%,绝对下降 5.11 个百分点,支持“先做跨模态对齐”的必要性。[来源:论文表 7–8,第 8–9 页]

但这些结果不能自动推出“模型可靠理解任意图片”。LLaVA-Bench(COCO)只有 30 张图、90 个问题;候选回答由文本 GPT‑4 打分,而参考回答也由文本 GPT‑4 基于人工文字描述生成,存在同源评测偏差的可能。ScienceQA 的 92.53% 又是 LLaVA 与 GPT‑4 组合系统的结果,不能归给 LLaVA 单模型。作者也明确列出视觉幻觉、偏见、细粒度视觉理解、评测稳健性与规模化能耗等风险。[来源:论文 §5.1–5.2,第 6–9 页;附录 A,第 14 页]

五、实际意义:把“数据配方”当作产品能力的一部分

对产品团队,这篇论文最重要的启示是:如果希望助手在同一图像上完成问答、解释、比较或推理,不能只堆积图文字幕;训练数据必须显式呈现用户意图和合适的回答方式。投影层的简单设计也说明,早期原型可以先验证数据配方与交互任务,不必一开始就设计复杂的跨模态连接器。

但这是基于论文结果的产品解读,不是作者已经验证的部署结论。真实应用仍需单独测试高分辨率细节、幻觉、拒答、安全、公平性、延迟和成本;医疗等高风险场景尤其不能把流畅解释等同于事实正确。[依据:论文附录 A 的风险讨论;产品含义为本文解释]


研究附录

证据账本

主张精确证据来源判断
数据生成规模158K:58K 对话、23K 详述、77K 推理§3,第 4 页作者报告
对齐预训练规模过滤 CC3M 得 595K 图文对§4.2,第 5 页作者报告
聊天训练计算8×A100;预训练 1 epoch;指令微调 3 epochs§5,第 5 页实验配置
指令微调有效完整数据 85.1;无指令微调 21.5表 4,第 7 页强消融证据,但 GPT‑4 评测
ScienceQA 单模型LLaVA 90.92%表 7,第 8 页准确率
ScienceQA 组合系统LLaVA + GPT‑4 裁判 92.53%表 7,第 8 页不等于 LLaVA 单模型
阶段一的作用跳过预训练后 85.81%,下降 5.11 个百分点表 8,第 9 页强消融证据
未解决风险幻觉、偏见、能耗、评测复杂性、细粒度理解附录 A,第 14 页作者明确限制

术语小抄

  • 视觉指令微调(visual instruction tuning):用“图像 + 自然语言指令 + 回答”继续训练模型,使它学会按用户意图处理视觉输入。
  • 视觉词元(visual tokens):由图像特征投影得到、可与文本词嵌入一起送入语言模型的向量序列;它们不是普通可读文字。
  • 端到端训练:回答损失可以更新投影层和语言模型,而不是在多个独立工具之间手工编排流程。本论文中视觉编码器仍保持冻结。
  • 相对分:论文用 GPT‑4 对候选回答和参考回答分别打 1–10 分,再比较;它不是标准分类准确率。

阅读时应继续追问

  1. 如果裁判不再是 GPT‑4,模型排序和 85.1 相对分是否仍稳定?
  2. 训练答案由 GPT‑4 生成、评测又由 GPT‑4 完成,会产生多大同源偏好?
  3. 约 80K 张图能否覆盖文字识别、细粒度定位、跨文化场景和长尾概念?
  4. 复杂推理答案是否真的基于图像,还是在复述字幕后依赖语言先验?
  5. 在真实产品中,怎样分别测量视觉幻觉、事实错误与指令不遵循?

不确定项

  • 论文报告 GPT‑4 生成的数据质量持续优于 ChatGPT,尤其在空间推理上,但正文没有给出该比较的量化表格,因此不应解读为已测得的固定优势。[来源:§3,第 4 页]
  • “类似多模态 GPT‑4 的行为”主要来自少量定性案例与 GPT‑4 打分,不能视为能力等价。[来源:摘要;§5.1]
  • 论文的版本与基线属于 2023 年研究环境;本文只解释该论文声称并测量的内容,不把“当时 SoTA”外推为今天的模型排名。

编辑自检(0–2 分)

项目分数核验
核心想法2开篇可复述数据改造与模型桥接
来源扎根2主要数字均带章节、表格或页码
压缩2摘要、方法、证据各自承担不同问题
机制2输入、转换、训练控制与输出完整
证据2结果与产品解释明确分开
局限2评测依赖、幻觉、偏见、成本均说明
视觉目的2三图分别降低数据、训练、边界理解负担
视觉准确2箭头与训练状态和正文一致
阅读流2不打开附录也能理解贡献
中文质量2术语首次出现均用白话解释
总分20/20高于 16/20,且来源扎根与视觉准确无零分

关于这篇论文的三个关键问题

让模型不只“看图说话”:LLaVA 与视觉指令微调 解决了什么问题?

当时不少视觉语言模型已经能为图片写字幕,或在特定任务上分类、检测、分割,但任务往往由模型结构预先限定,交互接口也较固定。用户若改问“哪里不寻常”“为什么会这样”或“请分步骤解释”,模型可能仍只复述画面。论文要解决的问题是:如何让一个端到端视觉语言模型,把自然语言当作统一任务接口,针对同一张图执行不同指令?[来源:论文 §1,第 1–2 页]

让模型不只“看图说话”:LLaVA 与视觉指令微调 的核心结论有哪些证据?

ScienceQA 提供了另一类证据。LLaVA 单模型准确率为 90.92%,接近论文引用的当时 MM‑CoT Large 的 91.68%;让文本 GPT‑4 在答案冲突时结合两边结果再裁决,组合达到 92.53%。预训练消融也很关键:跳过阶段一后从 90.92% 降至 85.81%,绝对下降 5.11 个百分点,支持“先做跨模态对齐”的必要性。[来源:论文表 7–8,第 8–9 页]

阅读 让模型不只“看图说话”:LLaVA 与视觉指令微调 时最需要注意什么局限?

但这些结果不能自动推出“模型可靠理解任意图片”。LLaVA-Bench(COCO)只有 30 张图、90 个问题;候选回答由文本 GPT‑4 打分,而参考回答也由文本 GPT‑4 基于人工文字描述生成,存在同源评测偏差的可能。ScienceQA 的 92.53% 又是 LLaVA 与 GPT‑4 组合系统的结果,不能归给 LLaVA 单模型。作者也明确列出视觉幻觉、偏见、细粒度视觉理解、评测稳健性与规模化能耗等风险。[来源:论文 §5.1–5.2,第 6–9 页;附录 A,第 14 页]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro