返回报告库

AI / Technology

让模型不只“看图说话”LLaVA 与视觉指令微调

关于这篇论文的三个关键问题

让模型不只“看图说话”:LLaVA 与视觉指令微调 解决了什么问题?

当时不少视觉语言模型已经能为图片写字幕,或在特定任务上分类、检测、分割,但任务往往由模型结构预先限定,交互接口也较固定。用户若改问“哪里不寻常”“为什么会这样”或“请分步骤解释”,模型可能仍只复述画面。论文要解决的问题是:如何让一个端到端视觉语言模型,把自然语言当作统一任务接口,针对同一张图执行不同指令?[来源:论文 §1,第 1–2 页]

让模型不只“看图说话”:LLaVA 与视觉指令微调 的核心结论有哪些证据?

ScienceQA 提供了另一类证据。LLaVA 单模型准确率为 90.92%,接近论文引用的当时 MM‑CoT Large 的 91.68%;让文本 GPT‑4 在答案冲突时结合两边结果再裁决,组合达到 92.53%。预训练消融也很关键:跳过阶段一后从 90.92% 降至 85.81%,绝对下降 5.11 个百分点,支持“先做跨模态对齐”的必要性。[来源:论文表 7–8,第 8–9 页]

阅读 让模型不只“看图说话”:LLaVA 与视觉指令微调 时最需要注意什么局限?

但这些结果不能自动推出“模型可靠理解任意图片”。LLaVA-Bench(COCO)只有 30 张图、90 个问题;候选回答由文本 GPT‑4 打分,而参考回答也由文本 GPT‑4 基于人工文字描述生成,存在同源评测偏差的可能。ScienceQA 的 92.53% 又是 LLaVA 与 GPT‑4 组合系统的结果,不能归给 LLaVA 单模型。作者也明确列出视觉幻觉、偏见、细粒度视觉理解、评测稳健性与规模化能耗等风险。[来源:论文 §5.1–5.2,第 6–9 页;附录 A,第 14 页]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro