如何评估多模态模型的「理解「能力?有哪些指标和 Benchmark
1️⃣ 考察意图
面试官想看你能否设计一个全面的多模态评估方案,而非只说"跑 VQA 准确率"。刁钻点在于:多模态评估面临"评估覆盖面"和"评估深度"的矛盾——简单 benchmark(如 VQA v2)只测感知能力,复杂 benchmark(如 MMMU)测推理但数据量小。答好了能展示你的评估方法论。
2️⃣ 标准答
多模态理解能力评估分四个维度,每个维度有专属 benchmark:
1. 视觉感知能力(Visual Perception)
- VQA v2:视觉问答——给定图像和问题,生成答案。准确率指标。2M+ 问题,覆盖物体识别、颜色、数量、位置等
- GQA:场景图问答——基于图像的场景图(物体+关系+属性)构建问题。比 VQA v2 更注重推理
- TextVQA:文本视觉问答——需要读取图像中的文字(如路牌、标签、屏幕)。评估 OCR + 推理能力
- DocVQA:文档视觉问答——理解文档结构(表格、表单、图表)。评估文档理解能力
- 关键指标:准确率(Accuracy),但 VQA v2 用"soft accuracy"(多个人工标注答案都算对)
2. 视觉推理能力(Visual Reasoning)
- MMMU(Massive Multi-discipline Multimodal Understanding):大学级别多学科多模态理解,覆盖 30 个学科(如艺术、商业、医学),需要专业知识 + 视觉推理。115K 题
- MMBench:多模态综合能力 benchmark,覆盖 20 个能力维度(如属性识别、关系推理、逻辑推理)。4K+ 题,中英双语
- SEED-Bench:多场景多模态评估,覆盖图像、视频、多图场景。19K 题
- 关键指标:准确率,但按能力维度分拆报告(如"属性识别 85%、关系推理 72%、逻辑推理 65%")
3. 多模态指令遵循能力(Instruction Following)
- MM-Vet:综合评估 VLM 的 6 个核心能力(识别、空间感知、数学、逻辑推理、语言生成、视觉-语言对齐),用 GPT-4 评分
- LLaVA-Bench(Wild):真实场景图文问答,用 GPT-4 对模型输出打分(1-100 分)
- MT-Bench Multimodal:多轮多模态对话,评估对话连贯性和视觉一致性
- 关键指标:GPT-4 评分(1-100),但需注意 LLM-as-Judge 的局限性
4. Agent 场景能力(Agent-Specific)
- VisualWebBench:网页理解——给定网页截图,回答关于布局、内容、交互的问题
- ScreenSpot:屏幕交互——给定 UI 截图和指令(如"点击设置按钮"),评估是否正确定位
- Mind2Web:网页 Agent 评估——在真实网页上完成多步任务
- 关键指标:任务完成率、步骤准确率、定位准确率
Benchmark 选择矩阵:
| 评估目标 | 推荐 Benchmark | 数据量 | 评估方式 | 适用模型 |
|---|---|---|---|---|
| 基础感知 | VQA v2 | 2M+ | 准确率 | 所有 VLM |
| OCR能力 | TextVQA | 45K | 准确率 | LLaVA/Qwen-VL |
| 推理能力 | MMMU | 115K | 准确率 | GPT-4V/Gemini |
| 综合能力 | MMBench | 4K+ | 准确率(分维度) | 所有 VLM |
| 指令遵循 | MM-Vet | 200+ | GPT-4评分 | 所有 VLM |
| Agent能力 | Mind2Web | 2K+ | 任务完成率 | Agent系统 |
3️⃣ 答题模板(30 秒电梯版)
"多模态评估分四维度。感知能力用 VQA v2(2M题,准确率)和 TextVQA(OCR)。推理能力用 MMMU(115K题,大学级别跨学科)和 MMBench(4K题,分20个维度)。指令遵循用 MM-Vet(GPT-4 评分1-100)和 LLaVA-Bench(真实场景)。Agent 能力用 Mind2Web(任务完成率)。选型:基础评估用 VQA v2+MMBench,深度评估用 MMMU+MM-Vet,Agent 评估用 Mind2Web。注意 LLM-as-Judge 的局限性。"
4️⃣ 高频追问 & 应对
追问 1:VQA v2 的准确率怎么计算?多个正确答案怎么处理?
VQA v2 用"soft accuracy":对于每个问题,收集 10 个人工标注答案,如果模型的输出与其中 ≥3 个标注一致,得 1 分;如果与 1-2 个一致,得 0.3 分;都不一致得 0 分。这比严格匹配更公平,因为有些问题有多种合理答案(如"什么颜色"可以答"蓝"或"深蓝")。局限:(1) 标注偏差——10 个标注者可能都是英语母语,对非英语答案不公平;(2) 简短答案——VQA v2 只接受单词/短语,不接受长描述,无法评估生成质量。
追问 2:MMMU 和 MMBench 有什么区别?哪个更难?
区别:(1) MMMU 考"专业知识"——需要大学级别的学科知识(如"这张显微镜图是什么细胞"),VLM 不仅需要看图还需要"知识";(2) MMBench 考"通用能力"——分 20 个维度(如属性识别、空间推理、逻辑推理),不需要专业知识但需要更强的推理。难度:MMMU 更难——GPT-4V 在 MMMU 上只有 59.6%,在 MMBench 上 75-80%。原因:MMMU 需要知识+视觉+推理三者结合,任何一环弱都会出错。
追问 3:LLM-as-Judge 评多模态有什么问题?
三个问题:(1) 视觉盲区——GPT-4 评分时只看模型输出的文本,不看原图,无法判断"输出是否准确描述了图像";(2) 长度偏好——GPT-4 倾向给更长的回答打高分,即使内容不准确;(3) 风格偏好——GPT-4 偏好结构化输出(如"1. 2. 3."列表),即使非结构化更准确。改进:(1) 用 GPT-4V 做多模态 Judge——输入图像+模型输出+参考答案,让 GPT-4V 综合判断;(2) 人工校准——抽 10% 数据人工评分,计算 GPT-4 与人工的一致性(Cohen's Kappa),低于 0.7 则调整评分 prompt。
5️⃣ 避坑 · 常见错误答法
- ❌ "VQA v2 准确率高就说明模型好" → ✅ "VQA v2 只测基础感知能力。模型可能在 VQA v2 上 80% 但在 MMMU(推理)上只有 40%。需要多 benchmark 组合评估。"
- ❌ "用 BLEU/CIDEr 评估多模态输出就行" → ✅ "BLEU/CIDEr 只评估文本质量(n-gram 匹配),不评估视觉准确性。模型可能生成流畅但视觉错误的描述。需要结合 VQA 准确率或人工评估。"
- ❌ "Benchmark 分数高的模型一定适合我的场景" → ✅ "Benchmark 是通用评估,特定场景(如医学影像、工业检测)需要领域专属评估。通用 benchmark 高不等于领域适用。"
6️⃣ 简历呼应
- 如果你有 VLM 评估项目:从"评估方案设计"切入,描述你为特定场景(如文档理解)设计的评估 pipeline,覆盖感知+推理+指令遵循三个维度
- 如果你只做过 NLP 评估:用"NLP benchmark 迁移"——BLEU/ROUGE → CIDEr/SPICE(多模态),HumanEval → MMBench(综合能力),MT-Bench → MM-Vet(指令遵循)
- 如果你是校招无项目:在 3 个 VLM(LLaVA/Qwen-VL/GPT-4V)上跑 VQA v2 + MMMU + MMBench,对比分析各模型的优势维度
- "VQA: Visual Question Answering" (Antol et al., 2015)
- "MMMU: A Massive Multi-discipline Multimodal Understanding Benchmark" (Yue et al., 2024)
- "MMBench: Is Your Multi-modal Model an All-around Player?" (Liu et al., 2024)