多模态 Agent 的 Prompt Engineering 和纯文本有什么不同
1️⃣ 考察意图
考察多模态 prompt 的特殊技巧。刁钻点:多模态 prompt 不只是"加图片",还涉及图像位置、多图管理、视觉引导等。
2️⃣ 标准答
三个核心差异:
1. 图像位置影响效果
- 图像放在 prompt 开头(
[IMG] 指令文本)效果最好——LLM 先"看"图再理解指令 - 图像放在中间(
文本 [IMG] 文本)适合多图交错场景 - 图像放在结尾(
指令文本 [IMG])效果最差——LLM 可能先"决定"了回答方向再"看"图
2. 视觉引导提示
- 纯文本 prompt:直接写指令
- 多模态 prompt:可以加"视觉引导",如"请仔细看图中左上角的文字"或"先描述你看到的,再回答问题"
- 思维链(CoT)在多模态中更有效:让 VLM 先描述图像内容,再做推理
3. 多图管理
- 多图 prompt 需要明确标注每张图的角色:
图1(产品截图):[IMG1] 图2(设计稿):[IMG2] 请对比两者的差异 - 避免混淆:不超过 4 张图(LLaVA 建议),超过用分组处理
示例对比:
纯文本 prompt: "总结以下文本的核心观点:{text}"**多模态 prompt: "[IMG] 请先描述这张图表的内容(包括图表类型、坐标轴、数据趋势), 然后总结核心发现,最后给出数据驱动的建议"
3️⃣ 答题模板
"三个差异。第一,图像位置——开头最好(先看图再理解指令),结尾最差。第二,视觉引导——加'先描述再推理'的 CoT,比直接问效果高 5-10%。第三,多图管理——明确标注角色('图1是产品截图,图2是设计稿'),不超过 4 张。"
4️⃣ 高频追问
追问 1**:多模态 CoT 具体怎么写?
格式:
[IMG] 请按以下步骤回答:1. 描述图像中的关键元素 2. 分析元素之间的关系 3. 基于分析回答问题:{question}。效果:在 MMMU 上比直接问高 8-12%。关键:让 VLM 先"看"再"想",避免直接跳到结论。
追问 2:Few-shot 在多模态 prompt 中怎么用?
提供几个"图像+问题+答案"的示例。格式:
示例1:[IMG1] Q: ... A: ... 示例2:[IMG2] Q: ... A: ... 现在请回答:[IMG3] Q: ...。注意:示例图像应与目标图像在领域和复杂度上接近。局限:每个示例的图像 token 占上下文,3 个示例就消耗 768 token。
5️⃣ 避坑
- ❌ "把图像放在 prompt 最后就行" → ✅ "图像位置影响效果。开头最好,结尾最差。多图交错时用 Qwen-VL 的交错格式。"
6️⃣ 简历呼应
- 有 VLM 应用经验:从"prompt 优化实验"切入,对比不同图像位置和 CoT 格式的效果
- 校招无项目:在 LLaVA 上测试不同 prompt 模板在 VQA 上的效果
- "Visual Prompt Engineering: A Survey" (Zhang et al., 2024)
—— 本场面试完 ——