Q928多模态真题解析多模态AgentAlpha 社区真题库约 4 分钟更新 2026-09-29

多模态 Agent 的 Prompt Engineering 和纯文本有什么不同

多模态 Agent 的 Prompt Engineering 和纯文本有什么不同

1️⃣ 考察意图

考察多模态 prompt 的特殊技巧。刁钻点:多模态 prompt 不只是"加图片",还涉及图像位置、多图管理、视觉引导等。

2️⃣ 标准答

三个核心差异:

1. 图像位置影响效果

  • 图像放在 prompt 开头([IMG] 指令文本)效果最好——LLM 先"看"图再理解指令
  • 图像放在中间(文本 [IMG] 文本)适合多图交错场景
  • 图像放在结尾(指令文本 [IMG])效果最差——LLM 可能先"决定"了回答方向再"看"图

2. 视觉引导提示

  • 纯文本 prompt:直接写指令
  • 多模态 prompt:可以加"视觉引导",如"请仔细看图中左上角的文字"或"先描述你看到的,再回答问题"
  • 思维链(CoT)在多模态中更有效:让 VLM 先描述图像内容,再做推理

3. 多图管理

  • 多图 prompt 需要明确标注每张图的角色:图1(产品截图):[IMG1] 图2(设计稿):[IMG2] 请对比两者的差异
  • 避免混淆:不超过 4 张图(LLaVA 建议),超过用分组处理

示例对比:

纯文本 prompt: "总结以下文本的核心观点:{text}"**多模态 prompt: "[IMG] 请先描述这张图表的内容(包括图表类型、坐标轴、数据趋势), 然后总结核心发现,最后给出数据驱动的建议"

3️⃣ 答题模板

"三个差异。第一,图像位置——开头最好(先看图再理解指令),结尾最差。第二,视觉引导——加'先描述再推理'的 CoT,比直接问效果高 5-10%。第三,多图管理——明确标注角色('图1是产品截图,图2是设计稿'),不超过 4 张。"

4️⃣ 高频追问

追问 1**:多模态 CoT 具体怎么写?

格式:[IMG] 请按以下步骤回答:1. 描述图像中的关键元素 2. 分析元素之间的关系 3. 基于分析回答问题:{question}。效果:在 MMMU 上比直接问高 8-12%。关键:让 VLM 先"看"再"想",避免直接跳到结论。

追问 2:Few-shot 在多模态 prompt 中怎么用?

提供几个"图像+问题+答案"的示例。格式:示例1:[IMG1] Q: ... A: ... 示例2:[IMG2] Q: ... A: ... 现在请回答:[IMG3] Q: ...。注意:示例图像应与目标图像在领域和复杂度上接近。局限:每个示例的图像 token 占上下文,3 个示例就消耗 768 token。

5️⃣ 避坑

  • ❌ "把图像放在 prompt 最后就行" → ✅ "图像位置影响效果。开头最好,结尾最差。多图交错时用 Qwen-VL 的交错格式。"

6️⃣ 简历呼应

  • 有 VLM 应用经验:从"prompt 优化实验"切入,对比不同图像位置和 CoT 格式的效果
  • 校招无项目:在 LLaVA 上测试不同 prompt 模板在 VQA 上的效果
  • "Visual Prompt Engineering: A Survey" (Zhang et al., 2024)

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。