视觉 Agent 的评估体系和纯文本 Agent 有什么不同?要多考虑哪些维度?
先这样答
纯文本 Agent 的评估围绕任务完成率、回答质量、工具使用正确率。视觉 Agent 在这之上多了六个维度。视觉定位精度:模型标出的目标框是否正确,用 IoU 衡量。空间推理:能否理解物体的相对位置关系,比如「按钮的右边」「表格第二列」。OCR 准确率:截图里的文字识别是否正确,小字号和艺术字是重灾区。多帧一致性:视频或动态场景里能否跨帧追踪同一个物体。操作生效率:GUI 场景下每一步操作是否真正命中了目标元素,点了不等于点对了。视觉幻觉:看到图中不存在的东西、误读不存在的文字。
方法分三层。Benchmark 层用公开数据集做横向对比,GUI 定位有 ScreenSpot,通用多模态理解有 MMMU,网页操作有 VisualWebArena。自动化测试层:录制标准操作流程,让 Agent 执行同样的任务,逐步对比它的操作序列和标准答案。人工评估层:复杂场景的输出质量还是需要人来判断,尤其是那些标准答案写不全的开放任务。
面试官会怎么追问
- 「视觉幻觉怎么量化?」 抽取模型输出里对画面的所有事实性描述,逐条回到原图核对,描述了不存在物体或错误文字的记为幻觉,报告幻觉条数占比。可以直接复用「按图索骥」的核对思路。
- 「操作生效率和任务完成率有什么区别?」 任务完成率是端到端结果,操作生效率是过程指标。一个任务可能前九步都对、最后一步点偏导致失败,只看任务完成率定位不到问题在哪一步。过程指标用来归因。
- 「自动对比操作序列有什么坑?」 同一个任务有多条正确路径,逐步严格 diff 会把合理的替代操作判错。所以对比要做语义对齐,允许等价动作,或者只校验关键状态节点而不是每一步。
回答的坑
- 把评估说成只跑 benchmark 分数。产品迭代要的是能归因的分层指标,不是一个总分。
- 不区分「点到了元素」和「点对了元素」。坐标命中但语义理解错的情况,只有状态验证能抓到。
同系列的题
—— 本题完 ——