Agent 评估与 LLM 评估有什么不同
配图(无描述)
1️⃣ 考察意图
考察对两种评估范式的区分能力。刁钻点:Agent评估不是LLM评估的简单扩展——需要评估"行为序列"而非"单次输出"。
2️⃣ 标准答
| 维度 | LLM评估 | Agent评估 |
|---|---|---|
| 评估对象 | 单次文本输出 | 多步行为序列 |
| 环境 | 无环境(输入→输出) | 有环境(状态变化) |
| 指标 | BLEU/ROUGE/准确率 | 任务完成率+步骤准确率+效率+安全 |
| 交互 | 单轮 | 多轮(5-50步) |
| 工具 | 无工具 | 有工具调用(参数+结果解析) |
| 副作用 | 无(纯文本输出) | 有(文件操作/邮件发送/API调用) |
| 可复现性 | 高(相同输入→相同输出) | 低(环境状态+随机性) |
| 评估成本 | 低(自动匹配) | 高(需要环境+状态验证) |
核心区别:Agent评估需要"环境"和"副作用"
- LLM评估:
输入文本 → LLM → 输出文本→ 用BLEU/ROUGE评估输出质量 - Agent评估:
输入指令 → Agent → [工具调用1 → 环境反馈1 → 工具调用2 → ...] → 最终状态→ 检查环境状态是否达到目标
Agent特有的评估挑战:
- 长程效应:第1步的错误可能在第10步才显现
- 路径多样性:同一任务可以有多种完成路径,不是唯一正确答案
- 环境依赖:同一Agent在不同环境中的表现可能不同
- 安全评估:需要评估Agent是否执行了不该执行的操作
3️⃣ 答题模板
"核心区别:LLM评估单次文本输出(BLEU/ROUGE),Agent评估多步行为序列(任务完成率+步骤准确率+效率+安全)。Agent评估需要环境和副作用管理——不仅要'输出对',还要'操作对'。特有挑战:长程效应(第1步错误第10步才显现)、路径多样性(多种正确路径)、环境依赖、安全评估。"
4️⃣ 高频追问
追问 1:Agent评估为什么可复现性低?
两个原因:(1) 环境状态变化——Agent的第2步行为依赖第1步的环境反馈,如果环境有随机性(如API返回顺序不同),后续步骤可能不同;(2) LLM的随机性——temperature>0时,相同输入可能产生不同输出。提高可复现性:(1) 固定环境状态——用确定性仿真环境;(2) temperature=0——牺牲多样性换取可复现性;(3) 多次运行取平均——跑5次取平均完成率。
追问 2:Agent的"路径多样性"怎么评估?
不要只看"最终状态是否正确",还要看"路径是否合理"。方法:(1) 路径评分——用LLM-as-Judge评估路径的合理性(如"是否有多余步骤"、"是否有错误尝试");(2) 最优路径对比——计算Agent路径与最优路径的编辑距离,距离越小说明效率越高;(3) 步骤效率=最优步数/实际步数。如果Agent用20步完成了一个5步就能完成的任务,步骤效率只有25%。
5️⃣ 避坑
- ❌ "用BLEU评估Agent输出就行" → ✅ "BLEU只评估文本质量。Agent评估需要状态验证(操作是否生效)、路径评估(步骤是否合理)、安全评估(是否执行危险操作)。"
6️⃣ 简历呼应
- 有评估经验:从"Agent评估vs LLM评估对比"切入
- 校招无项目:对比HumanEval(LLM评估)和AgentBench(Agent评估)的评估方法差异
—— 本场面试完 ——