Q910评测与可观测真题解析评测AgentAlpha 社区真题库约 4 分钟更新 2026-09-29

Agent 评估与 LLM 评估有什么不同

Agent 评估与 LLM 评估有什么不同

配图(无描述)

1️⃣ 考察意图

考察对两种评估范式的区分能力。刁钻点:Agent评估不是LLM评估的简单扩展——需要评估"行为序列"而非"单次输出"。

2️⃣ 标准答

维度LLM评估Agent评估
评估对象单次文本输出多步行为序列
环境无环境(输入→输出)有环境(状态变化)
指标BLEU/ROUGE/准确率任务完成率+步骤准确率+效率+安全
交互单轮多轮(5-50步)
工具无工具有工具调用(参数+结果解析)
副作用无(纯文本输出)有(文件操作/邮件发送/API调用)
可复现性高(相同输入→相同输出)低(环境状态+随机性)
评估成本低(自动匹配)高(需要环境+状态验证)

核心区别:Agent评估需要"环境"和"副作用"

  • LLM评估:输入文本 → LLM → 输出文本 → 用BLEU/ROUGE评估输出质量
  • Agent评估:输入指令 → Agent → [工具调用1 → 环境反馈1 → 工具调用2 → ...] → 最终状态 → 检查环境状态是否达到目标

Agent特有的评估挑战:

  1. 长程效应:第1步的错误可能在第10步才显现
  2. 路径多样性:同一任务可以有多种完成路径,不是唯一正确答案
  3. 环境依赖:同一Agent在不同环境中的表现可能不同
  4. 安全评估:需要评估Agent是否执行了不该执行的操作

3️⃣ 答题模板

"核心区别:LLM评估单次文本输出(BLEU/ROUGE),Agent评估多步行为序列(任务完成率+步骤准确率+效率+安全)。Agent评估需要环境和副作用管理——不仅要'输出对',还要'操作对'。特有挑战:长程效应(第1步错误第10步才显现)、路径多样性(多种正确路径)、环境依赖、安全评估。"

4️⃣ 高频追问

追问 1:Agent评估为什么可复现性低?

两个原因:(1) 环境状态变化——Agent的第2步行为依赖第1步的环境反馈,如果环境有随机性(如API返回顺序不同),后续步骤可能不同;(2) LLM的随机性——temperature>0时,相同输入可能产生不同输出。提高可复现性:(1) 固定环境状态——用确定性仿真环境;(2) temperature=0——牺牲多样性换取可复现性;(3) 多次运行取平均——跑5次取平均完成率。

追问 2:Agent的"路径多样性"怎么评估?

不要只看"最终状态是否正确",还要看"路径是否合理"。方法:(1) 路径评分——用LLM-as-Judge评估路径的合理性(如"是否有多余步骤"、"是否有错误尝试");(2) 最优路径对比——计算Agent路径与最优路径的编辑距离,距离越小说明效率越高;(3) 步骤效率=最优步数/实际步数。如果Agent用20步完成了一个5步就能完成的任务,步骤效率只有25%。

5️⃣ 避坑

  • ❌ "用BLEU评估Agent输出就行" → ✅ "BLEU只评估文本质量。Agent评估需要状态验证(操作是否生效)、路径评估(步骤是否合理)、安全评估(是否执行危险操作)。"

6️⃣ 简历呼应

  • 有评估经验:从"Agent评估vs LLM评估对比"切入
  • 校招无项目:对比HumanEval(LLM评估)和AgentBench(Agent评估)的评估方法差异

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。