Q909评测与可观测真题解析评测AgentAlpha 社区真题库约 4 分钟更新 2026-09-29

如何评估一个 Agent 的能力?有哪些常用指标

如何评估一个 Agent 的能力?有哪些常用指标

配图(无描述)

1️⃣ 考察意图

面试官想看你能否从任务完成、效率、安全三个维度构建完整的评估指标体系。刁钻点:很多人只答"准确率",但 Agent 评估需要多维度指标——不仅要"做对",还要"高效"和"安全"。

2️⃣ 标准答

Agent 评估指标分四维度:

维度指标计算方式目标值
效果任务完成率(Success Rate)成功任务数/总任务数>85%
效果步骤准确率(Step Accuracy)正确步骤数/总步骤数>90%
效率平均步数(Avg Steps)完成任务的平均步骤数越少越好
效率平均延迟(Avg Latency)从输入到完成的总时间<5s
效率Token消耗(Avg Tokens)完成任务消耗的LLM token数<5,\mathrm{k}
安全危险操作拒绝率正确拒绝危险操作的比例>95%
安全误拒率(Normal Reject Rate)正常操作被误判为危险的比例<5%
安全幻觉率(Hallucination Rate)编造工具/API/事实的比例<10%

指标间Trade-off:

  • 准确率 vs 效率:步数多可能更准但更慢。需要找平衡点
  • 安全 vs 可用性:拒绝率高→安全但用户体验差。误拒率需控制<5%
  • Token消耗 vs 效果:更多token可能更准但成本高。需优化prompt减少token

3️⃣ 答题模板

"四维度指标:效果(任务完成率>85%+步骤准确率>90%)、效率(平均步数+延迟<5s+Token<5K)、安全(拒绝率>95%+误拒率<5%+幻觉率<10%)。Trade-off:准确率vs效率(步数多更准但更慢)、安全vs可用性(拒绝率高体验差)、Token vs效果(更多token更准但贵)。"

4️⃣ 高频追问

追问 1:任务完成率怎么定义"成功"?

三种标准:(1) 精确匹配——Agent输出与expected output完全一致。适合结构化任务(如SQL查询);(2) 语义匹配——用BERTScore或GPT-4判断语义相似度>阈值。适合开放式任务(如回答问题);(3) 状态验证——检查环境状态是否达到目标(如文件是否创建、邮件是否发送)。适合操作类任务。选择:优先用状态验证(最可靠),其次语义匹配,最后精确匹配。

追问 2:Token消耗为什么是重要指标?

Token消耗直接影响成本和延迟。GPT-4 0.03/1K input token,如果每个任务消耗10K token,成本0.3/任务。日活10万用户=每日$3万。优化方案:(1) 压缩上下文——用摘要替代完整历史;(2) 减少工具描述——只提供相关工具的描述;(3) 缓存——相同查询复用之前的推理结果。目标:单任务<5K token。

5️⃣ 避坑

  • ❌ "只看任务完成率就行" → ✅ "完成率95%但每任务消耗50K token、延迟30s、有3%幻觉率,仍然不可用。需要四维度综合评估。"

6️⃣ 简历呼应

  • 有评估经验:从"多维度评估体系"切入
  • 校招无项目:为一个简单Agent设计评估指标dashboard
  • "Evaluating LLM-based Agents" (Wang et al., 2024)

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。