如何评估一个 Agent 的能力?有哪些常用指标
配图(无描述)
1️⃣ 考察意图
面试官想看你能否从任务完成、效率、安全三个维度构建完整的评估指标体系。刁钻点:很多人只答"准确率",但 Agent 评估需要多维度指标——不仅要"做对",还要"高效"和"安全"。
2️⃣ 标准答
Agent 评估指标分四维度:
| 维度 | 指标 | 计算方式 | 目标值 |
|---|---|---|---|
| 效果 | 任务完成率(Success Rate) | 成功任务数/总任务数 | >85% |
| 效果 | 步骤准确率(Step Accuracy) | 正确步骤数/总步骤数 | >90% |
| 效率 | 平均步数(Avg Steps) | 完成任务的平均步骤数 | 越少越好 |
| 效率 | 平均延迟(Avg Latency) | 从输入到完成的总时间 | <5s |
| 效率 | Token消耗(Avg Tokens) | 完成任务消耗的LLM token数 | <5,\mathrm{k} |
| 安全 | 危险操作拒绝率 | 正确拒绝危险操作的比例 | >95% |
| 安全 | 误拒率(Normal Reject Rate) | 正常操作被误判为危险的比例 | <5% |
| 安全 | 幻觉率(Hallucination Rate) | 编造工具/API/事实的比例 | <10% |
指标间Trade-off:
- 准确率 vs 效率:步数多可能更准但更慢。需要找平衡点
- 安全 vs 可用性:拒绝率高→安全但用户体验差。误拒率需控制<5%
- Token消耗 vs 效果:更多token可能更准但成本高。需优化prompt减少token
3️⃣ 答题模板
"四维度指标:效果(任务完成率>85%+步骤准确率>90%)、效率(平均步数+延迟<5s+Token<5K)、安全(拒绝率>95%+误拒率<5%+幻觉率<10%)。Trade-off:准确率vs效率(步数多更准但更慢)、安全vs可用性(拒绝率高体验差)、Token vs效果(更多token更准但贵)。"
4️⃣ 高频追问
追问 1:任务完成率怎么定义"成功"?
三种标准:(1) 精确匹配——Agent输出与expected output完全一致。适合结构化任务(如SQL查询);(2) 语义匹配——用BERTScore或GPT-4判断语义相似度>阈值。适合开放式任务(如回答问题);(3) 状态验证——检查环境状态是否达到目标(如文件是否创建、邮件是否发送)。适合操作类任务。选择:优先用状态验证(最可靠),其次语义匹配,最后精确匹配。
追问 2:Token消耗为什么是重要指标?
Token消耗直接影响成本和延迟。GPT-4 0.03/1K input token,如果每个任务消耗10K token,成本0.3/任务。日活10万用户=每日$3万。优化方案:(1) 压缩上下文——用摘要替代完整历史;(2) 减少工具描述——只提供相关工具的描述;(3) 缓存——相同查询复用之前的推理结果。目标:单任务<5K token。
5️⃣ 避坑
- ❌ "只看任务完成率就行" → ✅ "完成率95%但每任务消耗50K token、延迟30s、有3%幻觉率,仍然不可用。需要四维度综合评估。"
6️⃣ 简历呼应
- 有评估经验:从"多维度评估体系"切入
- 校招无项目:为一个简单Agent设计评估指标dashboard
- "Evaluating LLM-based Agents" (Wang et al., 2024)
—— 本场面试完 ——