是什么
Agent 评估的指标分为三个层次。结果层关注任务成功率与最终答案质量。过程层考察工具选择正确率、规划合理性、步数效率以及死循环率。资源层衡量 token 成本、延迟和人工介入率。
评估方法包含固定题集回归测试、LLM-as-a-Judge 打分与轨迹比对。线上依靠人工抽检与用户反馈监控,错误案例会归因并补充至离线评测集。
机制难点在于多步任务中常出现结果正确但过程错误的情况。模型输出的随机性会导致分数波动。同时,评测集必须跟随业务需求动态更新。
解决什么问题
解决了系统迭代缺乏方向的问题。工程师修改提示词或更换底层模型后,需要明确知晓改动使整体效果变好还是变坏。
如果没有这套机制,Agent 系统的更新就等同于盲改。评估机制确保每次修改有数据支撑,避免局部优化导致其他任务表现下降。
面试怎么考
面试常考任务成功率之外的指标。答题时应补充过程层面的工具调用和规划质量,以及资源层面的成本和延迟。
考官常问 LLM-as-a-Judge 和固定题集的优缺点。答题需指出前者适合主观评价,后者标准稳定。从零构建基准测试与评测集动态更新也是高频考点,需强调线上错误案例回流,说明如何将真实场景转化为离线用例。
又称:Agent 评估 · Agent 评测 · Agent Evaluation
接着做点什么
—— 本条完 ——