评估评估Agent更新 2026-09-28

Agent 评估Agent Evaluation

一句话定义

Agent 评估是衡量 Agent 运行质量的工程机制。以任务成功率为主指标,同时考察工具选择、执行步数、是否死循环等轨迹质量,以及成本延迟等资源消耗。该机制依赖离线固定题集与线上监控协同运作。

是什么

Agent 评估的指标分为三个层次。结果层关注任务成功率与最终答案质量。过程层考察工具选择正确率、规划合理性、步数效率以及死循环率。资源层衡量 token 成本、延迟和人工介入率。

评估方法包含固定题集回归测试、LLM-as-a-Judge 打分与轨迹比对。线上依靠人工抽检与用户反馈监控,错误案例会归因并补充至离线评测集。

机制难点在于多步任务中常出现结果正确但过程错误的情况。模型输出的随机性会导致分数波动。同时,评测集必须跟随业务需求动态更新。

解决什么问题

解决了系统迭代缺乏方向的问题。工程师修改提示词或更换底层模型后,需要明确知晓改动使整体效果变好还是变坏。

如果没有这套机制,Agent 系统的更新就等同于盲改。评估机制确保每次修改有数据支撑,避免局部优化导致其他任务表现下降。

面试怎么考

面试常考任务成功率之外的指标。答题时应补充过程层面的工具调用和规划质量,以及资源层面的成本和延迟。

考官常问 LLM-as-a-Judge 和固定题集的优缺点。答题需指出前者适合主观评价,后者标准稳定。从零构建基准测试与评测集动态更新也是高频考点,需强调线上错误案例回流,说明如何将真实场景转化为离线用例。

又称:Agent 评估 · Agent 评测 · Agent Evaluation

—— 本条完 ——