先这样答
Agent 评测要把线下回归、能力评测和线上验证放在一起。线下先跑黄金集回归,保证改版后基础能力不退化。这个回归是每次改版都要跑的固定检查。
线下还要做加分能力评测,并按检索、工具、生成分层。这样可以分别看出 Agent 在不同能力上的表现。线上采用灰度加 A/B,主指标看任务成功率。安全、延迟、成本作为护栏指标,防止只追求成功率而带来其他问题。
线上和线下通过 bad case 互相连接。线上发现的 bad case 要清洗后回流到线下集,补充后续回归。离线分数和在线指标要定期对齐校准,确认线下结果能反映线上任务表现。这样,改版先在线下检查,再在线上验证,线上问题继续回到线下处理。
面试官会怎么追问
-
「为什么不能只看线上的任务成功率?」
线上任务成功率是主指标,但不能覆盖所有问题。还要看安全、延迟和成本这些护栏指标。只看成功率,可能会漏掉其他质量风险。 -
「线下评测具体怎么拆能力?」
线下先跑黄金集回归,确认改版没有造成基础能力退化。再做加分能力评测,按检索、工具、生成分层。这样能定位问题属于哪一类能力。 -
「线上 bad case 回流后,怎么判断线下集是否有效?」
先清洗线上 bad case,再加入线下集,作为后续回归样本。之后定期对齐离线分数和在线指标。如果两者出现偏差,就继续校准评测集和判断方式。
回答的坑
- 只讲黄金集回归,不讲线上灰度和 A/B,无法说明评测结果是否对应真实任务效果。
- 只看任务成功率,不看安全、延迟、成本,评测结论就不完整。
同系列的题
—— 本题完 ——