五厂面经真题集蚂蚁集团面经高频蚂蚁集团真题大模型面试Agent评测速答 · 约 5 分钟更新 2026-09-29

Agent 评测体系怎么建?线上和线下评测怎么协同?

一句话结论

用线下黄金集回归和分层能力评测守住基础质量,再用线上灰度与 A/B 验证真实任务效果,并把 bad case 回流线下、定期校准离线分数和在线指标。

先这样答

Agent 评测要把线下回归、能力评测和线上验证放在一起。线下先跑黄金集回归,保证改版后基础能力不退化。这个回归是每次改版都要跑的固定检查。

线下还要做加分能力评测,并按检索、工具、生成分层。这样可以分别看出 Agent 在不同能力上的表现。线上采用灰度加 A/B,主指标看任务成功率。安全、延迟、成本作为护栏指标,防止只追求成功率而带来其他问题。

线上和线下通过 bad case 互相连接。线上发现的 bad case 要清洗后回流到线下集,补充后续回归。离线分数和在线指标要定期对齐校准,确认线下结果能反映线上任务表现。这样,改版先在线下检查,再在线上验证,线上问题继续回到线下处理。

面试官会怎么追问

  • 「为什么不能只看线上的任务成功率?」
    线上任务成功率是主指标,但不能覆盖所有问题。还要看安全、延迟和成本这些护栏指标。只看成功率,可能会漏掉其他质量风险。

  • 「线下评测具体怎么拆能力?」
    线下先跑黄金集回归,确认改版没有造成基础能力退化。再做加分能力评测,按检索、工具、生成分层。这样能定位问题属于哪一类能力。

  • 「线上 bad case 回流后,怎么判断线下集是否有效?」
    先清洗线上 bad case,再加入线下集,作为后续回归样本。之后定期对齐离线分数和在线指标。如果两者出现偏差,就继续校准评测集和判断方式。

回答的坑

  • 只讲黄金集回归,不讲线上灰度和 A/B,无法说明评测结果是否对应真实任务效果。
  • 只看任务成功率,不看安全、延迟、成本,评测结论就不完整。
—— 本题完 ——