五厂面经真题集腾讯面经高频腾讯真题轨迹评测Agent评测速答 · 约 5 分钟更新 2026-09-29

怎么构建 Agent 轨迹评测集,同时评估最终结果与中间步骤?

一句话结论

把 Agent 轨迹按结果层和步骤层分别标注、分别评分,再用失败样本定位走歪的步骤,并持续回流 bad case 防回归。

先这样答

构建 Agent 轨迹评测集,要把结果层和步骤层分开标注、分别评分,再用失败样本定位具体走歪的步骤。结果层标注最终答案的对错,并明确什么样的答案算正确。步骤层标注轨迹中的关键节点,判断 Agent 在每一步是否做了正确的行为。

步骤层要覆盖关键决策点。比如,这一步是否调用了正确的工具,是否在应该澄清时先向用户澄清。这样评测不只看最后答对还是答错,也能看到 Agent 是在哪一步开始偏离预期。

数据来源可以分成两部分。一部分来自线上真实轨迹采样,保留实际运行中的问题。另一部分由人工构造边界场景,用来覆盖真实轨迹不容易出现的情况。评测时对结果层和步骤层分别打分。失败样本要回到轨迹中,定位是哪一步走歪。修复后的 bad case 再回流进评测集,用来防止同类问题再次出现。

面试官会怎么追问

  • 「为什么不能只看最终答案?」
    只看最终答案,只能知道结果对不对,不能知道 Agent 的过程是否正确。步骤层可以检查关键节点的行为,比如工具调用和是否需要澄清。这样失败样本才能定位到具体步骤。

  • 「步骤层具体标注什么内容?」
    步骤层标注关键节点上的正确行为。可以标注这一步该调用哪个工具,也可以标注这一步是否应该先澄清。标注内容要围绕轨迹中的关键决策点。

  • 「评测集里的样本从哪里来?怎么持续维护?」
    样本一部分来自线上真实轨迹采样,另一部分来自人工构造的边界场景。评测发现失败后,要定位具体走歪的步骤。bad case 回流进评测集,后续用来防回归。

回答的坑

  • 只讲最终答案是否正确,不讲步骤层标注和分别评分,就无法定位 Agent 到底在哪一步出了问题。

  • 只靠线上真实轨迹,不补人工构造的边界场景,评测集就难以覆盖关键情况。

—— 本题完 ——