先这样答
构建 Agent 轨迹评测集,要把结果层和步骤层分开标注、分别评分,再用失败样本定位具体走歪的步骤。结果层标注最终答案的对错,并明确什么样的答案算正确。步骤层标注轨迹中的关键节点,判断 Agent 在每一步是否做了正确的行为。
步骤层要覆盖关键决策点。比如,这一步是否调用了正确的工具,是否在应该澄清时先向用户澄清。这样评测不只看最后答对还是答错,也能看到 Agent 是在哪一步开始偏离预期。
数据来源可以分成两部分。一部分来自线上真实轨迹采样,保留实际运行中的问题。另一部分由人工构造边界场景,用来覆盖真实轨迹不容易出现的情况。评测时对结果层和步骤层分别打分。失败样本要回到轨迹中,定位是哪一步走歪。修复后的 bad case 再回流进评测集,用来防止同类问题再次出现。
面试官会怎么追问
-
「为什么不能只看最终答案?」
只看最终答案,只能知道结果对不对,不能知道 Agent 的过程是否正确。步骤层可以检查关键节点的行为,比如工具调用和是否需要澄清。这样失败样本才能定位到具体步骤。 -
「步骤层具体标注什么内容?」
步骤层标注关键节点上的正确行为。可以标注这一步该调用哪个工具,也可以标注这一步是否应该先澄清。标注内容要围绕轨迹中的关键决策点。 -
「评测集里的样本从哪里来?怎么持续维护?」
样本一部分来自线上真实轨迹采样,另一部分来自人工构造的边界场景。评测发现失败后,要定位具体走歪的步骤。bad case 回流进评测集,后续用来防回归。
回答的坑
-
只讲最终答案是否正确,不讲步骤层标注和分别评分,就无法定位 Agent 到底在哪一步出了问题。
-
只靠线上真实轨迹,不补人工构造的边界场景,评测集就难以覆盖关键情况。
同系列的题