先这样答
我会分层设计评估体系。Planning 主要看任务完成率、步骤效率和工具选择准确率。任务完成率看 Agent 是否完成目标。步骤效率把实际步骤和最优路径对比。工具选择准确率看它是否在当前步骤选对工具。
幻觉率要做事实核查、自洽性检查和人工抽样。事实核查把输出和知识库对比,检查内容是否有事实依据。自洽性检查通过多次采样,看同一问题的回答是否一致。人工抽样用于检查自动指标没有覆盖到的错误。
整体结果还要看端到端成功率、满意度、延迟和 token 成本。端到端成功率看完整任务是否成功。满意度反映用户对结果的接受程度。延迟和 token 成本反映使用代价。这样既能看 Planning 的过程质量,也能看最终结果和实际使用表现。
面试官会怎么追问
-
「步骤效率里的最优路径怎么确定?」
可以先为任务定义可接受的完成路径,再用其中的最短或最优路径作为对比标准。评估时比较 Agent 的实际步骤和这条路径的差异。重点看它是否完成任务,以及是否增加了不必要的步骤。 -
「只看任务完成率,能判断 Planning 好不好吗?」
不能。任务完成了,不代表步骤合理,也不代表工具选得对。还要结合步骤效率和工具选择准确率,分别检查路径质量和工具使用质量。 -
「幻觉率为什么不能只靠知识库核查?」
知识库核查可以检查输出是否有事实依据,但不能覆盖所有问题。还要用多次采样做自洽性检查,并通过人工抽样发现自动检查遗漏的错误。
回答的坑
只报端到端成功率,会掩盖步骤冗余和工具选择错误。
只用知识库核查判断幻觉率,会漏掉回答不一致和自动检查未覆盖的问题。
同系列的题
这家公司的面经实录
相关深度笔记