Agent 的 A/B 测试框架怎么设计?怎么评估改动收益?

一句话结论

Agent 的 A/B 测试要按用户分桶,以任务完成率衡量收益,用安全率、延迟和成本守住护栏,再结合多轮过程指标、自动评估与人工对齐,按灰度阶段放量并支持自动回滚。

Agent 的 A/B 测试框架怎么设计?怎么评估改动收益?

先这样答

Agent 的 A/B 测试要按用户分桶,以任务完成率判断收益,用安全率、延迟和成本守住护栏,再通过灰度放量和自动回滚控制风险。同一用户持续进入同一组,避免多轮交互混用两个版本。Agent 输出具有非确定性,单次表现不能代表改动收益。评估需要大样本,不能凭几次成功案例下结论。

指标分成三层。主指标看任务完成率,回答改动是否让用户更容易完成任务。护栏看安全率、延迟和成本,检查收益是否伴随不可接受的代价。过程指标看工具调用准确率,帮助定位变化发生在哪里。Agent 的任务链路较长,要看多轮交互后的任务结果,不能只比较某一轮回答。

评估结合 LLM-as-Judge 和人工标注。人工评估贵,因此用自动评估覆盖更多样本,再用人工标注校准判断标准。放量按 5%、20%、50%、100% 推进。每个阶段都检查主指标和护栏。任务完成率上涨不等于可以直接放量,护栏也要满足要求。出现护栏异常时,框架应自动回滚。

面试官会怎么追问

  • 「为什么按用户分桶,不按每次请求分?」 Agent 要看多轮交互的任务结果。按请求分桶可能让同一用户在两个版本间切换。这样就难以判断任务结果来自哪个版本。按用户分桶能保持版本一致。
  • 「任务完成率涨了,成本也涨了,你怎么判断?」 任务完成率是主指标,成本是护栏。先检查成本是否满足护栏要求,再判断主指标收益。还要同时检查安全率和延迟。不能只拿完成率上涨作为继续放量的依据。
  • 「LLM-as-Judge 的结果,你敢直接用吗?」 不能直接把自动评分当成最终结论。要用人工标注对齐判断标准,检查自动评估与人工判断是否一致。发现分歧就校准评估标准。人工评估贵,但不能因此省掉对齐环节。

回答的坑

  • 只展示几条成功回答,不看大样本和多轮任务结果,无法说明非确定性 Agent 的改动收益。
  • 把工具调用准确率当成最终收益,或只看任务完成率而忽略护栏,都会误判是否该放量。

这家公司的面经实录

—— 本题完 ——