如何设计一个 Agent 的 A/B 测试实验
配图(无描述)
1️⃣ 考察意图
考察实验设计能力。刁钻点:Agent A/B测试比传统Web A/B复杂——需要控制"环境状态"和"多步交互"的变量。
2️⃣ 标准答
Agent A/B测试设计流程:
- 定义假设:"新版Agent(加双LLM安全审查)的任务完成率不低于旧版,但安全拦截率提升10%+"
- 分流策略:按user_id随机分50/50。注意:同一用户始终在同一组(避免交叉污染)
- 评估指标: - 主指标:任务完成率(不超过旧版-2%) - 辅助指标:安全拦截率(提升10%+)、平均延迟(不超过旧版+20%)、用户满意度(thumbs up率)
- 实验周期:至少2周(覆盖工作日+周末的用户行为模式)
- 样本量计算:假设基线完成率85%,期望差异2%,显著性水平0.05,功效0.8 → 每组需要~3500样本
- 护栏指标:安全事故率(如果新版安全事故率>0.1%,立即停止实验)
Agent A/B测试的特殊考虑:
- 环境一致性:两组用户必须在相同的环境中测试。如果环境有变化(如API升级),两组同时受影响
- 多步交互的归因:用户在第3步放弃了——是Agent的第2步回答不好还是用户临时有事?需要分析"放弃原因"
- 延迟影响:新版如果延迟更高,用户可能因为"等不及"而放弃,不是因为Agent效果差。需要控制延迟变量
- 学习效应:用户第一次接触新Agent时可能不熟悉交互方式,前3天的数据需要排除(washout period)
3️⃣ 答题模板
"六步流程:定义假设(新版不差于旧版+安全提升10%)→ 分流(user_id 50/50,同用户同组)→ 指标(主:完成率不降2%+,辅:安全提升10%+延迟不增20%)→ 周期(2周)→ 样本量(3500/组)→ 护栏(安全事故>0.1%立即停)。特殊考虑:环境一致、多步归因、延迟控制、学习效应排除前3天。"
4️⃣ 高频追问
追问 1:Agent A/B测试的样本量为什么比Web A/B大?
Agent任务的方差更大——同一任务可能用5步或20步完成,完成率波动大。Web A/B通常测点击率(二项分布,方差小),Agent测任务完成率(受多步交互影响,方差大)。样本量公式:n = 2×Z²×p×(1-p)/δ²,p=0.85, δ=0.02 → n≈3500。如果δ=0.05(差异更大),n≈560。
追问 2:如果A/B测试结果不显著怎么办?
三个选择:(1) 延长实验——可能样本量不够,延长到4周;(2) 细分分析——整体不显著但某个子群体显著(如新用户提升明显但老用户无变化)。可以针对子群体发布;(3) 放弃——如果延长后仍不显著,说明改动效果有限。不要"强行解读"不显著的结果。
5️⃣ 避坑
- ❌ "A/B测试跑3天就够了" → ✅ "Agent行为受用户习惯影响大,3天可能只覆盖工作日。至少2周覆盖完整行为周期。前3天排除(学习效应)。"
6️⃣ 简历呼应
- 有A/B测试经验:从"Agent A/B实验设计"切入
- 校招无项目:设计一个Agent A/B测试方案文档
- "Trustworthy Online Controlled Experiments" (Kohavi et al., 2020)
—— 本场面试完 ——