评测与可观测[A/B测试评估指标工程实践]速答 · 约 6 分钟更新 2026-09-28

LLM 应用的 A/B 测试和传统有什么不同?怎么设计?

一句话结论

LLM 应用的 A/B 测试面临输出非确定性和质量难量化的问题。设计时需按用户分流,指标改用解决率等业务代理指标,并用交错实验和离线影子评测提高测试敏感度。

先这样答

LLM 应用的 A/B 测试与传统测试的核心差异在于输出的非确定性、生成结果质量难以量化、用户的新奇效应更强,以及样本之间不完全独立。因此在设计实验时,不能照搬传统的测试框架,需从分流策略、指标选择和测试周期重新设计。

在分流策略上,必须按用户而不是按请求分流。大模型的对话具有上下文连贯性,如果同一用户在多轮对话中交替命中不同版本的模型,会导致体验断裂,同一用户的体验必须保持一致。在指标设计上,由于文本质量难量化,且模型自评分存在偏差,核心指标应选用业务代理指标,如对话解决率、留存率或人工介入率。计算统计显著性时,需按用户聚类校正方差,处理单用户样本间不独立的问题。

测试周期方面,新版本上线初期会引发用户的大量尝试,这种新奇效应会干扰数据表现。测试周期需要拉长,避开新奇效应后再做决策。为提高敏感度和安全性,可引入增强模式。一是交错实验,让同一用户交替看到两个版本的回答,这种方式对差异的敏感度更高;二是离线影子评测,新版本先用线上真实流量的影子数据在离线环境跑一遍进行安全评估。

总体来看,LLM 应用的 A/B 测试设计的重心在于用客观的业务结果对冲模型本身的不确定性,确保实验结论真实反映用户体验的变化。

面试官会怎么追问

  • 「离线影子评测具体是怎么操作的?」 系统将线上真实用户的请求复制一份发送给部署在离线环境的新模型。新模型的输出不返回给用户,仅记录在系统日志中。事后通过对比新旧模型对同一批请求的输出,评估新版本的表现与延迟情况。
  • 「交错实验中同一用户交替看到两个版本,具体适用什么场景?」 这种模式用于对模型生成质量进行细粒度对比。系统在多轮交互中交替使用两个版本的模型生成回复,通过统计用户对不同回复的采纳率来判断优劣。它能消除用户群体间的特征差异,对模型能力的微小变化更加敏感。
  • 「按用户聚类校正方差是因为什么?」 传统测试假设每个请求是独立的,但在 LLM 应用中,同一用户在一次会话中的多轮提问高度相关。若直接按请求计算方差会导致假阳性增加,按用户维度聚合能得到更准确的统计显著性。

回答的坑

  • 习惯性套用传统推荐系统的页面点击率作为核心指标,正确做法是强调人工介入率或问题解决率等业务代理指标。
  • 将模型自评分直接作为测试的决定性量化指标,实际操作中最终决策需依赖真实用户的行为结果。
—— 本题完 ——