先这样答
先说分工。离线评测回答「这次改动有没有变差」:固定一批评测用例,改提示词、换模型、调参数之前跑一遍,防回归。线上评测回答「真实用户拿到的质量怎么样」:实验室用例再全,也覆盖不了真实流量的分布,线上是唯一能看到真实效果的地方。两者不是备选关系,是同一条流水线的两段。
线上评测的信号有四个来源。一是抽样人审:每天从真实流量抽样,按统一标准打分,量不用大,持续比量大重要。二是用户反馈:点赞点踩、申诉、客服工单,把负反馈自动归集起来分析。三是埋点指标:回答被重新生成的比例、会话中途放弃率、工具调用失败率,这类行为信号往往比评分更早暴露问题。四是灰度对比:改动先放一小部分流量,新旧版本在同类查询上对比,确认不变差再全量。
总结:关键在把线上问题接回离线。线上发现的坏例子要沉淀进离线评测集,变成固定的回归用例。只跑离线的团队,评测集会慢慢和真实流量分布脱节;只看线上的团队,每次改动都没有回归保护。
面试官会怎么追问
- 「线上没法给每个回答打分,质量指标怎么定?」 用代理指标组合:用户显式反馈、行为信号(重试、放弃、就同一问题反复追问)加定期抽样人审校准。单一指标都会误读,比如重试率高可能是答案差,也可能是任务本身难。
- 「评测集多久更新一次?」 持续小步更新:每周从线上补充坏例和典型例,定期删过时用例。同时守住一条边界:评测集是回归工具不是优化目标,不能拿它反复调提示词刷分,那是对评测集过拟合。
- 「灰度放多少流量合适?」 看改动风险:提示词小改放一到两成跑几天,换模型这类大改从更小比例起步,并先在离线评测集确认没有明显回归。样本量要够看出你关心的指标差异,灰度太小出不了结论。
回答的坑
- 把离线分数当成线上效果的保证。评测集分布和真实流量有偏差,离线分数只说明「没退步」,不说明「变好了」。
- 只看平均分。线上质量看尾部:平均分持平、最差一成回答变差,用户体验照样垮,要盯分位数和坏例率。
同系列的题
—— 本题完 ——