先这样答
回答这个问题,核心思路是将指标分层,分为面向工程的模型指标和面向业务的产品指标,并在两者之间建立严格的映射关系。
模型指标主要关注底层能力,比如准确率和幻觉率,这些数据是给工程团队看的,用来衡量模型输出的质量边界。产品指标则关注用户的实际收益,比如任务完成率、人工介入率、用户留存以及投诉率,这是给业务团队看的。设计指标时存在两个常见的反模式。一是只看点击率或者调用量,因为用户点击了生成按钮并不代表其意图得到满足。二是直接拿模型自评的结果当作最终的产品指标,这会掩盖真实的业务问题。
模型指标和产品指标对齐的标准,在于模型指标的变化必须能够解释产品指标的波动。在具体落地时,首先要通过灰度对照实验来定义基础水位线,观察模型准确率变化是否带来了人工介入率的改变。日常迭代中,需要建立badcase分类账本,用业务层面的客诉或失败任务反推模型层面的具体缺陷,以此驱动研发的迭代优先级。同时,这两个层面的指标统计口径必须明确写进需求文档,防止后期认知不一致。
总的来说,指标设计就是用业务结果去检验工程产出,通过明确的映射关系和分类账本,让模型的每一次优化都能体现在产品指标的改善上。
面试官会怎么追问
-
「如果模型准确率变好了,但任务完成率没变,怎么排查?」 这说明模型指标和产品指标出现了脱节。排查时先看badcase分类账本,确认模型提升的准确率是否集中在用户不关心的长尾场景。另外需要检查产品交互流程,看是否是前端工程或意图识别环节出错,导致模型能力没有传递到最终任务上。
-
「为什么说拿模型自评当产品指标是错的?」 模型自评往往存在同质化偏见,且缺乏真实的业务上下文。业务结果是由用户的主观满意度和实际任务是否办成来决定的,模型自评只能作为工程阶段的参考,不能替代用户留存、投诉率等客观的业务反馈。
-
「灰度对照具体怎么做才能对齐指标?」 在上线新模型策略时,分出一部分流量作为实验组,保留原流程作为对照组。在两组中同步观察模型指标和产品指标。如果实验组的幻觉率下降,同时观察到投诉率同步下降,就能证明这两个指标之间存在有效的映射关系,从而确立评估基线。
回答的坑
- 把调用量和点击率当做AI功能的成功指标。正确方向是关注任务完成率和人工介入率,衡量功能是否真正解决了实际问题。
- 混淆工程指标与业务指标的汇报对象。正确方向是明确区分,将幻觉率等指标汇报给工程团队,将留存和客诉等汇报给业务团队,并清晰解释两者的联动关系。