先这样答
自动评估便宜、快速,适合日常回归和初筛;人工评估更贴近真实体验,适合抽样校准和对齐裁判。两者不能互相替代,要结合使用。
自动评估可以快速跑大量样本,也方便持续比较版本变化。但指标和真实体验之间可能有差距,BLEU 这类指标尤其明显。LLM 裁判也会有偏差,所以自动分数不能直接等同于用户感受。人工评估更接近真实体验,能发现指标没有覆盖的问题。但人工成本高、速度慢,难以处理大规模样本,标注结果的一致性也可能不够好。
实际工作中,我会让自动评估负责日常回归和初筛。发现异常后,再用人工评估抽样确认。人工标注还可以定期用来校准自动指标,检查两者的相关性。如果相关性变差,就要重新看评估指标和裁判结果。这样既保留自动评估的效率,也用人工结果约束评估方向。
面试官会怎么追问
-
「为什么不能只看自动评估的分数?」 自动指标只反映它被设计来衡量的内容。指标和真实体验之间可能有差距,BLEU 这类指标尤其明显。LLM 裁判本身也可能有偏差,所以还需要人工抽样检查。
-
「人工评估这么贵,为什么还要做?」 人工评估更贴近真实体验。它能帮助确认自动评估是否真的反映了结果质量。人工标注还可以用来校准自动指标,检查两者的相关性。
-
「你会怎么安排自动评估和人工评估的分工?」 我会让自动评估负责日常回归和初筛,先快速发现变化。再对部分样本做人工评估,确认自动结果。定期比较人工标注和自动指标的相关性,发现偏差后及时调整。
回答的坑
-
不要把自动评估的分数直接当成真实体验,也不要忽略 LLM 裁判可能存在的偏差。
-
不要只说人工评估更准确,还要说明它成本高、速度慢、难以规模化且一致性可能不足。
同系列的题
这家公司的面经实录
—— 本题完 ——