先这样答
先回答可靠不可靠:有已知的系统性偏差,但工程上可控,是当前大规模评估几乎绕不开的手段。
常见偏差有四类。位置偏差:两份答案谁放前面谁占便宜,模型倾向给先出现的打高分。长度偏差:答案越长分越高,啰嗦反而占优。自我偏好:用模型 A 当裁判评模型 A 和 B 的输出,A 偏向自己风格。细节幻觉:裁判对长答案里的事实断言不逐条核实,编得流畅的答案得分高于朴素的正确答案。
对策都是成熟的。位置偏差:交换顺序评两次,分数取平均或按规则合并。长度偏差:评分细则里明确「冗余不加分」,或者在比较式评审里限制答案展示格式。自我偏好:裁判模型和被评模型错开。细节问题:把「这个答案对不对」拆成逐条断言核对(列出答案里的每个事实断言,逐条标注能否被参考资料支撑),粒度越细裁判越稳。
比偏差管理更重要的两件事。第一,评分细则的质量决定一切:把「答案质量好」翻译成可判定的检查项(是否引用了检索内容、是否回答了用户最后一问、格式是否符合要求),裁判是执行细则的,细则本身模糊,裁判模型再强也评不准。第二,校准不能停:定期抽一批样本人工独立打分,和裁判分对比,一致率掉下来就修细则或者换裁判模型。裁判分适合做回归对比和候选筛选,上线决策、对外发布的数字,还是要过人工。
面试官会怎么追问
- 裁判用更强的模型就可靠了吗? 能缓解不能消除,位置和长度偏差在强模型上依然存在;成本也翻上去了,批量评估通常用中等模型做裁判加严格细则。
- 打分制和两两比较哪个好? 两两比较(A 和 B 谁好)对模型更自然、一致性更高;打分制(1 到 10)便于算指标。实践中常用比较产生排序,再用规则换算分数。
- 怎么评裁判本身? 拿人工标注的基准集算裁判和人类的一致率(Cohen's Kappa 或简单一致率),这是裁判的「准入职考核」和「定期体检」。
回答的坑
- 只答「不可靠所以不用」。大规模评估没有更好的替代,讲清偏差和对策才是正确姿势。
- 不提人工校准。完全去人工的评估在关键场景是不负责任的,面试官等这句话。
—— 本题完 ——