是什么
这种评测方法主要包含三种形态。单点打分是让模型按照给定的评分细则对输出进行独立评估;成对比较是让模型判断两个结果中哪一个更好;轨迹评估则是针对 Agent 的多步执行过程进行逐段判断。
该机制存在已知的偏差,包括先出现项占优的位置偏差、长答案占优的长度偏好、给自身风格打高分的自我偏好,以及评分细则模糊导致的分数漂移。为使结果稳定,需采取低温度采样、提供参考答案与评分细则、交换选项位置进行双向比较、引入多模型投票,并与人工抽检结果对齐校准。
解决什么问题
在问答、文本摘要以及 Agent 行为轨迹等开放式输出场景中,通常没有唯一正确的答案。传统的规则指标无法测量生成内容的质量,而人工评测又面临成本高且速度慢的限制。这种方法解决了开放式任务难以进行大规模自动化评测的问题。
面试怎么考
面试常围绕该方法的可靠性与工程细节展开。常见考法包括询问 LLM 打分是否可靠、存在哪些偏差以及如何消除。
另一高频考法是询问该方法与金标准集合如何配合使用。答题要点应说明通过金标准集合进行锚定与人工校准,再利用模型判定来扩充评测规模。
又称:LLM-as-a-Judge · 模型评模型 · 大模型评分
接着做点什么
—— 本条完 ——