评估评估评测更新 2026-09-28

LLM-as-a-JudgeLLM as a Judge

一句话定义

LLM-as-a-Judge 是用强模型按标准给输出打分或做成对比较的评测方法,能覆盖人工无法达到的规模。其风险有位置偏差、长度偏好与自我偏好,需通过锚定样例与一致性校验来稳定。

是什么

这种评测方法主要包含三种形态。单点打分是让模型按照给定的评分细则对输出进行独立评估;成对比较是让模型判断两个结果中哪一个更好;轨迹评估则是针对 Agent 的多步执行过程进行逐段判断。

该机制存在已知的偏差,包括先出现项占优的位置偏差、长答案占优的长度偏好、给自身风格打高分的自我偏好,以及评分细则模糊导致的分数漂移。为使结果稳定,需采取低温度采样、提供参考答案与评分细则、交换选项位置进行双向比较、引入多模型投票,并与人工抽检结果对齐校准。

解决什么问题

在问答、文本摘要以及 Agent 行为轨迹等开放式输出场景中,通常没有唯一正确的答案。传统的规则指标无法测量生成内容的质量,而人工评测又面临成本高且速度慢的限制。这种方法解决了开放式任务难以进行大规模自动化评测的问题。

面试怎么考

面试常围绕该方法的可靠性与工程细节展开。常见考法包括询问 LLM 打分是否可靠、存在哪些偏差以及如何消除。

另一高频考法是询问该方法与金标准集合如何配合使用。答题要点应说明通过金标准集合进行锚定与人工校准,再利用模型判定来扩充评测规模。

又称:LLM-as-a-Judge · 模型评模型 · 大模型评分

相关术语

—— 本条完 ——