五厂面经真题集百度面经高频百度真题LLM-as-a-Judgerubric速答 · 约 5 分钟更新 2026-09-29

LLM-as-a-Judge 的 rubric 怎么设计?哪些维度是硬门槛,哪些是加分项?

一句话结论

Rubric 分硬门槛和加分项:先用规则判事实、安全、相关性和格式,命中一项就低分;模型再按完整性、结构、简洁度和引用规范连续评分,并用正反例与人工抽样校准。

先这样答

Rubric 要分成硬门槛和加分项两层。硬门槛采用一票否决,事实错误、答非所问、违反安全约束、格式不符,任一项命中就直接低分。加分项采用连续分,评价完整性、结构清晰、简洁度和引用规范。

设计时先把能用规则判断的硬门槛交给规则。比如事实、格式和安全约束中能明确判断的部分,先由规则处理,成本为零。模型只判断规则无法判断的内容。这样可以减少模型承担的判断范围,也让评分结果更容易解释。

每个加分维度都要准备正例和反例,并标出对应的锚点分数。完整性要看关键内容是否覆盖,结构清晰要看信息是否容易跟随,简洁度要看是否有多余表达,引用规范要看引用是否符合要求。上线后还要校准裁判本身:抽样做人工比对,并交换答案顺序测试位置偏差。发现偏差后,再调整 rubric 或评分方式。

面试官会怎么追问

  • 「为什么不让模型直接给总分?」 先判硬门槛,再评加分项,能把明确错误和主观判断分开。规则能处理的内容不交给模型,可以减少评分波动。模型只处理规则判不了的部分。

  • 「正反例锚点具体解决什么问题?」 它把抽象标准变成可比较的参照。裁判可以对照答案落在哪个区间,减少不同裁判对同一维度的理解差异。正例和反例都要覆盖,否则锚点不完整。

  • 「怎么确认裁判没有位置偏差?」 可以抽样把模型评分和人工判断做比对。还要交换答案的展示顺序,观察评分是否随位置变化。两种结果都要看,不能只检查模型给出的分数。

回答的坑

  • 把事实错误和表达不够完整放在同一套连续分里,会漏掉一票否决项。

  • 只写维度名称而不给正反例锚点,裁判仍然容易出现评分漂移。

—— 本题完 ——