先这样答
Rubric 要分成硬门槛和加分项两层。硬门槛采用一票否决,事实错误、答非所问、违反安全约束、格式不符,任一项命中就直接低分。加分项采用连续分,评价完整性、结构清晰、简洁度和引用规范。
设计时先把能用规则判断的硬门槛交给规则。比如事实、格式和安全约束中能明确判断的部分,先由规则处理,成本为零。模型只判断规则无法判断的内容。这样可以减少模型承担的判断范围,也让评分结果更容易解释。
每个加分维度都要准备正例和反例,并标出对应的锚点分数。完整性要看关键内容是否覆盖,结构清晰要看信息是否容易跟随,简洁度要看是否有多余表达,引用规范要看引用是否符合要求。上线后还要校准裁判本身:抽样做人工比对,并交换答案顺序测试位置偏差。发现偏差后,再调整 rubric 或评分方式。
面试官会怎么追问
-
「为什么不让模型直接给总分?」 先判硬门槛,再评加分项,能把明确错误和主观判断分开。规则能处理的内容不交给模型,可以减少评分波动。模型只处理规则判不了的部分。
-
「正反例锚点具体解决什么问题?」 它把抽象标准变成可比较的参照。裁判可以对照答案落在哪个区间,减少不同裁判对同一维度的理解差异。正例和反例都要覆盖,否则锚点不完整。
-
「怎么确认裁判没有位置偏差?」 可以抽样把模型评分和人工判断做比对。还要交换答案的展示顺序,观察评分是否随位置变化。两种结果都要看,不能只检查模型给出的分数。
回答的坑
-
把事实错误和表达不够完整放在同一套连续分里,会漏掉一票否决项。
-
只写维度名称而不给正反例锚点,裁判仍然容易出现评分漂移。
同系列的题
—— 本题完 ——