大模型和 Agent 是非确定性系统,同一个提示词两次输出可能不同。评测就是这类系统的质量关,业务落地岗几乎必问。这一章适合准备投应用和算法岗的人优先学,建议花 2 到 4 天。面试官的核心逻辑只有一条:设计机制,别让被测的模型改自己的分数。
考点地图
Benchmark 与数据污染
先懂行业基准,再懂基准怎么被作弊。追问集中在两处:怎么用 n-gram 重合度判断模型是不是把测试集背进了预训练数据;榜单分数和真实能力之间差着什么。这块是后面业务定制评测的地基。
Golden Set 与回归
业务场景要有自己的私有测试集。考点是采样和均衡:从真实用户日志里怎么采、长尾意图和高频意图怎么配比、标注怎么对齐。系统一迭代就要回归,多模块组合系统里「改了提示词、坏了别的地方」的拦截机制是追问热点。
LLM 裁判校准
用大模型打分能省人工,但裁判自身有偏见:偏好长回答、受选项顺序影响、被花哨措辞糊弄。校准手段是考点:交换选项顺序、强制先推理再打分、多维评分框架、关键信息点对比。裁判可信度锚在校准上,这是离线自动评测的命门。
线上评测与数据回流
上线只是开始。线上指标掉了对着离线测试集排查,低分案例清洗后回流进 Golden Set。埋点、显式反馈(点踩)、隐式反馈(追问率、转人工率)三类信号的采集与配合是完整考点。
站内学习路线
按「先打地基 → 再攻高频 → 最后自测」走。
先打地基,认识通用基准和它的漏洞:
第一篇建立全局认知,第二篇理解基准怎么失真。别背榜单分数,说得出测试逻辑才算懂。
再攻高频,业务评测四件套按依赖顺序排:
- 评测用的 Golden Set 怎么建?
- Agent 改了一版提示词,怎么知道没有改坏别的地方?
- 用大模型给大模型打分(LLM-as-Judge)可靠吗?怎么用才靠谱?
- 模型应用上线后怎么持续评测?线上和离线评测怎么配合
先有测试集,再防回归,再解决自动打分的可信度,最后接上线上信号。最后用 从零构建一个 Agent Benchmark 要做哪些事? 把全链路串起来。
深度长文目前 1 篇:阿里 Agent 岗三面:评测体系怎么做,怎么防止裁判被糊弄,还原了高阶面试的对抗性追问,值得精读。长文在补,先把速答刷完。
高频追问与避坑
面试官追问原话:「你们的 Golden Set 数据怎么来的?」 答法方向:说清混合来源和配比——线上日志聚类采样加边界场景人工构造;标注有对齐培训和一致性校验;失效用例定期清理。 浅答错在哪:只答「从线上日志随机抽一批让人标」。随机抽样漏掉低频但致命的场景,没有一致性校验的标注把人的主观噪音带进基准。
面试官追问原话:「用 GPT-4 打分,它总给长回答打高分,怎么办?」 答法方向:裁判提示词里放参考答案,要求按关键信息点对比而不是看篇幅;评分拆成事实正确、逻辑连贯、表达简洁三个维度,冗长单独扣分;强制先输出推理过程再给分。 浅答错在哪:只答「改提示词让它别偏好长文本」。长度偏好是预训练带来的固有倾向,一句指令压不住,要有结构化评分框架。
面试官追问原话:「Agent 链路很长,怎么确定是哪一步导致评测失败?」 答法方向:拆链路。意图识别、检索、工具调用、生成各自建子测试集;端到端失败时自动回溯各节点中间输出,和子测试集标准结果比对,定位故障节点。 浅答错在哪:只看最终输出的准确率。Agent 的错误会级联,检索错了生成照样流畅,不拆链路排查无从下手。
刷完站内内容,去飞书专项真题集做延伸练习。评测答得好不好,面试官听的是你有没有「裁判不能既当运动员」这根弦。