Q25评测与可观测评测与可观测AgentAlpha 社区约 9 分钟更新 2026-09-29

第 7 章 · 评测面试导学

评测章节的考点地图与刷题路线:Benchmark 与数据污染、Golden Set 与回归、LLM 裁判校准、线上评测与数据回流,附三个最容易翻车的追问。

面试官原题

大模型和 Agent 的评测面试考什么?评测体系怎么从零搭?

面试官 · Agent 岗面试现场

大模型和 Agent 是非确定性系统,同一个提示词两次输出可能不同。评测就是这类系统的质量关,业务落地岗几乎必问。这一章适合准备投应用和算法岗的人优先学,建议花 2 到 4 天。面试官的核心逻辑只有一条:设计机制,别让被测的模型改自己的分数。

考点地图

Benchmark 与数据污染

先懂行业基准,再懂基准怎么被作弊。追问集中在两处:怎么用 n-gram 重合度判断模型是不是把测试集背进了预训练数据;榜单分数和真实能力之间差着什么。这块是后面业务定制评测的地基。

Golden Set 与回归

业务场景要有自己的私有测试集。考点是采样和均衡:从真实用户日志里怎么采、长尾意图和高频意图怎么配比、标注怎么对齐。系统一迭代就要回归,多模块组合系统里「改了提示词、坏了别的地方」的拦截机制是追问热点。

LLM 裁判校准

用大模型打分能省人工,但裁判自身有偏见:偏好长回答、受选项顺序影响、被花哨措辞糊弄。校准手段是考点:交换选项顺序、强制先推理再打分、多维评分框架、关键信息点对比。裁判可信度锚在校准上,这是离线自动评测的命门。

线上评测与数据回流

上线只是开始。线上指标掉了对着离线测试集排查,低分案例清洗后回流进 Golden Set。埋点、显式反馈(点踩)、隐式反馈(追问率、转人工率)三类信号的采集与配合是完整考点。

站内学习路线

按「先打地基 → 再攻高频 → 最后自测」走。

先打地基,认识通用基准和它的漏洞:

  1. 大模型评测都看哪些 Benchmark?榜单排名可信吗?
  2. Benchmark 数据污染是什么?怎么判断模型是背过题还是真会?

第一篇建立全局认知,第二篇理解基准怎么失真。别背榜单分数,说得出测试逻辑才算懂。

再攻高频,业务评测四件套按依赖顺序排:

  1. 评测用的 Golden Set 怎么建?
  2. Agent 改了一版提示词,怎么知道没有改坏别的地方?
  3. 用大模型给大模型打分(LLM-as-Judge)可靠吗?怎么用才靠谱?
  4. 模型应用上线后怎么持续评测?线上和离线评测怎么配合

先有测试集,再防回归,再解决自动打分的可信度,最后接上线上信号。最后用 从零构建一个 Agent Benchmark 要做哪些事? 把全链路串起来。

深度长文目前 1 篇:阿里 Agent 岗三面:评测体系怎么做,怎么防止裁判被糊弄,还原了高阶面试的对抗性追问,值得精读。长文在补,先把速答刷完。

最后自测:去模拟面试抽题检验,其余题目在本分类页持续更新。

高频追问与避坑

面试官追问原话:「你们的 Golden Set 数据怎么来的?」 答法方向:说清混合来源和配比——线上日志聚类采样加边界场景人工构造;标注有对齐培训和一致性校验;失效用例定期清理。 浅答错在哪:只答「从线上日志随机抽一批让人标」。随机抽样漏掉低频但致命的场景,没有一致性校验的标注把人的主观噪音带进基准。

面试官追问原话:「用 GPT-4 打分,它总给长回答打高分,怎么办?」 答法方向:裁判提示词里放参考答案,要求按关键信息点对比而不是看篇幅;评分拆成事实正确、逻辑连贯、表达简洁三个维度,冗长单独扣分;强制先输出推理过程再给分。 浅答错在哪:只答「改提示词让它别偏好长文本」。长度偏好是预训练带来的固有倾向,一句指令压不住,要有结构化评分框架。

面试官追问原话:「Agent 链路很长,怎么确定是哪一步导致评测失败?」 答法方向:拆链路。意图识别、检索、工具调用、生成各自建子测试集;端到端失败时自动回溯各节点中间输出,和子测试集标准结果比对,定位故障节点。 浅答错在哪:只看最终输出的准确率。Agent 的错误会级联,检索错了生成照样流畅,不拆链路排查无从下手。

刷完站内内容,去飞书专项真题集做延伸练习。评测答得好不好,面试官听的是你有没有「裁判不能既当运动员」这根弦。

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。