五厂面经真题集字节跳动面经高频RAG评估检索速答 · 约 6 分钟更新 2026-09-28

线上跑的 RAG 怎么衡量效果好不好?

一句话结论

分两层:检索层用 Hit@K 看该召回的有没有进前 K、MRR 看排多前,生成层用忠实度、答案相关性、上下文召回率这类 LLM 裁判指标;线上最终看点踩率、追问率、转人工率。

先这样答

RAG 评估分两层,先分层再谈指标。检索层不管生成,只看该召回的内容有没有被召回:Hit@K 回答「前 K 条里有没有命中」,一般低于 0.7 说明检索有问题,高于 0.8 答案还差就是生成层的锅;MRR 回答「命中的排第几」,低说明 Rerank 没起作用。两个配合能把检索层的问题定位到具体环节。

生成层看答案对不对、有没有编造,常用 LLM 当裁判的评估框架:忠实度看答案每句话有没有检索内容做依据,答案相关性看是否切题,上下文召回率看该引用的内容是否都被用到。这几个指标能自动批量跑,替代人工抽查。

两个落点必须说:第一,评估必须在自己的业务数据上跑,通用榜单不代表你的场景;第二,离线指标只是辅助,线上最终看用户点踩率、追问率、转人工率这些真实信号。评估体系的价值在于知识库每次更新、参数每次调整之后,能回答「变好了还是变差了」,没有它所有优化都是盲调。

面试官会怎么追问

  • 「靠用户投诉评估行不行?」 不行。投诉到达时错误答案已经伤害过一批用户;用户不投诉也不代表效果好,可能直接不用了。线上信号要点赞率这类被动采集的行为数据。
  • 「LLM 裁判本身不准怎么办?」 裁判要用强模型、给评分标准和示例(rubric),抽样和人工标注对齐校准;关键结论再加一层人工抽检。
  • 「评估集从哪来?」 从历史真实问答里标注构建,覆盖高频和边界问题,随业务迭代持续补充,不能一次建完永不更新。

回答的坑

只答「人工抽查几十条」或「看用户反馈」,没有分层指标体系,面试官会判定你没做过生产级 RAG。

把 Hit@K 和 MRR 混着说。前者是「找到没」,后者是「多快找到」,分不清说明没用过。

—— 本题完 ——