某大厂两面 · 检索与训练混考 16 分钟读完

RAG 专项:某大厂两面真题全记录

RAG 方向(应用算法岗)

面经RAG方向深挖混合检索LoRA

岗位:某大厂 RAG 方向应用算法岗 轮次:两面技术面 一句话定性:RAG 专项岗的考法是「检索 + 训练」五五开,两面各占一头。 素材来源:AgentGuide 开源面经合集案例(公司匿名),整理时间 2026-09-28


0. 一分钟速览

项目内容
方向RAG 应用算法
一面重心检索链路:BM25、混合检索、意图识别、模型选型
二面重心训练与推理:KV Cache、MoE 均衡、LoRA、scaling law
有手撕吗有。三数之和、求根到叶数字之和(LeetCode 129)
典型挂点只会向量检索说不出 BM25 的适用面;LoRA 初始化答不出
准备方向检索和训练各备一条完整追问链

1. 一面:检索链路

1.1 BM25 原理与混合检索

问法:「BM25 的原理?什么场景比向量检索好用?」

答题要点:BM25 是词频加逆文档频率加长度归一的关键词打分,核心假设是词匹配。精确词(产品型号、错误码、人名)上 BM25 稳赢向量检索——向量对这些低频精确词的表示不可靠。生产做法是混合检索:两路各召回一批,用 RRF(倒数排名融合)或加权合并,再用 Rerank 精排。

1.2 召回不对的处理

问法:「用户反馈答案不对,你怎么定位是检索的问题还是生成的问题?」

答题要点:分层排查。先看 Hit@K:该出现的 chunk 有没有进前 K——没进是检索问题,往下查查询改写、切分、Embedding;进了但答案错是生成问题,查忠实度和提示词约束。有评测集才能做这个排查,没有评测集连「不对」都无法量化。

1.3 意图识别与模型选型

意图识别决定路由(闲聊直答、知识库走 RAG、操作类走工具调用),考法常结合「怎么降低延迟」:意图分类用小模型,重活再上大模型。模型选型题答「先定评估集再选型」,而不是背排行榜。


2. 二面:训练与推理

2.1 KV Cache 与 Paged Attention

问法:「KV Cache 为什么省?Paged Attention 解决什么?」

答题要点:自回归生成每步都要全部历史的 K、V,缓存避免重算,代价是显存随上下文线性涨;Paged Attention 把 KV Cache 按页管理(像操作系统虚拟内存),解决连续分配带来的内部碎片和浪费,长上下文场景显存利用率大幅提高。

2.2 MoE 负载均衡

问法:「MoE 的负载均衡损失为什么需要?怎么改?」

答题要点:路由天然会扎堆热门专家,冷专家学不到东西;均衡损失(对各专家负载的软约束)把流量摊开。追问「改均衡系数会怎样」:太强专家被迫平均、专业化被压制,太弱回到扎堆——这是个调参权衡,能说出代价就到位。

2.3 LoRA 初始化与秩

问法:「LoRA 的 A、B 怎么初始化?为什么?」

答题要点:B 置零、A 随机(高斯),保证训练起点 BA=0、模型行为和基座完全一致,训练从「不扰动」开始。秩的选择按任务复杂度和数据量在 8 到 64 之间试,配合秩的缩放系数。

2.4 SFT scaling law 与数据分布

数据量增长带来的收益先陡后平,但分布比数量更重要:窄分布大量数据会把模型带偏(通用能力遗忘),广覆盖适量数据更稳。「数据分布偏移怎么发现」:训练损失正常但评测集掉点,先查评测集和训练数据的分布差异。


3. 复盘与准备清单

  • RAG 岗的追问链两条都要熟:检索链(改写→召回→融合→重排→评估)和训练链(SFT→LoRA→scaling→遗忘)。
  • 手撕稳定在 LeetCode 中等题:三数之和、129 这类出现频率高。
  • 和站内淘天篇、美团篇对照看:RAG 深挖的问法各厂高度一致,题库的 RAG 分类按 planned 刷完能覆盖九成。

相关题目:站内题库的「BM25 和向量检索怎么选」「KV Cache 为什么省显存」「LoRA 的秩怎么选」都是这个方向的高频原题。