高频合集 · CHEAT SHEET

RAG 面试题(50 问,含答案)

RAG 是面试问得最密的方向(真题图谱 1094 道关联题)。以下 50 道按「基础 → 检索 → 生成 → 评测 → 工程化」排列,每题一句话答案先行,完整解析链接在右侧。

本页 20 题同页给全答案,可直接背结论;每题链到 2431+ 篇真题解析库与逐题深挖。更新于 2026-10-01,持续补充。

RAG 检索增强

  1. Q1

    RAG 和微调怎么选?什么场景该用哪个?

    知识要更新、要溯源,用 RAG;行为、格式、领域语感不对,用微调;两者不冲突,多数生产系统是先 RAG 后微调。

  2. Q2

    RAG 的完整流程是什么?从文档到答案要过几道工序?

    两段六步:离线把文档解析、清洗、切分、向量化后入库;在线把查询改写、召回、重排后拼进提示词让模型生成带引用的答案。

  3. Q3

    文档切分(Chunking)怎么做?块切多大合适?

    从固定的几百 token 加重叠起步,再按文档结构升级——标题层级切块、表格整块保留、父块检索子块匹配,切分质量决定检索上限。

  4. Q4

    Embedding 模型怎么选?看哪些指标?

    五个维度:中文/多语能力、检索精度(看 C-MTEB 这类榜单)、最大输入长度、推理成本、能否私有化部署;选定后用自己的数据建评测集复测,别只信榜单。

  5. Q5

    向量数据库怎么选?Milvus、FAISS、PGVector 差在哪?

    先问规模和运维:千万级以下原型用 FAISS,已有 PostgreSQL 的用 PGVector,亿级、多副本、要标量过滤的再上 Milvus 这类专用库——别一上来就堆专用设施。

  6. Q6

    RAG 检索不准怎么排查?从哪一步开始查?

    先把检索和生成分开评——命中了答错是生成的问题,没命中是检索的问题;检索问题再按切分、查询改写、召回、重排四段逐层看。

  7. Q7

    RAG 的效果怎么评估?有哪些指标?

    分两侧评:检索侧看 Recall@k、MRR 这类排序指标,生成侧看忠实度、答案相关性、引用准确;没有标注就先建几十条 Golden Set,工具上 RAGAS 这类框架可以起步。

  8. Q8

    混合检索和重排序(Rerank)是什么?为什么向量检索不够用?

    向量检索懂语义但抓不准精确词——型号、错误码、人名容易丢;补一条 BM25 关键词链路做混合检索,再用交叉编码器把两路结果重排,召回率和排序质量都上台阶。

  9. Q9

    GraphRAG 是什么?它比普通 RAG 强在哪、贵在哪

    GraphRAG 先从文档里抽取实体和关系建成知识图谱,检索时沿着图扩展上下文。强在能回答跨文档的全局问题,贵在建图要过一遍全部语料、查询也要多跳扩展。

  10. Q10

    几百页的长文档怎么做 RAG?直接塞长上下文行不行

    行不行看查询频次:偶尔查一次,直接塞长上下文最省事;高频生产场景要建索引,长上下文有中间内容利用率下降的问题,成本也随每次查询线性增长。

  11. Q11

    Query 改写是什么?为什么用户原句直接拿去检索效果差?

    Query 改写是结合意图和对话上下文,把口语、省略或有指代的问题改成更适合检索的表达,避免用户原句与知识库书面文本在词汇和语义上对不上。

  12. Q12

    RAG 的知识库怎么更新?文档改了答案还是旧的怎么办?

    更新要打通整条链路:旧切片没清、检索没按版本过滤、缓存没失效,任何一层留下旧数据,答案就一直是旧的。给切片带版本元数据,三层对齐才算更新完成。

  13. Q13

    Bi-Encoder 和 Cross-Encoder 是什么?Rerank 为什么非它不可?

    Bi-Encoder 双塔独立编码做召回,文档向量可离线预计算建索引;Cross-Encoder 拼接打分精度高但没法预计算,只能放在召回后的小候选集上做精排。

  14. Q14

    Embedding 模型是怎么训练出来的?对比学习在做什么?

    Embedding 训练的核心是对比学习,通过 InfoNCE 损失函数拉近正样本、推远负样本,现代做法高度依赖 In-batch 负例与 BM25 挖掘的难负例来构建训练信号。

  15. Q15

    RAG 的父子索引是什么?为什么检索小块、返回大块?

    父子索引将文档分为两层,向量库存储句子级小块用于精准检索,命中后向大模型提供其对应的段落级大块,解决了检索需要语义集中与生成需要完整上下文的粒度矛盾。

  16. Q16

    知识有时效性,向量检索怎么处理时间衰减?

    可以给检索分数加上时间衰减函数,或采用新旧双路召回融合。同时要在写入侧维护文档的失效期元数据,并按文档类型配置不同衰减强度,避免误伤长期稳定的概念类知识。

  17. Q17

    向量库选了 HNSW,在线更新和索引一致性怎么处理?频繁更新的代价是什么?

    HNSW 的强项是查询,弱项是删改;频繁更新会导致图连接退化和写入阻塞,实际工程中通常用版本切换和冷热分区机制,把在线改图转换为离线换图。

  18. Q18

    文档没有标题层级时,分块怎么切?切完剩下的碎块怎么处理?

    遇到无结构文本,按段落、句子、固定窗口或语义相似度骤降点依次降级切分。尾部碎块通常向前合并或交由父子索引处理,保证语义自洽,不强求等长。

  19. Q19

    知识库到千万级文档,为什么只调向量库参数救不了召回?

    千万级规模下相似内容海量增加,向量区分度被稀释,单靠调参解决不了干扰项暴增的问题,必须通过检索架构升级、数据治理和模型调优来应对。

  20. Q20

    LightRAG 是什么?和 GraphRAG 怎么选?

    LightRAG 是 GraphRAG 的轻量替代,用双层检索取代了昂贵的社区聚类与摘要。做跨文档全局归纳选 GraphRAG,要图结构又想控制成本和增量更新选 LightRAG,局部问答用向量 RAG 就够。

先补概念?术语速览