RAG · ALL
RAG 检索增强 · 全部题目
共 591 篇,本页第 97-144 篇。← 回到学习路径视图
No.1168What is the difference between embedding short and long content?**面试官想考察你对 embedding 模型在长度维度上的“语义压缩瓶颈”理解深度,以及在实际 RAG 系统中如何针对不同…→No.1169What is the role of embedding models in RAG systems?**面试官想考察你对 RAG 系统核心组件的理解深度,而非简单背诵“嵌入模型做语义搜索”。刁钻点在于:你是否清楚嵌入模型在 …→No.1170When should I use Fine-tuning instead of RAG?**面试官想考察你是否能跳出“RAG vs Fine-tuning”的二元对立,从工程取舍和系统设计的角度给出决策框架。刁钻…→No.1171When should you use RAG instead of fine-tuning an LLM?**面试官想看你能否在“RAG”和“微调”之间做出工程级别的权衡,而非单纯背诵定义。这属于系统设计取舍类问题,刁钻点在于:很…→No.1172chunk 大小怎么定的面试官想看你是否理解 chunk 大小不是拍脑袋的“最佳值”,而是受 LLM 上下文窗口、检索精度、语义完整性三者制约的…→No.19第 1 章 · RAG 面试导学本导读梳理了 RAG 章节的考点地图与学习路线。从文本切分、向量库选型到多路检索与系统评测,带你避开常见面试陷阱,高效掌…→No.1900什么是递归检索(Recursive Retrieval)面试官想考察你对“迭代式检索”策略的工程化理解,而非单纯背诵定义。核心在于:你能否设计出递归触发条件、终止机制,并权衡计…→No.1901企业场景里,为什么权限控制不能只靠前端限制面试官想考察你对 RAG 系统安全边界的理解深度,而非单纯背概念。这是典型的工程取舍 + 系统设计题。刁钻点在于:多数人…→No.1902全量重建在生产环境里会带来什么问题面试官想看你是否真正经历过生产环境的“毒打”,而非停留在理论层面。考察类型是工程取舍 + 系统设计。刁钻点在于:全量重建…→No.1903哪些优化适合早做,哪些优化适合后做面试官想看你是否具备“工程优先级判断力”——不是背 RAG 组件列表,而是能根据投入产出比(ROI)和系统瓶颈,区分哪些…→No.1904哪些环节适合做缓存面试官想考察你对 RAG 系统性能瓶颈的工程直觉,而非背诵缓存概念。刁钻点在于:RAG 各环节(文档解析、向量化、检索、…→No.1905它为什么会影响 RAG 效果面试官想考察你是否理解“Lost in the Middle”这一现象对RAG系统性能的具体影响机制,而非仅仅背诵概念。…→No.1907文档清洗、切块、Embedding、入库、检索、生成分别怎么串起来面试官想考察你是否真正动手搭过 RAG 系统,而非只背概念。核心是看你对数据流中每个环节的“衔接点”和“工程取舍”的理解…→No.1908第一次上线时,最值得优先补齐的 3~5 个能力是什么面试官想看你是否具备“从 demo 到生产”的工程化思维,而非只会搭个 RAG 原型。这道题表面问优先级排序,实则考察你…→No.1909索引为什么不是“把文本存进去”这么简单面试官想看的不是你会不会调FAISS API,而是你是否理解索引的本质是搜索优化而非存储。这道题属于工程取舍+系统设计型…→No.1910线上 RAG 系统应该监控哪些指标面试官想看你是否具备“生产级”RAG 系统的工程思维,而非仅停留在论文 demo 阶段。核心考察点:能否区分离线评估(如…→No.1911长上下文和 RAG 分别适合什么场景面试官想考察的不是“背概念”,而是场景化系统设计能力——能否根据业务约束(数据规模、延迟、成本、更新频率)做出工程取舍。…→No.1912RAG 的完整工作流程是什么面试官真正想看的不是你会背“检索-生成”四个字,而是你对RAG pipeline中每个环节的工程细节和取舍有手感。这是一…→No.1913一次失败回答上线后,应该如何快速定位问题出在哪一层面试官想看你是否具备系统化故障定位的工程思维,而非靠直觉瞎猜。这属于系统设计+debug混合题型,刁钻点在于:RAG 失…→No.1914为什么 Embedding 能支持语义检索面试官想考察你是否真正理解 Embedding 的底层原理,而非停留在“向量相似度”的表面。这是典型的概念+工程取舍题:…→No.1915为什么 LLM 不直接处理“句子含义”,而是处理 token 序列面试官想考察你对LLM底层设计原理的理解深度,而非简单背诵。这是典型的“工程取舍”+“系统设计”混合题。刁钻点在于:候选…→No.1916为什么“有资料”不等于“资料可被有效检索和使用”面试官想考察你对RAG系统“检索有效性”的深层理解,而非简单背诵流程。核心是区分“数据存在”与“数据可被检索”之间的工程…→No.1917为什么一个端到端分数无法告诉你系统真正的问题在哪面试官想看你是否具备分模块诊断的工程思维,而非只会堆指标。RAG 系统是检索+排序+生成的流水线,端到端分数(如整体准确…→No.1918为什么上下文里要去重、排序和压缩面试官真正想看的不是你会背“去重、排序、压缩”三个词,而是考察你对RAG系统上下文构建这一关键环节的工程取舍和系统级理解…→No.1919为什么上下文顺序会显著影响回答质量面试官想考察你对 Transformer 架构中位置编码与注意力分布的深层理解,以及如何将这种理论偏差转化为 RAG 系…→No.1920为什么关键词匹配在很多场景下仍然很重要面试官想看你是否理解关键词匹配(如BM25)在RAG系统中的不可替代性,而非单纯背诵概念。这是“工程取舍”型问题,刁钻点…→No.1921为什么去重、去噪、字段标准化很重要面试官想看你是否理解RAG系统“垃圾进,垃圾出”的本质,而非只会调模型。这道题表面是问数据预处理,实际考察三点:一是对检…→No.1922为什么复杂文档结构下,简单 top-k chunk 容易失效面试官想看你是否理解“检索粒度”与“文档结构”之间的深层矛盾,而非单纯背诵chunking概念。考察类型是工程取舍+系统…→No.1923为什么复杂问题常常不适合只走一条召回链路面试官想考察你对检索系统在复杂场景下失效本质的理解,而非简单背诵“多路召回”概念。刁钻点在于:你是否能区分“复杂问题”的…→No.1924为什么很多 RAG Demo 能跑,但很难稳定上线面试官想看你是否真正经历过RAG从Demo到生产的“最后一公里”,而非只会调API跑通Jupyter Notebook。…→No.1925为什么很多业务问题最后是系统设计问题,而不只是模型问题面试官想看你是否具备系统级思维,而非“模型至上”的单一视角。这道题是典型的工程取舍 + 系统设计考察,刁钻点在于:候选人…→No.1926为什么很多团队卡在“Demo 很顺,落地很难”这一步面试官想考察你是否有从“玩具”到“生产系统”的实战认知。这不是背概念题,而是工程取舍 + 系统设计的混合题。刁钻点在于:…→No.1927为什么混合检索通常比单路检索更稳面试官想考察你对检索系统“稳定性”的工程理解,而非单纯背诵混合检索的定义。刁钻点在于:稳定性不是“平均效果好”,而是“最…→No.1928为什么索引阶段的设计失误很难在 Prompt 层补回来面试官想看你是否真正理解RAG系统的分层职责边界,而非只会调Prompt。核心考察点:索引层决定检索候选集的上限,Pro…→No.1930什么情况下应该先动 Chunk,什么情况下应该先动 Rerank,什么情况下该动 Prompt面试官想看你是否具备 RAG 系统调试的优先级判断力,而非只会背概念。这是一道工程取舍+系统设计题,刁钻点在于:候选人常…→No.1931什么时候值得加 Reranker?\「,面试官想考察你对 RAG 系统“成本-收益”的工程判断力,而非单纯背诵 Reranker 原理。刁钻点在于:候选人常无脑…→No.1932什么时候应该只返回检索结果,不做生成?\「,面试官想考察你是否能跳出“RAG 必须生成”的惯性思维,识别出生成环节是成本与风险的来源,而非必然增值步骤。这是典型的工…→No.1933什么时候应该要求模型引用来源?\「,面试官想考察你对 RAG 系统中“引用”机制的工程判断力,而非简单背诵概念。这是典型的系统设计取舍题,刁钻点在于:候选人…→No.1938How does the Response Relevancy metric help evaluate whether a RAG generator is addressing the user’s query effectively面试官想考察你对 RAG 评估体系的理解深度,而非单纯背诵指标定义。这道题看似基础,但“刁钻点”在于:Response …→No.1939Explain the difference between Precision@k and Recall@k in the context of RAG. When might you prefer one over the other面试官想确认你是否真正理解 Precision@k 和 Recall@k 在 RAG 中的工程含义,而非仅仅背诵定义。这…→No.1940What does context precision measure in a RAG retriever, and how does it differ from context recall面试官想考察你对 RAG 评估体系中最核心的两个指标——Context Precision 和 Context Reca…→No.1944一般你是如何选合适的embedding模型面试官想看的不是“你用过哪个模型”,而是你是否有系统化的选型方法论。这道题属于工程取舍+系统设计混合型,刁钻点在于:很多…→No.1945假设用户提出的问题在知识库中根本不存在,你会如何设计“拒答 / 置信度”机制?你如何定义 RAG 系统中的“不知道”面试官想看你是否理解RAG系统的可靠性边界,而非仅关注检索或生成性能。这是一道系统设计+工程取舍题,刁钻点在于:如何定义…→No.1946在 RAG 中,你是如何判断检索召回“是否足够好”的?如果要做一个离线评测体系,你会怎么设计标注、评估指标以及 A/B 对比策略这道题考察的是系统设计 + 工程取舍能力,而非单纯背指标。面试官真正想看的是:你是否理解检索质量对 RAG 最终回答的因…→No.1947不同基准测试在评估记忆形成、检索、演化方面各有什么侧重面试官想看你是否真正理解“记忆”在 Agent 中的三层能力(形成、检索、演化),而非只背 benchmark 名字。考…→No.1948在 RAG 中 Embedding 究竟是什么?如何选择和评估一个 Embedding 模型面试官想考察你是否真正理解 Embedding 在 RAG 中的角色——不只是“把文本转成向量”的背概念,而是能讲清它如…→No.1949怎么量化你的 RAG 效果面试官想看你是否具备系统化的 RAG 评估思维,而非只背几个指标。这题考察类型是系统设计 + 工程取舍,刁钻点在于:RA…→No.1951一个生产级 RAG 系统相比 Demo 多了哪些能力面试官想考察你是否真正经历过RAG从“跑通”到“扛住”的工程化过程,而非停留在调库Demo层面。这是典型的系统设计+工程…→