RAG · ALL
RAG 检索增强 · 全部题目
共 591 篇,本页第 481-528 篇。← 回到学习路径视图
No.2647What are the key hyperparameters in a RAG pipeline面试官想看你是否真正理解 RAG 不是“一个模型”,而是一个由检索、重排序、生成三阶段组成的系统工程。这道题表面考“背参…→No.2649How does RAG help reduce hallucinations in LLM generated responses面试官想考察的远不止“RAG能减少幻觉”这个结论。真正想看的是:你是否理解幻觉产生的根本原因(参数化知识过时/缺失/错误…→No.2650What are the common retrieval approaches used in RAG systems面试官想考察你对 RAG 检索层的系统化认知,而非简单罗列方法名。这道题是典型的工程取舍 + 系统设计类型,刁钻点在于:…→No.2651What are some common challenges in RAG retrieval面试官想考察你对 RAG 检索环节的工程化认知深度,而非简单罗列“语义鸿沟、噪声”等表面概念。刁钻点在于:能否区分检索失…→No.2654How do you balance relevance and diversity when retrieving document chunks for RAG面试官想看你是否理解RAG检索环节的“信息冗余”陷阱——只追求top-k相关性会导致上下文被同质化片段填满,降低生成质量…→No.2655How do sparse embeddings differ from dense embeddings in terms of keyword matching and retrieval interpretability面试官想考察你对检索系统底层表示的理解,而非简单背诵定义。核心是看你能否从“表示形式→匹配机制→可解释性”这条逻辑链,讲…→No.2657How does re-ranking differ from the initial retrieval process in RAG面试官真正想考察的不是你是否知道“检索在前、重排在后的流程”,而是你对RAG两阶段设计背后工程取舍的深度理解。这是一道典…→No.2664What are effective strategies to reduce latency in RAG systems面试官想考察你能否从系统架构层面拆解 RAG 延迟瓶颈,而非只背“用缓存、用小模型”这种泛泛之谈。核心是区分“理论方案”…→No.2666Why is re-ranking important in the RAG pipeline after initial document retrieval面试官想考察你对 RAG 系统整条链路的理解深度,而非仅停留在“检索+生成”的粗浅认知。这道题属于工程取舍与系统设计的混…→No.2669What are the possible reasons for the poor performance of a RAG retriever面试官想看你能否系统化诊断RAG检索器性能问题,而非零散罗列原因。这是典型的debug+系统设计题,刁钻点在于:候选人常…→No.2681How does RAG help reduce hallucinations in LLMs面试官想考察你能否从系统架构层面解释RAG对抗幻觉的机制,而非停留在“检索+生成”的浅层理解。核心刁钻点在于:你是否清楚…→No.2686How does RAG work面试官想确认你是否真正理解RAG的工程本质,而非仅背诵“检索+生成”的皮毛。这是P0基础题,但刁钻点在于:能否清晰区分索…→No.2688What is a VectorDB, and how is it utilized in RAG retrieval面试官想确认你能否清晰区分向量数据库(VectorDB)与传统数据库(如MySQL、Elasticsearch),并理解…→No.2694增量更新索引通常怎么做面试官想考察你对向量索引“写路径”的工程理解,而非单纯背概念。增量更新是RAG系统从Demo到生产的关键瓶颈——全量重建…→No.2695新增、修改、删除数据分别怎么同步到索引面试官真正想看的是你对索引维护的工程细节,而非背CRUD概念。这是典型的系统设计+工程取舍题,刁钻点在于:候选人常只答“…→No.27RAG 检索真题 · Rag常见且chunk的方式有哪些?你用的是什么embedding真题完整解析:面试官想考察你对RAG系统“数据入口”的工程理解,而非背诵概念。刁钻点在于:chunking不是一刀切,e…→No.2728What are the different types of re-ranker models that can be used in RAG面试官想考察你对 RAG 系统中重排序(Re-ranking)环节的系统性理解,而非简单罗列模型名称。这属于工程取舍 +…→No.2732Describe a scenario where a BM25 retrieval might return relevant chunks but in poor ranking order. How would a neural re-ranker specifically address this limitation面试官想考察你对 RAG 检索-重排两阶段架构的工程取舍理解,而非单纯背诵概念。刁钻点在于:不仅要指出 BM25 的“词…→No.2733LightRAG vs GraphRAG:图检索怎么选GraphRAG 深而贵、LightRAG 轻而快、向量 RAG 最简。这篇给三种图检索方案的对比表与按「问题全局性」选…→No.28RAG 检索真题 · 向量数据库的embedding模型是什么?向量维度是真题完整解析:面试官想考察你对向量数据库选型的工程理解,而非背诵模型名称。刁钻点在于:候选人常只答“用text-embe…→No.901BM25 是什么面试官想确认你是否真正理解 BM25 的数学直觉和工程取舍,而不仅仅是背公式。这是典型的“背概念 + 工程取舍”混合题。…→No.902RAG 可以接哪些数据源面试官想考察你对 RAG 数据源多样性的理解深度,而不仅仅是罗列类型。真正刁钻点在于:你是否能区分不同数据源接入时的技术…→No.903RAG 是什么面试官想看的不是你对 RAG 的百度百科式定义,而是你是否真正理解它解决了 LLM 的什么核心问题,以及各组件在工程上的…→No.904Recall@K、Precision@K、MRR、nDCG 分别在看什么这道题看似是背概念,实则考察三个层次:第一层,是否清晰理解四个指标的定义和计算逻辑,而非死记公式;第二层,是否知道每个指…→No.905一个最小可用的 RAG 系统由哪些部分组成面试官想确认你能否从“最小可用”出发,拆解RAG系统的核心骨架,而不是堆砌生产级组件。这是典型的“系统设计+概念验证”题…→No.906为什么做完清洗和切块后,才能进入索引阶段这道题看似基础,但面试官真正想考察的是你对 RAG 全流程“数据依赖”的理解深度,而非简单背诵步骤。它属于工程取舍类型,…→No.907什么是 Chunk面试官想考察你对 RAG 系统基础组件的理解深度,而非单纯背定义。这题看似简单,但刁钻点在于:Chunk 不是“切一刀”…→No.908什么是 Embedding面试官考察你对 Embedding 本质的理解,而非仅仅背诵“将离散对象映射到连续向量”的定义。这是典型的背概念 + 工…→No.910什么是 Token面试官想确认你是否真正理解Token作为LLM输入基石的本质,而非仅停留在“Token是词”的模糊认知。这是基础概念题,…→No.911什么是“lost in the middle”面试官想考察你是否真正理解LLM在长上下文场景下的“注意力盲区”,而不仅仅是背概念。这是典型的工程取舍+系统设计类问题,…→No.912什么是元数据(Metadata)面试官想看你是否真正理解元数据在RAG系统中的“杠杆作用”,而非仅仅背诵“数据的数据”这个定义。这是工程取舍类问题,刁钻…→No.913什么是混合检索面试官想确认你是否理解“单一检索方法有偏”这个核心问题,以及能否给出工程上可行的融合方案。这属于工程取舍+系统设计类问题…→No.914什么是语言模型(Language Model)面试官想考察你对语言模型本质的理解,而非背诵定义。这是典型的“概念+演进”题,刁钻点在于:能否从概率建模的数学本质出发,…→No.915做 RAG 之前,为什么要先处理数据而不是直接喂给模型面试官想看你是否理解RAG系统“数据先行”的工程哲学,而非仅停留在模型调优层面。考察类型是工程取舍+系统设计,刁钻点在于…→No.916向量数据库到底存了什么面试官想确认你是否真正理解向量数据库的内部存储结构,而不是只会调 API 调包。表面是问“存了什么”,实际考察三个层次:…→No.917知识库数据清洗通常要做什么面试官想考察你对RAG系统数据预处理的理解深度,而非简单背诵清洗步骤。核心是看你能不能讲清楚“为什么清洗”以及“清洗如何…→No.918Embedding 在 RAG 里到底负责什么面试官想看你是否真懂Embedding在RAG中的核心职责,而非只会背“把文本转成向量”。考察类型是工程取舍+系统设计。…→No.919RAG 常见错误类型有哪些面试官想看你是否具备系统性诊断 RAG 系统的能力,而非零散地背几个错误。考察类型是工程取舍 + 分类思维。刁钻点在于:…→No.920Token 和字、词、子词有什么关系面试官想看你是否真正理解 Token 不是语言学单位,而是模型为了高效处理文本而设计的“计算单元”。这题看似基础,但刁钻…→No.921为什么文档必须切块面试官想考察你是否真正理解RAG系统中“检索”与“生成”的底层矛盾,而非单纯背诵“因为上下文窗口有限”。刁钻点在于:切块…→No.922为什么模型需要把 token 映射成向量表示面试官想看你是否真正理解“向量化”不是技术花活,而是神经网络能处理离散符号的唯一路径。考察类型是背概念 + 工程取舍。刁…→No.923为什么评测问题必须覆盖不同任务类型面试官想看你是否理解评测集设计的核心原则——任务覆盖度,而非仅仅会跑一个指标。这属于系统设计+工程取舍类问题,刁钻点在于…→No.924为什么页眉页脚、导航栏、模板噪声会影响 RAG 效果面试官想考察你对 RAG 数据管线的工程敏感度,而非单纯背概念。这道题看似基础,但刁钻点在于:它要求你从检索精度和生成质…→No.925什么是 Groundedness / Faithfulness面试官想确认你是否真正理解RAG生成质量评估的两个核心维度,而非仅背概念。考察类型是概念辨析+工程取舍。刁钻点在于:多数…→No.926文档、网页、数据库、代码库有什么区别面试官想看你是否真正理解RAG系统的数据工程基础,而非只背概念。这是一道系统设计+工程取舍题,刁钻点在于:候选人常只回答…→No.927Embedding 在 LLM 里主要负责什么面试官想考察你对 LLM 底层机制的理解深度,而非简单背诵“Embedding 是向量映射”。这道题是典型的概念辨析 +…→No.928TopK 不是越大越好,为什么面试官想考察你对 RAG 系统“检索-生成”耦合的深层理解,而非单纯背概念。这是一个工程取舍题,刁钻点在于:候选人常误以…→No.929一个最小 Demo 最应该先保证什么,而不是先优化什么面试官想看你是否具备工程化 MVP 思维,而非只会堆砌技术组件。这道题表面问“先保证什么”,实则考察你对 RAG 系统核…→