RAG · ALL

RAG 检索增强 · 全部题目

共 591 篇,本页第 49-96 篇。← 回到学习路径视图

No.11RAG 为什么越用越慢?反向调优的排查顺序上线时很快的 RAG,一年后高峰期开始超时,期间没人改过代码。慢不是单一 bug,是索引膨胀、数据倾斜、缓存退化、重排加…→No.1101什么样的数据不应该直接进入知识库面试官想考察你对 RAG 知识库“数据准入”的工程判断力,而非简单背诵。核心是:你是否理解“知识库不是垃圾桶”,能识别出…→No.1103从用户提问到模型回答,中间数据流是怎么走的面试官想看你是否真正理解 RAG 系统从输入到输出的完整数据流,而不仅仅是背出“检索-生成”两个词。这是典型的系统设计 …→No.1105哪些场景适合用 RAG,哪些场景不适合面试官想看你能否跳出“RAG 万能论”的陷阱,精准判断技术选型的边界。这题不是背概念,而是工程取舍决策——考察你是否理解…→No.1106图片、表格、图表、PDF 等复杂格式为什么更难处理面试官想看的不是你会不会用OCR,而是你对“非结构化数据”在RAG pipeline中从解析到检索的整条链路失真有系统认…→No.1111召回到了不等于模型就能答好,为什么面试官想看你是否理解RAG系统的“最后一公里”瓶颈:检索(Recall)只是信息获取,生成(Generation)才是价…→No.1112如何避免旧 Chunk 残留、重复索引和脏数据面试官想考察你对 RAG 系统数据一致性的实战理解,而非单纯背概念。刁钻点在于:候选人常只提“加唯一ID”或“定期清理”…→No.1113秒?用户问个报销流程等 5 秒,百度搜索都比你快。你们怎么优化的面试官在测试你的系统性能优化能力,而非单纯背诵RAG流程。刁钻点在于:用户对“5秒”的直观抱怨,指向的是端到端延迟(TT…→No.1114长文档、多文档、跨文档问题分别怎么优化面试官想看你能否跳出“RAG = 检索+生成”的简单认知,针对不同文档结构(长、多、跨)给出差异化的工程优化策略。这是系…→No.11155. RAG的完整流程,构建向量检索库时如何处理时间衰减对召回的影响面试官想看你是否真正做过RAG系统,而非只背过流程。核心考察点:时间衰减是向量检索中一个刁钻的工程问题——传统向量库只关…→No.1117为什么“有知识库”不等于“知识真的可用”面试官想考察你从“数据搬运”到“工程落地”的认知差距。这不是背概念题,而是系统设计 + debug 题。刁钻点在于:多数…→No.1122BM25 和向量检索的结果怎么融合的面试官想看你是否真正理解混合检索(Hybrid Search)在RAG系统中的工程落地,而非只会背RRF公式。考察类型是…→No.1123BM25和向量检索的权重比例你是怎么定的面试官想看你是否理解混合检索(Hybrid Search) 中不同检索器融合的工程本质,而非简单背公式。考察类型是工程取…→No.1124Bert句向量空间的各向异性有了解过吗?解释一下面试官想考察你对BERT句向量表示缺陷的底层理解,而非简单背诵。这属于概念+工程取舍类型,刁钻点在于:多数人只知道“各向…→No.1125DiskANN 向量索引原理面试官想考察你对向量索引从内存到磁盘的工程演进理解,而非单纯背诵 HNSW 或 IVF 原理。刁钻点在于:DiskANN…→No.1129How does RAG help reduce hallucinations in LLMs?**面试官想考察你对RAG(检索增强生成)缓解幻觉的机制理解深度,而非简单背诵流程。核心是:你是否能区分RAG是“减少”而非…→No.1130How is an embedding model used in the context of LLM applications?**面试官想考察你是否理解 embedding 模型在 LLM 应用中的工程集成模式,而非仅仅背诵“把文本转成向量”的定义。…→No.1131How to benchmark embedding models on your data?**面试官想看的不是你会不会调API,而是你能否在真实业务数据上,科学地判断哪个embedding模型最适合你的场景。这是典…→No.1132How to evaluate RAG-based systems?**面试官想看的不是你会背RAGAS指标列表,而是你是否理解评估本身是一个系统设计问题。考察类型是工程取舍+系统设计。刁钻点…→No.1133How to find the ideal chunk size?**面试官想考察的不是“你背过 chunk size 默认值”,而是你是否有系统化的实验方法论来应对真实 RAG 系统的性能…→No.1134How to handle list item during chunking?**面试官想考察你对非连续文本(列表)的 chunking 策略设计能力,以及结构化信息保留与检索效果的权衡。这属于工程取舍…→No.1135HyDE感觉比较费力面试官想看你是否真正理解HyDE(Hypothetical Document Embeddings)的工程代价,而非只会…→No.1137MinerU 你用下来觉得有什么不足?你怎么解决的面试官想看你是否真正用过 MinerU 这类文档解析工具,而非停留在“知道名字”层面。考察类型是工程取舍 + debug…→No.1139Q11: 了解搜索系统吗?和 RAG 有什么区别?**面试官想看你是否真正理解搜索系统和RAG在系统设计层面的本质差异,而非停留在“搜索返回列表,RAG生成答案”的浅层对比。…→No.1140Q12: 知道或者使用过哪些开源 RAG 框架比如 Ragflow?如何选择合适场景?**面试官想考察你对 RAG 生态的广度和选型深度。表面是问“知道哪些框架”,实则是看:你是否踩过坑、能否根据业务场景做工程…→No.1141Q14: RAG中知识库搭建,对知识库的文件文档进行动态增量更新,怎么来避免新旧文档的分布不一致导致的检索偏差问题?**面试官想看你是否真正处理过RAG系统的“脏活”——增量更新带来的数据分布漂移。这不是背概念题,而是工程取舍+系统设计题。…→No.1142Q15: RAG如果有噪声怎么办?**面试官想考察你对RAG系统噪声问题的系统性认知,而非单一技巧。这是P1进阶题,刁钻点在于:多数候选人只想到“加个rera…→No.1143Q19: 在RAG里的「召回-过滤-生成「三段式 pipeline能细讲一下吗?**面试官想看你是否真正理解RAG pipeline的工程本质,而非背概念。这道题是典型的系统设计+工程取舍类型,刁钻点在于…→No.1144Q2: 一个完整的 RAG 流水线包含哪些关键步骤?请从数据准备到最终生成,详细描述整个过程面试官想看的不是“RAG 就是检索+生成”这种教科书定义,而是你对工程整条链路的掌控力。这道题是典型的系统设计 + 工程…→No.1145Q3: 如何优化向量检索的召回速度?**面试官想考察你对向量检索工程落地的深度,而非单纯背诵索引类型。这是典型的“工程取舍+系统设计”题,刁钻点在于:候选人常只…→No.1146Q5: 除了基础的向量检索,你还知道哪些可以提升 RAG 检索质量的技术?**面试官想看你是否只停留在“向量检索+LLM”的玩具级认知,还是真正落地过生产级RAG系统。考察类型是系统设计+工程取舍,…→No.1147Q7: 在什么场景下,你会选择使用图数据库或知识图谱来增强或替代传统的向量数据库检索?**面试官想看你是否理解“存储引擎选型”的本质,而非死记硬背。考察类型是系统设计取舍,刁钻点在于:很多人以为向量数据库是 R…→No.1148Q8: 如何全面地评估一个 RAG 系统的性能?请分别从检索和生成两个阶段提出评估指标面试官想看你是否具备系统级评估思维,而非只背几个指标。刁钻点在于:RAG 评估不是简单堆指标,而是解耦检索与生成,并理解…→No.1149Q8:如何评估一个 RAG 系统面试官想看你是否理解RAG评估的多维性,而非简单堆指标。考察类型是系统设计+工程取舍。刁钻点在于:RAG是检索+生成的串…→No.1150Q: GraphRAG 相比传统 RAG 的算法改进是什么?它适用于什么场景面试官想看你是否理解RAG的演进逻辑,而非死记硬背概念。传统RAG(Naive RAG)依赖向量相似度检索,本质是“语义…→No.1151Q: MemGPT 和传统的 RAG 在处理长上下文时有何本质区别面试官想考察你是否理解“有状态”与“无状态”系统在长上下文处理上的架构级差异。这不是背概念题,而是系统设计题。刁钻点在于…→No.1152Q: 密集检索和稀疏检索的优缺点分别是什么?为什么 Hybrid Search 通常效果更好面试官想考察你对检索范式本质的理解,而非单纯背概念。这是典型的“工程取舍+系统设计”题:密集检索(Dense Retri…→No.1153Question 6: How do you choose the right fine-tuning strategy (full vs. specific PEFT method) for a given task and resource constraints?**面试官想看的不是你会背LoRA公式,而是你在真实工程中如何做决策——在GPU预算、数据量、部署灵活性和性能天花板之间做取…→No.1156RAG作为工具时,如何设计Query路由策略面试官想考察你对 Agent 工具调用中“决策层”的设计能力,而非单纯背诵 RAG 流程。刁钻点在于:路由不仅仅是“分类…→No.1158RRF 重排序的具体实现和优化面试官想考察你对多路召回融合(Multi-Stage Retrieval)中重排序(Re-ranking)的工程落地能力…→No.1159RRF的k值你用的多少面试官真正想看的是你对 RRF(Reciprocal Rank Fusion)这个融合排序算法的理解深度,而不仅仅是背参…→No.1161Rerank 对所有页的结果都做精排吗?Top 100 全部过 Cross-Encoder 不会太慢?你们怎么优化的面试官想考察你对 RAG 系统中 Rerank 环节的工程落地能力,而非单纯背诵 Cross-Encoder 原理。刁钻…→No.1162Rerank 用的什么模型?为什么只排前 100 条面试官想考察你对 Rerank 模块的工程落地理解,而非单纯背模型名。刁钻点在于:为什么是 100 条?不是 50 或 …→No.1163Walk me through steps of improving sentence transformer model used for embedding?**面试官想看你是否真正动手微调过 Sentence-BERT,而非只背过概念。这是一道工程取舍 + 系统设计题,刁钻点在于…→No.1164What are the advantages of Agentic AI compared to RAG Chatbot. How do you convince the business regarding this?**面试官想看你是否真正理解Agentic AI与RAG Chatbot的本质差异,而非停留在“RAG查文档,Agent能干…→No.1165What are the different types of chunking methods?**面试官想考察你对 RAG 系统底层数据预处理的理解深度,而非简单背诵方法名。这是典型的“工程取舍 + 系统设计”题,刁钻…→No.1166What factors influence chunk size?**面试官想考察你对 RAG 系统核心超参数 `chunk size` 的多维度工程权衡能力,而非单纯背诵“256 toke…→No.1167What is 「chunking「 and why is it important in RAG?**面试官想考察你对RAG系统底层数据预处理的理解深度,而非简单背定义。核心是看你能不能讲清chunking如何影响检索精度…→