是什么
RAG 的工作链路分为离线与在线两部分。离线侧负责文档解析、文本切分并进行向量化入库。在线侧接收用户查询后,经过查询处理,执行向量、字面或混合检索,接着对检索结果重排,最后组装成上下文交由大模型生成带有引用约束的回答。
其关键设计点包括切分策略、混合检索、重排机制、查询改写,以及针对召回率、MRR 和忠实度的评测。在与微调的分工上,面对频繁更新或需要溯源的知识优先选择 RAG,改变模型行为风格或学习领域语法则依赖微调,两者可叠加使用。
解决什么问题
大模型单独工作时,存在参数知识带有截止日期、私有知识未进入训练集以及生成答案无法溯源等限制。RAG 通过将知识存放在外部数据库中,弥补了这些模型固有的缺陷。
外部知识的更新可以立即生效,使得模型能够回答最新或私有的信息。同时,生成的内容具备可引用的来源依据,并且可以通过外部库实现可控的数据访问权限。
面试怎么考
面试常要求口述完整流程,需熟练掌握离线入库与在线生成的各个节点。针对检索不准的排查考点,答题时应从查询改写、切分策略、检索方式及重排等环节逐一分析。
关于 RAG 和微调的选择,需明确知识更新与行为风格改变的边界。此外,考官常问知识库如何进行增量更新,以及 RAG 的评估指标,作答时应准确列举召回率与忠实度等标准。
又称:RAG · 检索增强生成
接着做点什么
—— 本条完 ——