Q1011RAG 检索增强真题解析RAG(检索增强生成)AgentAlpha 社区真题库约 9 分钟更新 2026-09-29

什么时候该换模型,什么时候该改 Prompt,什么时候该加 RAG

面试官真正想看的是你在 LLM 应用落地中的工程决策能力,而非背诵概念。考察类型是系统设计 + 工程取舍。刁钻点在于:候选人往往只会“先改 Prompt,不行加 RAG,再不行换模型”这种线性思维,但实际场景中成本、延迟

1 什么时候该换模型,什么时候该改 Prompt,什么时候该加 RAG

P1 · rag

🏷 标签:rag, prompt-engineering, model-selection, cost-benefit

1️⃣ 考察意图

面试官真正想看的是你在 LLM 应用落地中的工程决策能力,而非背诵概念。考察类型是系统设计 + 工程取舍。刁钻点在于:候选人往往只会“先改 Prompt,不行加 RAG,再不行换模型”这种线性思维,但实际场景中成本、延迟、维护复杂度是动态博弈的。答好了能展示你对成本效益分析(Cost-Benefit)、任务复杂度分层(Task Taxonomy)和迭代优化方法论(Iterative Optimization)的硬实力,证明你不是只会调 API 的“提示词工程师”。

2️⃣ 标准答

这个问题没有银弹,核心是根据任务复杂度、成本预算、数据特性做三层决策。我按“先诊断、后开方”的逻辑组织:

第一步:诊断任务瓶颈

  • 改 Prompt 的适用场景:任务边界清晰、输出格式固定、模型本身能力足够但“没理解”你的意图。例如:分类任务(情感分析)、结构化抽取(JSON 输出)、角色扮演风格控制。典型信号:模型输出偏离格式、幻觉率低但逻辑不对、few-shot 示例能明显提升效果。
  • 加 RAG 的适用场景:任务依赖外部知识或长尾信息,模型参数内知识不足。例如:企业文档问答、实时新闻摘要、产品手册客服。典型信号:模型对低频实体(如“2024 年 Q3 财报数据”)胡编乱造、用户问题需要引用具体文档、知识更新频率高(周级)。
  • 换模型的适用场景:任务需要强推理(多步逻辑、数学证明)、多轮规划(Agent 工具调用)、长上下文理解(100K+ tokens)。例如:代码生成、复杂数学题、多 Agent 协作。典型信号:改 Prompt 和 RAG 后准确率仍低于 60%、模型无法遵循复杂指令(如“先总结再分类最后生成 JSON”)、延迟和成本预算允许升级。

第二步:工程取舍(Trade-off)

  • 改 Prompt 成本最低但天花板明显:一次 Prompt 优化(如加 Chain-of-Thought、格式约束)成本约 0.1 美元(API 调用费),但效果上限受限于模型能力。坑:过度优化 Prompt 会导致“过拟合”,换一个类似任务就失效。解法:用 Prompt 版本管理(如 LangSmith)记录每次改动,并设置 A/B 测试。
  • 加 RAG 效果提升大但维护成本高:需要搭建知识库(Chunking 策略、Embedding 模型选择、Reranker 部署)。实际落地的坑:Chunk 大小设 512 tokens 时,长文档召回率低;设 1024 tokens 时,检索噪声大。解法:用滑动窗口 + 重叠(overlap=128 tokens),并配合Hybrid Search(BM25 + Dense Retrieval)平衡精确匹配和语义相似度。维护成本:每周更新知识库需 2-3 小时人力。
  • 换模型成本最高但效果最稳:从 GPT-3.5 换到 GPT-4,API 费用涨 10-20 倍,延迟从 1 秒变 3 秒。坑:盲目换模型可能“杀鸡用牛刀”,比如简单分类任务用 GPT-4 和 GPT-3.5 准确率差不到 2%,但成本翻 10 倍。解法:先做小样本测试(50 条数据),对比不同模型在准确率、延迟、成本上的表现,用Pareto 最优决策。

第三步:迭代顺序与监控

  • 推荐顺序:先改 Prompt(1-2 天)→ 加 RAG(1-2 周)→ 换模型(1 天,但需预算审批)。例外:如果任务本身需要强推理(如数学题),直接跳过前两步,换模型。
  • 监控指标:准确率(Accuracy)、召回率(Recall)、用户满意度(CSAT)、单次请求成本(Cost/Query)、P95 延迟。决策阈值:当改 Prompt 后准确率 < 70% 且成本 < 0.01 美元/次,启动 RAG;当 RAG 后准确率 < 80% 且预算允许,换模型。

3️⃣ 答题模板(30 秒电梯版)

“这个问题我从三个层面回答:第一,诊断任务瓶颈——改 Prompt 适合格式控制,加 RAG 适合外部知识,换模型适合强推理;第二,工程取舍——改 Prompt 成本最低但天花板明显,RAG 效果提升大但维护成本高,换模型效果最稳但成本最高;第三,迭代顺序——先改 Prompt,再试 RAG,最后换模型,但强推理任务直接换模型。总结一句:没有银弹,核心是成本效益分析加小样本测试。”

4️⃣ 高频追问 & 应对

追问 1:你提到 RAG 维护成本高,具体怎么量化?比如 1000 个文档的知识库,每周更新一次,人力成本是多少?

量化分三块:1)数据预处理:新文档需 Chunking(用 LangChain 的 RecursiveCharacterTextSplitter,chunk_size=512, overlap=128),耗时约 2 小时/1000 文档;2)Embedding 生成:用 text-embedding-3-small,1000 文档约 0.5 美元 API 费,耗时 10 分钟;3)索引更新:用 FAISS 或 Pinecone 增量更新,需 1 小时脚本维护。总人力成本约 3-4 小时/周,API 成本约 2 美元/周。取舍:如果文档更新频率高(日级),建议用异步流水线(如 Airflow 调度),但初期搭建成本高。

追问 2:如果用户问题同时需要外部知识和强推理,比如“根据 2024 年财报数据,计算公司毛利率并对比行业平均”,你怎么选?

这是典型混合场景,我选“RAG + 换模型”组合:先用 RAG 检索财报文档(用 Hybrid Search 提高召回),再喂给强推理模型(如 GPT-4 或 Claude 3.5)做计算。坑:RAG 检索结果可能包含噪声,导致推理错误。解法:加 Reranker(如 Cohere Rerank 3)过滤 Top-3 相关片段,并在 Prompt 中明确“只基于提供的文档计算,不要编造行业数据”。如果预算有限,可先用 GPT-3.5 做 RAG 检索,再让 GPT-4 做推理,成本降低 50%。

追问 3:你提到“小样本测试”,具体怎么做?样本量多大?怎么评估?

样本量:50-100 条,覆盖高频、低频、边界 case(如歧义问题、多轮对话)。评估方法:1)准确率:人工标注 ground truth,对比模型输出;2)召回率:对 RAG 场景,看检索结果是否包含正确答案;3)成本:统计 API 调用次数和 token 数;4)延迟:记录 P95 延迟。工具:用 LangSmith 或 Weights & Biases 做实验追踪,自动生成对比报告。决策:如果 GPT-3.5 + RAG 准确率 > 85%,就不换模型;否则换 GPT-4,但需确认成本增幅在预算内。

5️⃣ 避坑 · 常见错误答法

  • ❌ “先改 Prompt,不行加 RAG,再不行换模型,这是标准流程。” → ✅ “标准流程是基础,但需要根据任务复杂度做动态调整:强推理任务直接换模型,外部知识任务优先加 RAG,格式控制任务才先改 Prompt。”
  • ❌ “RAG 就是加个知识库,很简单。” → ✅ “RAG 的坑很多:Chunk 大小、Embedding 模型选择、Reranker 部署、知识更新频率,每个环节都有 trade-off。比如 Chunk 太大检索噪声高,太小召回率低,需要实验调参。”
  • ❌ “换模型就是升级到 GPT-4,效果肯定好。” → ✅ “换模型前必须做成本效益分析:简单分类任务 GPT-3.5 和 GPT-4 准确率差不到 2%,但成本涨 10 倍,性价比极低。只有强推理任务才值得换。”

6️⃣ 简历呼应

  • 如果你有 RAG 项目:从“知识库维护成本”切入,讲你如何用 Hybrid Search 和 Reranker 优化检索,并对比改 Prompt 和换模型的成本差异。例如:“在客服问答项目中,我通过改 Prompt 解决 80% 高频问题,加 RAG 覆盖 15% 低频问题,最后只对 5% 复杂推理问题换 GPT-4,总成本降低 60%。”
  • 如果你只做过传统 NLP:用“特征工程 vs 模型选型”类比。例如:“传统 NLP 中,改 Prompt 类似特征工程(低成本调参),加 RAG 类似引入外部知识库(如 WordNet),换模型类似从 SVM 换到 BERT。核心都是成本效益分析。”
  • 如果你是校招无项目:聚焦“小样本测试方法论”。例如:“我在论文复现中,用 GPT-3.5 和 GPT-4 对比 50 条数学题,发现 GPT-3.5 准确率仅 40%,而 GPT-4 达 85%,但成本高 15 倍。最终选择 GPT-4 + 缓存机制,平衡效果和成本。”
  • 《RAG vs Fine-tuning vs Prompt Engineering: A Practical Guide》by LangChain Blog
  • 《When to Use RAG, When to Fine-Tune, and When to Switch Models》by Pinecone
  • 《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》by Wei et al. (2022)
  • 《Hybrid Search: Combining BM25 and Dense Retrieval for Better RAG》by Cohere
  • 《Cost-Effective LLM Deployment: A Pareto Analysis of Model Selection》by Anthropic Research

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。