高频题速答 · QUICK ANSWERS
Agent 面试题大全
40 道真实高频题,一题一页。每页先给一句能直接说出口的结论,再补追问点和常见的坑。面试前速刷,面试中救场。
题目来自社区成员的真实面经与公开面经汇总,按大家实际会搜的说法组织。 想看逐层拆解的长文,去深度解析;想按学习路线刷,去专栏目录。
RAG 检索增强
从文档到答案的整条链路:Embedding、分块、多路召回、重排、缓存与权限。答这类题要先说清链路分层,再讲每一层你踩过的坑。
8 题Q · RAG 和微调怎么选?什么场景该用哪个?知识要更新、要溯源,用 RAG;行为、格式、领域语感不对,用微调;两者不冲突,多数生产系统是先 RAG 后微调。Q · RAG 的完整流程是什么?从文档到答案要过几道工序?两段六步:离线把文档解析、清洗、切分、向量化后入库;在线把查询改写、召回、重排后拼进提示词让模型生成带引用的答案。Q · 文档切分(Chunking)怎么做?块切多大合适?从固定的几百 token 加重叠起步,再按文档结构升级——标题层级切块、表格整块保留、父块检索子块匹配,切分质量决定检索上限。Q · Embedding 模型怎么选?看哪些指标?五个维度:中文/多语能力、检索精度(看 C-MTEB 这类榜单)、最大输入长度、推理成本、能否私有化部署;选定后用自己的数据建评测集复测,别只信榜单。Q · 向量数据库怎么选?Milvus、FAISS、PGVector 差在哪?先问规模和运维:千万级以下原型用 FAISS,已有 PostgreSQL 的用 PGVector,亿级、多副本、要标量过滤的再上 Milvus 这类专用库——别一上来就堆专用设施。Q · RAG 检索不准怎么排查?从哪一步开始查?先把检索和生成分开评——命中了答错是生成的问题,没命中是检索的问题;检索问题再按切分、查询改写、召回、重排四段逐层看。Q · RAG 的效果怎么评估?有哪些指标?分两侧评:检索侧看 Recall@k、MRR 这类排序指标,生成侧看忠实度、答案相关性、引用准确;没有标注就先建几十条 Golden Set,工具上 RAGAS 这类框架可以起步。Q · 混合检索和重排序(Rerank)是什么?为什么向量检索不够用?向量检索懂语义但抓不准精确词——型号、错误码、人名容易丢;补一条 BM25 关键词链路做混合检索,再用交叉编码器把两路结果重排,召回率和排序质量都上台阶。
Agent 架构
ReAct 循环、规划与反思、记忆系统、整体设计。面试官最想看的是你能不能说出「为什么这么拆」,而不是背框架名字。
8 题Q · 什么是 AI Agent?它和直接调用大模型有什么区别?直接调用是「一问一答」,Agent 是让模型在循环里自主使用工具、维护状态、根据反馈决定下一步,直到把目标做完。差的是「行动循环」,不是模型更强。Q · ReAct 是什么?它是怎么跑起来的?ReAct 让模型交替输出「思考(Reason)」和「行动(Act)」:想一步该干什么、调一次工具、看一眼结果再想下一步,把推理过程和行动轨迹串成一个循环。Q · ReAct、Plan-and-Execute、Reflection 三种范式有什么区别?怎么选?ReAct 边想边走适合路径不明的短任务,Plan-and-Execute 先立整体计划再分步执行适合步骤多的长任务,Reflection 在执行后自我审查再返工,三者常组合用而不是三选一。Q · Agent 的记忆系统怎么设计?按寿命分层:上下文窗口是工作记忆,向量库放长期记忆,数据库放结构化事实;要点是定清楚「什么值得记、怎么检索回来、什么时候过期」。Q · Agent 的上下文窗口不够用怎么办?四板斧:裁剪(丢旧留新)、压缩(长文摘要化)、外置(状态写进存储按需取回)、分流(子任务拆给独立上下文)。目标是让窗口只装当前决策需要的信息。Q · Agent 为什么会陷入死循环?怎么检测和治理?死循环的根子是「模型看不到失败」:同一动作反复重试、两个工具互相踢皮球、错误输出被当成进展。治理靠检测(轨迹指纹、轮数预算、进度指标)加干预(升级提示、换路线、交还人)。Q · Agent 的效果怎么评估?评测集怎么建?分任务级(最终结果对不对)、轨迹级(过程合不合理)、成本级(轮数和 token)三层评;评测集从真实任务来,按难度分级,改一版跑一遍——没有回归评测的 Agent 迭代等于盲飞。Q · Workflow 和 Agent 有什么区别?什么时候不该用 Agent?Workflow 是人写死的流程图,模型只填空;Agent 是模型自己决定下一步。流程稳定、错误代价高的场景用 Workflow,路径真不确定才上 Agent。能用 Workflow 解决的问题上 Agent 是负收益。
工具调用
Function Call、MCP、A2A、Skills,以及工具过百之后的注册、发现、路由与 Schema 设计。落点永远在「准确率抓在哪个环节」。
7 题Q · Function Calling 是什么?模型是怎么学会调工具的?把工具的名字、用途、参数 Schema 写进提示词,模型输出结构化的调用意图(工具名 + JSON 参数),由应用侧执行后把结果喂回——模型只「点菜」,执行在你的代码里。Q · MCP 协议是什么?和 Function Calling 有什么区别?Function Calling 是模型「选工具、填参数」的能力,MCP 是把工具标准化接入的开放协议——一个管能力,一个管接入层,MCP 服务器暴露的工具最终还是要靠 Function Calling 来调。Q · Function Calling 准确率上不去怎么优化?按错误类型对症下药——选错工具改描述和工具筛选,参数填错改 Schema 设计和校验回路,时机错误改流程约束;先建错误分类账,再逐类治理。Q · 工具有上百个的时候,Agent 怎么选对工具?别让模型直面几百个工具——加一层工具检索:按语义把工具索引起来,每个场景先召回最相关的一小撮,再让模型在里面选;工具多本身是设计问题,先合并同类再上检索。Q · 工具调用失败怎么办?重试和兜底怎么设计?先把错误分类:参数错就回传让模型改,瞬时故障做退避重试,确定性失败立刻换路线;重试要有上限和预算,最后一级兜底是降级输出或转人工,绝不静默吞错。Q · A2A 协议是什么?它和 MCP 是什么关系?MCP 解决「Agent 怎么接工具」,A2A 解决「Agent 和 Agent 怎么协作」。前者是纵向的能力接入,后者是横向的智能体互操作,两个协议互补而不是竞争。Q · 怎么防止 Agent 调工具时越权?权限怎么控?三道闸:Agent 只拿到当前任务需要的最小工具集,写操作和高危操作强制人工确认,执行层用独立凭据按资源级鉴权。权限控制在代码里,不在提示词里。
多智能体
角色切分、消息协议、状态同步、冲突仲裁。拆多 Agent 不是人多力量大,是上下文稀缺和角色混乱逼出来的工程选择。
4 题Q · 什么是多智能体(Multi-Agent)?什么时候才需要多个 Agent?多个各有职责、各有上下文的 Agent 通过消息协作完成任务——当单 Agent 的上下文装不下、工具互相打架、或者任务天然要多种专业视角时,才值得拆多智能体。Q · 多 Agent 系统怎么通信、怎么编排?编排有三种基本形:主从式(一个 Leader 分派汇总)、流水线式(按阶段接力)、群聊式(共享消息板自由认领);通信靠结构化消息和明确协议,核心是把「交接什么信息」定义清楚。Q · 单 Agent 和多 Agent 怎么选?默认单 Agent,直到出现三个信号(上下文装不下、职责互相污染、权限需要隔离)才拆多 Agent;拆的时候先粗后细,每一次拆分都要能说清「解决了什么问题」。Q · 多 Agent 系统常见的失败模式有哪些?四类高发:交接时信息损耗、子任务目标漂移越帮越乱、循环互踢皮球、错误沿链路传播放大。治理上有共性:结构化交接契约、独立验收、全程留痕可回放。
记忆系统
工作记忆、情景记忆、语义记忆、程序性记忆怎么分,什么信息值得写入,冲突怎么覆盖合并,遗忘怎么设计。
3 题Q · Agent 的长期记忆和短期记忆怎么分层?三层:上下文窗口里的工作记忆(本轮任务)、向量库里的情景/语义记忆(跨会话)、数据库里的结构化事实(精确读写);每层有明确的写入门槛和淘汰机制。Q · Agent 的记忆检索和 RAG 检索是一回事吗?底层机制相似(都是向量检索),但数据源、条目形态、更新频率、冲突处理完全不同:记忆是「关于这个用户的、活的、会过期的」,文档是「外部的、静态的、有版本的」。Q · 上下文快满了,Agent 的记忆怎么压缩?分层处理:丢(裁掉旧轮次和冗余工具输出)、缩(结构化摘要替换原文)、沉(稳定事实写入长期记忆从上下文移除)。压缩的原则是保决策依据,丢过程细节。
评测与可观测
非确定系统的回归测试、Golden Set、LLM 裁判校准、trace 埋点与可观测性。核心是别让被测者改自己的分数。
4 题Q · 用大模型给大模型打分(LLM-as-Judge)可靠吗?怎么用才靠谱?有系统性偏差但可用——前提是评分细则拆到可判定、给参考样例、做位置去偏、定期人工抽检校准;裁判分数用于筛选和趋势对比,关键决策仍靠人。Q · 大模型评测都看哪些 Benchmark?榜单排名可信吗?通用能力看 MMLU 系列和 GPQA,代码看 HumanEval/SWE-bench,数学看 AIME,Agent 能力看 SWE-bench 和各类 agent benchmark;榜单看趋势别看名次:数据污染、应试特化和场景错配是三个坑。Q · Agent 改了一版提示词,怎么知道没有改坏别的地方?靠回归评测集:改前改后跑同一批用例,任务成功率、轨迹质量、成本三类指标对比,绿了才上线;再配线上灰度和反馈监控兜底。Q · 评测用的 Golden Set 怎么建?从真实任务采样起步,人工标注「标准答案 + 评分要点」,覆盖正常、边界、失败三类场景;小而准胜过大而杂,随线上反馈滚动补充;Golden Set 本身也要版本管理。
项目实战与企业级
从 demo 到生产的差距:私有知识、权限边界、可审计、业务集成、成本可控。项目题八成问的是这五件事。
6 题Q · 大模型幻觉是什么?有哪些缓解办法?模型生成了流利但无依据的内容,根子在于它按概率续写而非查证事实。缓解靠外挂事实源(RAG)、约束生成(引用、温度、格式)、分层校验(自动断言 + 人工抽检)三层组合,无法根治只能压低。Q · 企业知识库 RAG 落地最常见的坑是什么?大头不在算法在数据:文档解析质量差、数据陈旧没版本、权限没接住;其次是把 demo 效果当上线预期。顺序上先修数据工程,再谈模型优化。Q · 大模型应用的 API 成本怎么降?顺序是:先省 token(上下文瘦身、输出限制),再上缓存(重复问题、公共前缀),再做路由(简单任务用小模型),最后才是砍功能或换部署方式,按性价比从高到低逐层做。Q · Agent 响应太慢怎么排查和优化?先打点分段定位:LLM 推理、工具执行、编排开销各占多少;大头通常是串行的 LLM 调用次数,优化顺序是减轮次、并行化、流式输出、缓存,最后才是换更快模型。Q · 大模型私有化部署怎么选型?四步走:先算业务要的能力档位,再按显存预算选模型规格(参数量 × 量化等级),然后选推理引擎和硬件,最后补齐外围(网关、监控、微调链路)——私有化是成本与可控性的权衡,不是免费午餐。Q · 大模型应用的安全问题有哪些?提示注入怎么防?六类风险:提示注入、越权与数据泄露、幻觉误导、内容合规、供应链安全、滥用与成本攻击;提示注入无法根治,防线是把「不可信内容只当数据」和权限、审计、人审组合起来。