AgentAlpha 笔记 · 第 1 辑
Agent 面试都问什么,
我们一篇篇拆过。
题目来自大厂 Agent 岗位的真实面试,每篇把一个追问从拆解写到能落地的答案。
按问题挑
四条主线,按问题分组。
每条主线收的是解决同一类问题的笔记。对上你手头的题,就从那条进。
Agentic RL
Agent 怎么从行动里学会负责
从 ReAct 讲到长轨迹强化学习,弄明白奖励、归因、rollout 和评测在真实系统里为什么会失效。
Agent 已经会 ReAct,为什么还要做 Agentic RL?
会调工具只说明流程跑得通。Agentic RL 真正要练的是环境变了怎么办:何时搜索、何时执行、何时停,失败后哪一步真正左右结果。
开始阅读Agent 做错了,二十步里到底哪一步该负责?
一条二十步的轨迹,真正改变结果的可能就两三步。credit assignment 要做的就是把这几步挑出来,而不是给整条轨迹开一张糊涂罚单。
开始阅读GRPO 训练 Agent,为什么 rollout 总把系统拖垮?
GRPO 的公式不难,难的是采出一批比得了、复现得了、成本也扛得住的 Agent 轨迹。工具、并发、超时,加上轨迹长短不齐,随时能把训练系统拖垮。
开始阅读Agent 把奖励刷满了,为什么任务还是没做成?
Reward hacking,是验收器给了个更好钻的空子。Agent 越擅长用工具,越得把奖励和真实结果分开核对。
开始阅读Code Agent
会写代码,不等于能交付
上下文、测试、权限和恢复机制没做扎实,Code Agent 就还是演示玩具,称不上可靠的工程系统。
代码 Agent 为什么总要先读仓库,再开始写?
给 Agent 喂仓库,要讲优先级:任务约束、代码入口、依赖关系、验证路径。读对地方,比读得多更要紧。
开始阅读面试官追问:代码 Agent 说测试全绿,为什么我还是不敢合并?
测试全绿,只说明这轮没抓到问题。Code Agent 还得说清改了哪里、测了哪里、哪些边界没碰到,不能丢出一行 passed 就完事。
开始阅读Code Agent 为什么不能直接给 root 权限?
权限没有一键总闸。文件、网络、进程、身份、审批五个口子要逐一设卡,而且每张卡都得能验证。
开始阅读Code Agent 跑到一半挂了,怎样恢复又不重复执行?
恢复不是把聊天记录从头再播一遍,得靠持久化状态、操作幂等键,再加上对未知结果的对账,把重复副作用挡在外面。
开始阅读Code Agent 怎样把一句需求稳稳做成补丁?
靠谱的 Code Agent 不会拿一句需求直接换一大段代码,先拆成可验证的任务,照着仓库里的证据小步改,最后分层验收,证明补丁真能交付。
开始阅读RAG
答案要有证据,证据还得查得到来路
Embedding、分块、混合检索、重排、评测一路走下来,光能回答不算数,还得答得对、说得出依据,错了也定位得了。
RAG 的证据怎样一路到答案?
把文档塞进向量库不算难。难的是对的证据能找回来、排到前面、真的被模型用上,每一环还得拿评测证明没掉链子。
开始阅读Embedding 到底把什么变成了向量?相似不等于正确
Embedding 把文本放进能比较的语义空间,可它不懂权限、时间和业务上的轻重。上手 RAG,先弄清它能干什么、干不了什么。
开始阅读RAG 分块怎么定?先别急着争 256 还是 512
每一块都得两头兼顾:检索时能被准确定位,单独拎出来也撑得住一个回答。
开始阅读混合检索和重排,分别在补 RAG 的什么漏洞?
向量检索负责把可能相关的证据捞进候选集,重排再把真能回答问题的片段顶到前面。一个管找得全,一个管排得准。
开始阅读RAG 怎么评测才不自欺?把“答得像”拆开看
RAG 评测只盯最终答案,看不出门道。数据、召回、证据引用、生成,一层层分开查,才知道系统到底掉链子在哪一环。
开始阅读RAG 选向量库,先别看排行榜:把检索目标算清楚
先定语料规模、过滤条件、更新频率、召回目标、尾延迟,再比较 HNSW、倒排、混合检索和托管服务。
开始阅读RAG 查询改写:别替用户补条件
Query rewrite、问题拆解、假设文档,都是把用户的话翻成知识库听得懂的说法。每次改写都要能回到原问,必要时能撤回。
开始阅读Graph RAG:证据要能沿关系路径找回去
遇到跨文档、跨实体、要多跳关系的问题,图结构能补上纯向量相似度的短板。节点、边、来源、时间、路径评分都得记下来,不能只织一张好看的关系网。
开始阅读LLM 基础
从一行 Attention 到跑起来的 Transformer
从 Attention、位置编码、MoE 到 KV Cache 和推理优化,把大模型的地基讲成自己能推导、也能当面说清的面试答案。
Attention 到底在算什么?从一行公式讲清上下文理解
面试别只背 Q、K、V。把 Attention 拆成找谁相关、取哪些信息、按多大权重合并,再连上 mask、多头和复杂度,Transformer 为什么读得懂上下文就清楚了。
开始阅读Transformer 为什么跑赢 RNN?别只说“因为能并行”
RNN 的过时是一步步来的:顺序依赖在大规模训练和长上下文里越来越贵。把训练、推理、位置、工程取舍分开算,才讲得清 Transformer 为什么占上风。
开始阅读MoE 为什么参数更多,推理却不一定更贵?
几个模型简单拼一起,不叫 MoE。效果和成本,看路由器替 token 挑哪些专家、容量怎么才不堵、token 又怎么分到不同设备上。
开始阅读KV Cache 缓存的到底是什么?为什么长对话越聊越贵
KV Cache 缓存每层历史 token 的 Key 和 Value,解码只算新 token;代价是上下文越长,显存和带宽越吃紧。
开始阅读大模型推理优化:吞吐、延迟和显存要一起看
推理优化没有万能开关。先把 TTFT、TPOT、吞吐、显存分开看,再挑量化、连续批处理、Prefix Cache、投机解码或并行策略,才知道自己到底改善了哪一项。
开始阅读Tokenizer 和位置编码:模型为什么不按你以为的词来读?
Token 不是字数,位置也不是给每个词贴个序号就完了。分词粒度、上下文长度、位置外推、成本体验要连起来看,才解释得了同一句话换个语言、变长之后表现为什么不一样。
开始阅读模型量化后变小了,效果和服务为什么可能变差?
量化是把权重或激活的数值精度压低,省显存也省带宽,可误差会集中砸在敏感层、长上下文和工具调用上。面试要讲得清量化粒度、校准数据、部署硬件、回退策略。
开始阅读LLM 选型:把任务、成本和失败代价放进同一张表
选模型别只盯着总榜。先列清楚哪些任务不能出错,再拿固定样本去比质量、延迟、成本、稳定性,最后才定路由和灰度。
开始阅读上下文窗口变长了,为什么 Agent 还是会漏信息?
长上下文的瓶颈,往往在关键事实能不能被定位、留下、引用。把上下文预算拆给任务、证据、工具、输出,再用中间信息测一测,才谈得上长文能力。
开始阅读LLM 训练
训练目标,最后要落成能复盘的行为变化
SFT 数据、loss mask、偏好对齐、稳定性排查,搞清楚模型是真学会了、忘了,还是只把模板背得更熟。
一条 SFT 样本怎样改变模型行为
监督微调改的是模型在特定输入下的行为分布。数据构造、loss mask、质量分层、回归评测拆开看,才知道它到底学会了什么。
开始阅读RLHF 为什么要奖励模型?从偏好到 PPO 怎么接起来
RLHF 先把偏好学成奖励,再用策略优化推高质量。数据、奖励模型、KL 约束、PPO 串起来,才讲得清它怎么工作、怎么被 reward hacking 反噬。
开始阅读DPO 和 PPO 到底差在哪?什么时候可以不要奖励模型
DPO 把偏好优化改成离线分类目标,省掉 PPO 的在线 rollout 和显式奖励模型;但数据质量、参考策略、分布外风险还在。训练目标、链路、选型边界放一起,差异才清楚。
开始阅读训练 loss 降了,模型为什么没变聪明?
loss 好看,只说明优化器在朝目标走。数据污染、mask 错位、梯度爆炸、学习率不匹配、灾难性遗忘,都能让 loss 降下去、能力不动。配指标矩阵和可回滚实验,才找得到能修的环节。
开始阅读这批预训练数据值得加吗?
喂给模型的 token 多,不等于学到的能力多。重复网页放大偏见,模板化代码挤掉推理数据的位置,低质量语料把训练预算烧成噪声。清洗、配比、能力评测连起来看,才知道这批数据值不值得加。
开始阅读Agent 架构
会调工具只是起点,可控、能复盘才是架构
记忆、规划、安全、可观测性,逐项划成可验证的工程边界,Agent 每次行动才说得清、出事能恢复。
Agent 到底是什么:别把会调用模型的流程都叫 Agent
面试官问 Agent 有哪些核心组件,看的是你能不能把目标、状态、行动、观察、停止条件串成一条真跑得起来的流程。
开始阅读记忆系统里,短期、长期和压缩到底怎么分工
别把记忆系统当聊天记录仓库。先定下什么值得留、存成什么样、什么时候取回来;遇到新旧信息打架,还得有覆盖和过期的规矩。
开始阅读规划与反思什么时候有用,什么时候只是让 Agent 多说废话
Planner 要拆到能落地执行,拆得细不等于聪明;Reflection 要能改方向,补一句“你确定吗”不算反思。什么时候收手也要提前定好。
开始阅读Agent 安全怎么设计:权限、工具和数据边界
Agent 的风险不只是说错话,还在它能看哪些数据、动哪些工具、改什么东西。把自然语言里的意图落成权限和审批,边界才查得住。
开始阅读Agent 上线后怎么定位问题?从 trace 到可观测性和回放
最终答案只是最后一幕。查线上坏案例,要把规划、检索、工具、模型、状态变化、验收证据按顺序记下,之后才能重放。
开始阅读Workflow 还是 Agent?先看这件事到底有多不确定
Workflow 和 Agent 怎么选?先看任务不确定性、风险、验证成本、回退办法,再定哪些步骤交给 Agent,哪些边界写死。
开始阅读上下文越塞越满,Agent 为什么反而变笨?
Agent 变笨,多数是上下文里混进旧状态、没用的工具结果、没人核过的指令。先筛,再压缩、排序、标注,模型才看得见重点。
开始阅读Agent 上线,先把超时、熔断和未知结果设计好
线上故障往往是工具超时、重复写入、上下文膨胀、版本漂移撞一起。先画状态和故障边界,再谈扩容。
开始阅读Agent 什么时候该交给人?把人工接管设计成正常路径
Agent 卡住时,最怕的是证据、权限、确认都没拿到,还照样自信地往下做。升级人工的条件、交接的资料、之后的恢复方式要写清楚,人工接管才不会只剩一句“请联系客服”。
开始阅读多智能体
群聊式协作,什么时候才算团队系统
角色分工、消息协议、冲突仲裁、并发预算、协作评测,拆开看才明白多 Agent 什么时候真赚了,什么时候只是多花成本。
一个 Agent 做不完,什么时候该拆成多个?
多 Agent 的价值在于把互相牵制的目标拆成可验收的责任边界。先判断值不值得拆,再定角色、交接和失败回退。
开始阅读多 Agent 的消息和状态到底怎么管?
让多个 Agent 互相发消息不难,难的是事先约好:谁能动嘴、谁能动状态、什么时候提交、消息怎么算确认。
开始阅读多 Agent 结论打架怎么办?监督者和仲裁器各管什么
几个 Agent 结论打架,再让它们自由辩论,多半只多出几页字。监督者查过程和边界,仲裁器比证据和责任,别只靠投票。
开始阅读多 Agent 为什么越加人越慢?先管并发和预算
共享资源、复制上下文、尾延迟,都会让协作越多越慢;真正要管的是任务拓扑、扇出、token 和失败重试。
开始阅读多 Agent 协作怎么评测?不能只看最终答案
最终答案对了,不代表协作过程靠得住。评多 Agent,得把个体能力、消息质量、协作效率、失败恢复、安全边界分开,一项一项看。
开始阅读多智能体交接:先把合同写清楚
多智能体最常出的错在交接,不在角色多少。任务、状态、证据、权限、幂等键、确认方式都要写下来,出了事才知道谁接手、做到哪一步。
开始阅读多模态
图片、文档、视频,都要能当证据查出来
视觉 token、切片、版面结构,加上多模态 RAG 和视频时间轴,让模型从“看到了”变成“说得出在哪、引用有出处”。
图像怎样进入 Transformer?
图片要被语言模型理解,得先过视觉编码、特征投影、跨模态融合。把像素、patch、视觉 token、文本 token 串起来,才知道模型看见了什么。
开始阅读图片问答答非所问,可能是模型根本没看清
小字、表格、长截图答不对,多半是目标没带着合适的分辨率进入上下文。全图定位、局部切片、OCR、证据合并配合着用,视觉问答才稳。
开始阅读文档理解为什么不能只做 OCR?版面关系才是线索
PDF 压成一串 OCR 文本,栏、行、表头、脚注之间的关系就没了。文档 Agent 想可靠,得把文字、坐标、块类型、跨页结构一起存下来,才答得出“哪一列、哪一行、依据在哪”。
开始阅读多模态 RAG 怎样把图片、表格和文字一起查出来?
多模态 RAG 得把文字、表格、图片、坐标组织成统一的证据对象,再靠跨模态召回、元数据过滤、引用回溯去回答问题。
开始阅读视频 Agent 怎样处理百万级帧?先把时间定位做好
视频 Agent 不会逐帧塞给模型。先建时间轴,用镜头切分、关键帧、语音、OCR 做粗到细检索,再把答案落回能回放的时间区间。
开始阅读评测
Agent“看起来能用”,怎么证明它真可靠
结果、证据、线上漂移、Judge 校准、实验复现都管起来,评测才能定位问题、回放现场,持续回归也有抓手。
Agent 评测不能只看成功率:从结果到轨迹的五层指标
Agent 自报成功,任务未必真的完成。结果、步骤、工具调用、成本、安全约束分开查,才看得清它哪里稳,哪里只是碰巧答对。
开始阅读RAG 答案看着对,怎样证明它有依据?
贴一个文档链接,不等于答案有依据。验证 RAG 答案,得把结论拆成能核查的 claim,再对着证据看:覆盖没有、矛盾没有、版本对不对。
开始阅读离线评测 95 分,线上为什么还是翻车?
离线集测的是固定样本,线上面对的却是会变的用户、工具和数据。分布漂移、长尾失败、版本组合、副作用不进评测,就解释不了“离线 95%,线上 70%”的落差。
开始阅读让 LLM 给答案打分,为什么也会偏?
让一个大模型给另一个模型打分很省事,但它可能偏爱更长、更像自己、格式更整齐的答案。可靠 Judge 要靠评分标准、盲评、程序规则、人工样本一起校准。
开始阅读同一个 Agent 实验,怎样才能复现?
同一套 Prompt 第二次跑出不一样的结果,别急着怪模型随机。工具、知识库、系统时间、并发、评测器,哪个都可能变了。环境和版本指纹锁不住,结果就没办法解释。
开始阅读工具调用
外部行动不能悄悄发生,契约、回执、边界都得有
Function Calling、重试、MCP、结果塑形、权限审计,把模型提出的动作变成校验得了、恢复得了的工具调用,出问题查得到痕迹。
Function Calling:先把契约验清楚
Function Calling 是把自然语言决策变成可校验的动作请求。Schema、解析、权限、执行回执缺一环,再漂亮的 JSON 也可能变成线上事故。
开始阅读工具调用失败后,Agent 该重试、换工具还是停下?
失败,先看请求到没到、外部副作用是否未知、参数有没有错,再决定是重试、换工具、回退,还是转人工。
开始阅读MCP 统一了工具接入,为什么还有这么多坑?
MCP 统一了模型连工具、资源、提示模板的方式,但不会自动解决身份、权限、版本、租户隔离、副作用控制。协议统一只是起点。
开始阅读工具返回一大段 JSON,为什么 Agent 反而更容易做错
工具回得越多,Agent 不一定看得越明白。先定观察对象和字段优先级,再处理分页、截断、引用,下一步才不会被一堆无关 JSON 带跑。
开始阅读工具调用怎么做权限控制和审计?
Agent 的主体、租户、资源、动作、审批、幂等、审计证据都要进同一条调用链,这样才说得清谁在什么条件下让系统干了什么。
开始阅读工具调用为什么要做流式网关:别让用户只看到一个漫长的转圈
工具流式传输,是把一次调用拆成能排序、能恢复的事件流。顺序、背压、断线续传、权限、最终提交都归网关管,体验和可靠性才不会打架。
开始阅读Agent 之间怎么通信?先把消息信封设计好
A2A 别急着争协议名,先说清消息发给谁、谁有权限、版本怎么兼容、重复怎么办、结果怎么回执。传输层和任务层分开,换队列或网关也不怕。
开始阅读项目深挖
把 Demo 讲成经得起追问的工程系统
架构、RAG 取舍、指标、成本、框架边界,把项目经验拆成讲得清、经得起验证的工程决策。
从零设计企业知识库 Agent,第一张图该画什么?
画企业知识库 Agent 的第一张图,别只画模型调用。证据和权限要先落上去:谁属于哪个租户、能查哪些版本、答案怎么引用、出了错往哪追。
开始阅读你的 Agent 项目为什么要用 RAG?不用会怎样
知识会更新、数据不能公开、答案必须带出处、上下文装不下时,检索才值得加。
开始阅读项目里的指标怎么来的?别只报一个漂亮数字
别等项目收尾才补一张指标表。先把任务成功、证据、成本、安全定义清楚,再做基线和对照,才说得出到底好了多少、为什么会好。
开始阅读线上成本突然翻倍,Agent 项目从哪里开始降本
Agent 账单涨了,先把模型、工具、上下文、重试各花掉多少拆开算,再动路由和上下文。直接换小模型,可能只是把失败和重试一起放大。
开始阅读项目被追问‘你做的和框架有什么区别’,怎样讲出自己的贡献
框架替你处理通用编排,面试官更在意你在具体约束下做了什么决定:为何这样设计、怎么验证、失败后改了哪里。别只报组件名。
开始阅读通用与软实力
没做过的要讲清,做过的要讲深
假设、证据、失败复盘、技术沟通、学习路线,这几样练熟,Agent 面试就不止是背题,而是讲工程。
不会的 Agent 面试题怎么答:先拆问题,再声明假设
没做过的 Agent 题,别硬装全懂。先问目标、约束、输入输出、风险,再说你的假设、方案和验证办法,面试官更容易判断你的工程思路。
开始阅读项目讲不深,通常是证据链断了
面试官追你的项目,要听的是你碰上过什么问题、做了什么决定、怎么验证、最后结果如何。小项目照样能讲出深度。
开始阅读面试官追问失败案例,怎样讲具体又不把自己说垮
失败案例考的是边界感和复盘。挑一个真实发生过的,把现象、影响、定位、修复、还剩什么风险讲清楚,既不甩锅,也不把责任全揽在自己身上。
开始阅读技术方案有争议怎么办?从不同意见到可验证实验
嗓门大的人赢不了技术争议。把分歧写成两个能比较的假设,数据和指标先固定,做一个成本可控的实验,取舍记下来就行。
开始阅读Agent 工程师的学习路线怎么排:基础、项目、论文和面试如何互相喂养
论文、框架、面试题,别各刷各的。拿基础知识解释项目,让项目暴露问题,再借论文和面试题把答案讲一遍,学到的东西才用得起来。
开始阅读系统设计题怎么答:先问用户,再画 Agent
系统设计面试,先问清楚用户是谁、成功标准是什么、哪些边界不能碰,再把状态、工具、证据、评测、上线风险一项项接上。
开始阅读五厂高频题
一套 Agent 系统,怎么从头讲到上线
照着大厂常见的追问,把 RAG、工具、状态、性能、成本、稳定性串起来,练到能把零散知识讲成一整套系统。
AgentAlpha 公众号 · 已发表文章
公众号发过的内容,原文都收在这里。
共 10 篇,原文照收。
看看大佬云集的agent社区每天都在聊什么
打开原文 2026-08-31 · 已发表大厂Agentic RL面试,背完GRPO只是刚入门
打开原文 2026-08-30 · 已发表恭喜学弟拿下小红书offer
打开原文 2026-08-23 · 已发表网页版auto resesrch在路上了!
打开原文 2026-08-22 · 已发表阿里面试官追问:Code Agent跑到一半挂了,怎么恢复而且不重复执行?
打开原文 2026-08-22 · 已发表拿了一圈大厂offer的学弟最后竟然选了…
打开原文 2026-08-20 · 已发表阿里一面:Agent已经会ReAct了,为什么还要做Agentic RL?
打开原文 2026-08-16 · 已发表阿里面试官追问:Code Agent为什么不能直接给它root权限?
打开原文 2026-08-09 · 已发表面试官疑惑:你的Agent跑了二十轮对话,上下文爆了怎么办?
打开原文 2026-08-07 · 已发表面试官反问:Agent为什么必须学会遗忘?你回答不上来
打开原文Claude Code · 逐章整理中
Claude Code 从入门到高手
从 Agentic Loop、上下文与工具治理,到 MCP、Subagent、安全、性能和系统设计面试的系统教程。