AgentAlpha Notes · Vol. 01Agent 面试,
01Agent 面试,
别只背答案。
每道题都从面试官的追问开始:先拆掉似是而非的回答,再把直觉、系统机制和工程边界连起来。
从这一题开始
面试官追问:Agent 已经会 ReAct,为什么还要做 Agentic RL?
会调工具只说明流程能跑。Agentic RL 真正要学的是,在不断变化的环境里,什么时候搜索、什么时候执行、什么时候停止,以及失败后该把责任分给哪一步。
01 / AGENTIC RL
Agent 如何从行动中学会负责
从 ReAct 到长轨迹强化学习,理解奖励、归因、rollout 与评测为什么会在真实系统里失效。
01
面试官追问:Agent 已经会 ReAct,为什么还要做 Agentic RL?
会调工具只说明流程能跑。Agentic RL 真正要学的是,在不断变化的环境里,什么时候搜索、什么时候执行、什么时候停止,以及失败后该把责任分给哪一步。
02面试官追问:Agent 做错了,二十步里到底哪一步该背锅?
Agentic RL 最难的不是把奖励写成一个数字,而是把最终成败分配给真正改变结果的动作。
03面试官追问:GRPO 不是调用一个函数,Agent rollout 为什么总把系统拖垮?
GRPO 的公式并不神秘,难的是把一组可比较、可复现、成本可控的 Agent 轨迹真正采出来。
04面试官追问:Agent 把奖励刷满了,为什么任务还是没做成?
Reward hacking 不是模型突然变坏,而是验收器允许了一个更容易的目标。Agent 越会用工具,越要把奖励和真实结果拆开。
02 / CODE AGENT
能写代码,还不等于能交付
上下文、测试、权限和恢复机制,决定一个 Code Agent 是演示玩具,还是可靠的工程系统。
0511 min0611 min079 min0811 min
面试官追问:代码 Agent 为什么总要先读仓库,再开始写代码?
Repo context 不是把整个项目塞进上下文,而是把任务相关的约束、入口、依赖和验证路径按优先级交给 Agent。
面试官追问:代码 Agent 说测试全绿,为什么我还是不敢合并?
绿色只说明当前测试观察到的行为没有被破坏。Code Agent 真正要交付的是可解释的证据链,而不是一行 passed。
面试官追问:Code Agent 为什么不能直接给它 root 权限?
Code Agent 的权限不是一个开关,而是一套可验证的执行边界:文件、网络、进程、身份和审批都要分别设计。
面试官追问:Code Agent 跑到一半挂了,怎么恢复而且不重复执行?
恢复不是把聊天记录接着播一遍。要靠持久化状态、操作幂等键和未知结果对账,把重复副作用关在边界内。