公司题库 · OpenAI
OpenAI大模型 Agent 面试题
Agent 对齐与工具调用底层:RLHF 在 Agent 的应用、推理模型的取舍、Function Calling 原理。
题目口径:来自 OpenAI、GPT 等公开渠道的面经与岗位 JD 高频归纳,不是内部真题。 按大家实际被问到的方向整理,每题一页带答案与追问。
Q · Agent 的任务规划怎么做?为什么要先拆解再执行规划就是把目标拆成有依赖关系的子步骤,再按依赖顺序执行、根据每步反馈调整。先拆解是因为模型的上下文和可靠性都有限,大任务直接做容易在中途迷失。
Q · 为什么选 GRPO 而不是 PPO 或 DPO?GRPO 省去了 PPO 的价值网络以降低显存和稳定性成本,同时克服了 DPO 依赖离线偏好对且无过程信号的缺点,代价是需权衡采样成本与组大小。