公司题库 · 微软
微软大模型 Agent 面试题
企业级 Copilot 方向:Azure 技术栈选型、企业数据隐私增强、工具协议与错误恢复设计。
题目口径:来自 微软、Microsoft、Copilot 等公开渠道的面经与岗位 JD 高频归纳,不是内部真题。 按大家实际被问到的方向整理,每题一页带答案与追问。
Q · Agent 的任务规划怎么做?为什么要先拆解再执行规划就是把目标拆成有依赖关系的子步骤,再按依赖顺序执行、根据每步反馈调整。先拆解是因为模型的上下文和可靠性都有限,大任务直接做容易在中途迷失。
Q · LoRA 的 rank(秩)怎么选?是不是越大越好不是。rank 是 LoRA 旁路矩阵的宽度,决定能学多少变化:小了容量不够,大了费显存还容易过拟合,常见做法从个位数到几十之间起步按任务调。
Q · 为什么选 GRPO 而不是 PPO 或 DPO?GRPO 省去了 PPO 的价值网络以降低显存和稳定性成本,同时克服了 DPO 依赖离线偏好对且无过程信号的缺点,代价是需权衡采样成本与组大小。