目录
AgentAlpha
· 面试间
← 返回主站
目录
开始
面试间首页
模拟面试 · 抽题自测
简历体检
系统学习
LLM 基础概念
209
RAG 检索增强
609
Agent 架构
275
工具调用
106
多智能体
94
记忆系统
7
评测与可观测
107
项目实战与企业级
797
训练与微调
334
推理与部署
23
多模态
68
提示工程
8
安全与合规
8
五厂面经真题集
217
题库与工具
速答题库
术语表
五厂真题集
学习路线
Agent 应用开发
RAG 工程师
LLM 应用开发
AI Infra
按公司刷
百度
76
美团
70
字节跳动
64
腾讯
62
阿里巴巴
51
拼多多
14
小红书
7
滴滴
5
快手
5
DeepSeek
4
蚂蚁集团
3
小米
3
项目面试包
企业知识库 RAG 助手
Text2SQL 数据查询 Agent
数据分析 Agent(ChatBI)
题目来自公开面经与社区真实面经
持续更新 ·
agentalpha.top
首页
/
面试间
/
大厂真题库
/
Agent 算法
岗位方向 · TRACK
Agent 算法面试题
Agentic RL 与后训练:SFT/RLHF/DPO/GRPO、奖励设计、轨迹数据、评测对齐。
27 道题 · 题目口径为公开面经与岗位 JD 的高频归纳
Q · SFT 数据和 RLHF 对齐数据,在筛选标准和用途上有什么核心区别?
SFT 数据教模型学会做任务,核心是筛选正确且多样的示范数据;RLHF 数据教模型按人类偏好做得更好,核心是筛选具有真实优劣对比和高标注一致性的偏好对。前者决定能力上限,后者决定行为对齐。
查看答案 →
Q · Agent 为什么必须学会遗忘?记忆衰退机制怎么设计?
遗忘是为了保证检索质量与决策准确性。无限制的记忆会导致检索变慢并引入噪声,设计衰退机制需要结合时间衰减、按类型配置、用量反馈与显式失效,并在写入端做好冲突检测。
查看答案 →
Q · LoRA 的低秩分解为什么有效?
LoRA 的有效性建立在经验观察上:微调时权重的更新量是低秩的。它用两个小矩阵相乘来近似这个更新量,在保证起点等价原模型的同时,让可训练参数骤降。
查看答案 →
Q · DPO 训练后模型输出变长,是什么原因?
核心原因是偏好数据中被选中的回答普遍更长。DPO 直接对偏好对进行优化,模型将长度本身视作可利用的信号,学会了写长更易被选。缓解方法包括构造数据时控制长度均衡,或加长度惩罚项。
查看答案 →
Q · 模型出现复读机现象怎么解释、怎么处理?
复读机现象由训练数据重复、低温或贪心解码放大高频路径、解码缺少重复惩罚三者叠加造成。处理需从数据端去重,并在解码端调高温度、增加 repetition penalty 或设置 top-p 截断。
查看答案 →
Q · SFT 加 DPO 的训练数据怎么组织?
SFT 数据组织成指令与回答对,覆盖单轮、多轮及工具调用场景并作难度分层。DPO 数据组织成偏好对,需严格控制采纳与拒绝回答的长度均衡,防止模型学会写长。
查看答案 →
Q · LoRA 合并回原模型时,梯度有什么问题?
训练中途合并会破坏等价性,因为梯度只流过低秩矩阵,原模型权重被冻结未同步更新。部署时合并会导致无法热切换多任务 LoRA。
查看答案 →
Q · LoRA 能不能插在 LayerNorm 后面?
不推荐把 LoRA 插在 LayerNorm 后面。LayerNorm 参数量极小,微调收益有限。它对数据分布的稳定性很敏感,强行插入容易扰动训练。常见做法是插在注意力和前馈层的投影矩阵上。
查看答案 →
Q · NF4 和 FP16 怎么选?NF4 的分布拟合是什么逻辑?
QLoRA 微调时基座模型选 4 位 NF4 降低显存,训练和关键路径计算选 FP16。NF4 按正态分布分位数设置格点,中间密两头疏,拟合权重分布以减小量化误差。
查看答案 →
Q · 为什么选 GRPO 而不是 PPO 或 DPO?
GRPO 省去了 PPO 的价值网络以降低显存和稳定性成本,同时克服了 DPO 依赖离线偏好对且无过程信号的缺点,代价是需权衡采样成本与组大小。
查看答案 →
Q · GRPO 的奖励函数怎么设计?
GRPO 的奖励函数采用分层设计,结合结果奖励与过程奖励。原则上能用规则判别就不依赖模型,以此减少奖励作弊空间,且奖励维度必须单一可归因。
查看答案 →
Q · PPO 或 GRPO 训完,模型跑偏到训练分布外怎么办?
核心是控制策略偏移幅度并防止模型刷分。手段上利用KL约束控制偏离参考模型的幅度,设计多维奖励,调大温度和组大小保持探索。监控上盯紧生成熵、KL曲线与人工抽检。
查看答案 →
Q · DPO 为什么不需要显式奖励模型?它的假设和局限是什么?
DPO 不需要显式奖励模型,因为最优策略与奖励函数存在闭式对应关系。算法将偏好概率直接改写为策略的函数,把隐式奖励定义为当前策略与参考模型的对数比,从而直接用偏好对优化策略。
查看答案 →
Q · 怎么从线上轨迹筛选 Agent RL 数据,避免把偶然成功当优质样本?
筛选线上轨迹不能只看最终成功,必须做过程质量审查、可复现性验证和结果归因。实现上先用规则过滤坏例,再用模型打分,最后人工校准。
查看答案 →
Q · 多轮对话的训练数据怎么表示角色、状态、工具调用和最终答案?
把多轮对话整理成带角色的消息序列,把工具调用、工具返回和状态变化都插入上下文,只对 assistant 消息计算损失。
查看答案 →
Q · 过程奖励模型怎么设计?怎么防止模型迎合评审器而不是完成真实任务?
过程奖励模型按步骤评分,给长链路更密的信号;同时把评审器和执行器解耦,用结果奖励和人工标注校准,盯住过程分与结果分的相关性,防止模型迎合评审器。
查看答案 →
Q · LLM-as-a-Judge 的 rubric 怎么设计?哪些维度是硬门槛,哪些是加分项?
Rubric 分硬门槛和加分项:先用规则判事实、安全、相关性和格式,命中一项就低分;模型再按完整性、结构、简洁度和引用规范连续评分,并用正反例与人工抽样校准。
查看答案 →
Q · 为什么要做一致性检测和 swap consistency?防的是哪类偏差?
一致性检测和 swap consistency 用来确认评测结论是否稳定,主要防止裁判偏好第一个选项的位置偏差,以及模型受选项呈现顺序影响的顺序依赖。
查看答案 →
Q · DeepSeek R1 的核心创新点是什么?
DeepSeek R1 以纯强化学习激发推理行为,用 GRPO 降低训练成本,再通过多阶段训练和蒸馏兼顾能力、稳定性与小模型迁移。
查看答案 →
Q · GRPO 训练 MoE 模型会遇到什么问题?怎么改进?
GRPO 训练 MoE 要处理专家负载不均衡、稀疏奖励下组内方差归零和 KL 方差过大三类问题;可调负载均衡损失权重,联动组大小与采样温度,用 k3 估计 KL 并加入损失。
查看答案 →
Q · GRPO 的 KL 项怎么配置?超参怎么调?
KL 项放在损失函数里,估计器用低方差的 k3;系数在约束策略漂移和保留探索之间取平衡,并结合组大小、生成熵和组内奖励方差一起调。
查看答案 →
Q · 讲讲 RLHF 的具体过程,涉及几个模型?
RLHF 具体涉及四个模型:策略模型负责训练,参考模型计算 KL 约束,奖励模型根据人类偏好打分,价值模型计算优势函数以降低方差。
查看答案 →
Q · 从数据角度看,大模型会有什么问题?
大模型的数据问题主要有六类:质量、分布、时效、隐私、偏见和污染,可以按训练前清洗、训练中配比、训练后评测来回答。
查看答案 →
Q · 特定任务用预训练还是微调?怎么判断?
先看任务差距、数据量和更新频率:差距小用提示词,有几千条高质量领域数据再考虑微调,频繁变化的知识用 RAG。
查看答案 →
Q · 为骑手助手构造 SFT 数据,怎么覆盖难例并避免数据泄漏?
先做脱敏,再从高频申诉、改判 case 和边界场景挖难例,分层采样并标注依据,按时间和骑手切分数据。
查看答案 →
Q · Function Call 的训练文本格式怎么组织喂给模型?
按消息序列组织训练文本:工具定义放系统段,调用请求放 assistant 的结构化字段,工具返回插回 tool 消息,训练只算 assistant 段损失。
查看答案 →
Q · LoRA、QLoRA 与全量微调怎么选?
资源有限先选 LoRA;单卡或大基座选 QLoRA;只有基座级任务且有多卡集群时才做全量微调,再看任务与基座差距和 Adapter 热切换需求
查看答案 →
其他岗位方向
Agent 开发 · 104 题
Agent 应用与平台工程:工具调用、上下文工程、记忆系统、多 Agent 编排、上线与稳定性。
进入 →
AI 算法应用 · 37 题
大模型应用算法:RAG 全链路、检索排序、微调选型、业务效果优化。
进入 →
多模态算法 · 6 题
视觉语言模型与多模态:融合架构、CLIP 系、VLM 评估与训练。
进入 →
AI Infra · 11 题
推理与训练系统:vLLM、量化、并行策略、显存与吞吐优化、服务化。
进入 →
通用算法基础 · 31 题
各岗通用底座:Transformer、注意力、采样参数、正则化等基础原理。
进入 →