某大厂两面 · 训练机制问到估计器层 16 分钟读完

RL 后训练方向:某大厂两轮深挖面经

强化学习 / 后训练方向(算法岗)

面经强化学习PPOGRPO后训练方向深挖

岗位:某大厂强化学习 / 后训练方向算法岗 轮次:两面技术面 一句话定性:这是一场「训练机制」面试,每个概念都要落到损失函数、估计器或资源账上。 素材来源:AgentGuide 开源面经合集案例(公司匿名),整理时间 2026-09-28


0. 一分钟速览

项目内容
方向RL 后训练(RLHF / GRPO 线)
一面重心PPO 全家桶机制、GRPO 的 KL 估计、rollout 资源账
二面重心偏好数据构造、记忆系统工程、工具调用容错
有手撕吗报告未提及;重点是推导和资源估算
典型挂点分不清 reward model 和 critic model;答不出 rollout 数怎么定
准备方向每个算法答「损失是什么、和谁比、谁不动」

1. 一面:PPO 全家桶与 GRPO 估计器

1.1 PPO 的四个模型与各自损失

问法:「PPO 训练里有几个模型?各自的损失是什么?」

答题要点:四个——策略模型(被训练,policy loss 带 clip)、参考模型(冻结,算 KL 约束策略别漂太远)、奖励模型(冻结,给回答打分)、价值模型(被训练,TD 误差的 value loss,算优势函数用)。

高频追问:reward model 和 critic model 什么区别? 答分工不是分工大小:reward model 对完整回答打「好不好」,是从人类偏好训出来的裁判;critic model 估计每个状态的价值,是为算优势函数(减少方差)服务的,只对训练效率负责。一个输出奖励信号,一个输出基线。

1.2 GRPO 与 KL 估计器

问法:「GRPO 和 PPO 的 KL 有什么不同?k1、k2、k3 估计是什么?」

答题要点:GRPO 去掉了价值模型,用同一 prompt 组内多个回答的平均奖励当基线(组内相对优势)。KL 的估计器有三档:k1 是无偏低方差大、k2 无偏但方差更大、k3 通常非负方差更低,GRPO 论文用的是 k3(实际实现里 KL 直接加在损失上而不是奖励里,这点说出来是加分项)。

1.3 rollout 数与资源账

问法:「rollout 数怎么定?和 batch size、卡数什么关系?」

答题要点:有效 batch = prompt 数 × 每 prompt 的 rollout 数;定 rollout 数权衡的是基线估计的稳定性(组太小优势估计噪声大)和推理成本(rollout 全是推理开销);卡数决定的是「一个 batch 的 rollout 生成要多久」,训练吞吐的瓶颈通常在 rollout 生成而不是梯度更新。真实采样数和名义 rollout 数的区别(部分采样失败、长度截断)也是追问点。


2. 二面:偏好数据、记忆与工程

  1. DPO 和 SFT 的关系:SFT 教「怎么写」,DPO 教「哪个更好」;偏好对构造要控制长度偏差(被选中的回答偏长会让模型学会啰嗦)。
  2. Agent 记忆系统的长期记忆查询优化:写多读少还是读多写少决定索引策略;召回用向量加关键词混合,热点条目加缓存。
  3. 工具调用容错:超时分级(快工具同步等、慢工具异步通知)、失败重试带上次错误信息、连续失败熔断降级。
  4. 用户行为日志抽对话训练数据:脱敏是底线,再按「有明确正负反馈的行为」筛样本,避免把噪声日志当偏好。

3. 复盘与准备清单

  • RL 方向的面试语言是数字和损失:答任何算法先给损失函数,再给「和谁比、谁冻结」,最后给资源账。
  • reward/critic、on-policy/off-policy、名义/真实采样数这三对概念是深挖高发区,各准备一段对照。
  • 非确定性系统出问题怎么定位(奖励模型漂移?数据分布变了?KL 约束太松?)建议准备一个自己排查过的案例。

相关题目:站内题库的「GRPO 和 PPO 的区别」「为什么选 GRPO 不选 PPO」「DPO 输出为什么变长」都是这个方向的高频原题。