五厂面经真题集美团面经高频美团真题RLHFGRPO速答 · 约 5 分钟更新 2026-09-29

为什么选 GRPO 而不是 PPO 或 DPO?

一句话结论

GRPO 省去了 PPO 的价值网络以降低显存和稳定性成本,同时克服了 DPO 依赖离线偏好对且无过程信号的缺点,代价是需权衡采样成本与组大小。

先这样答

选择 GRPO 是为了在节省显存的同时获得过程信号。PPO 算法需要训练一个额外的价值网络。这个价值网络会占用大量显存资源。PPO 的训练过程还面临稳定性成本高的问题。GRPO 直接砍掉了这个价值网络。它采用组内采样的相对优势来替代价值网络的作用。

GRPO 让模型对同一个输入生成多个不同的回答。这些回答共同构成一个采样组。同组内的多个回答互为基线。算法通过比较这些组内回答的相对表现来计算优势。这种机制直接省去了一个模型。对比之下,DPO 算法虽然也不需要价值网络。但它强依赖离线构建的偏好对数据。DPO 只能基于静态数据学习。它给不了模型生成时的过程信号。

采用 GRPO 也有相应的代价。它需要对同一个提示词进行多次生成。这带来了较高的采样成本。工程落地时必须在采样成本和组大小之间做权衡。组大小决定了相对优势基线的质量。设计训练方案时需要找到这两者的平衡点。

面试官会怎么追问

  • 「GRPO 没有价值网络,怎么评估当前回答的优势?」 GRPO 通过组内采样的相对优势来评估。模型对同一输入生成一批回答。算法计算这些回答的得分并作为基线。单个回答的优势由它在同组内的相对表现决定。

  • 「你提到 DPO 给不了过程信号,这个过程信号具体指什么?」 过程信号指模型在主动生成回答时获得的反馈。DPO 依赖离线准备好的偏好对数据。模型只能拟合这些固定的数据。GRPO 允许模型自己采样生成回答并根据当前输出计算相对优势。

  • 「GRPO 的采样成本和组大小权衡,在实际训练中怎么体现?」 组大小直接决定了同组回答互为基线的准确度。组内样本太少会导致基线估计存在偏差。增加组大小可以提高相对优势的计算质量。这要求模型在推理阶段生成更多回答并增加采样计算成本。

回答的坑

答题时只强调 GRPO 节省显存,忽略了它需要付出额外采样成本的代价。

混淆 DPO 与 GRPO 的机制,没有点出 DPO 依赖离线偏好对且缺乏过程信号的缺陷。

—— 本题完 ——