训练与微调GRPORLHF速答 · 约 5 分钟更新 2026-09-19

GRPO 是什么?它比 PPO 省在哪

一句话结论

GRPO 用「组内比较」代替价值网络:同一个问题让模型采出一组回答,按组内相对好坏分配奖励来更新策略。省掉了和策略模型差不多大的价值模型,显存和算力都省下来。

先这样答

GRPO 是一种面向大模型的强化学习算法,可以看成对 PPO 的精简。做法:对同一个提示,让当前模型一次采出一组回答,用奖励模型或规则给每个回答打分,然后以组内平均分为基准,高于平均的回答加强、低于平均的削弱,用这个相对差距更新策略。

省在哪:PPO 需要一个价值网络回答「这个状态大概值多少分」,作为基线降低梯度估计的噪声,但它本身是和策略模型差不多大的网络,训练时要占一份显存、算一遍前向反向。GRPO 的观察是:同一组回答的分数互相一比,组平均分天然就是基线,价值网络可以整个去掉。少一份大模型的显存和计算,强化学习的训练门槛就降下来了。

一句总结:GRPO 把「训练一个估分网络」换成「一组回答互相当参照」,省掉价值网络这份大开销。它尤其适合数学、代码这类对错能自动判定的任务,规则判分加组内比较,整条训练链路都比 PPO 轻。

面试官会怎么追问

  • 「去掉价值网络,训练还稳吗?」 组内基线本身能降低估计噪声,但对分组设计有要求:组太小,平均分噪声大;组内回答缺乏多样性,比较信号就弱。实践里组的大小和采样温度是要认真调的。
  • 「奖励从哪来?」 两类来源:奖励模型打分,或者规则判分,比如数学题对答案、代码运行测试用例。能自动判分的任务用规则奖励更干净,也更好排查问题。
  • 「它和 DPO 是一类方法吗?」 不是。DPO 是离线的直接偏好优化,不需要采样循环;GRPO 是在线强化学习,每轮都要模型实际生成、打分、更新。GRPO 省掉价值网络但保留在线采样,DPO 连采样循环也省了。

回答的坑

  • 把 GRPO 说成「免费版的 PPO」。它省的是价值网络,靠组内比较补回基线功能,组设计不合理时训练质量会受影响,不是无代价的等价替换。
  • 只记得「省显存」说不出机制。面试官要听的是为什么能省:组平均分替代了价值网络的基线作用,这句讲不出来,名词背了也白背。
—— 本题完 ——