先这样答
GRPO 是一种面向大模型的强化学习算法,可以看成对 PPO 的精简。做法:对同一个提示,让当前模型一次采出一组回答,用奖励模型或规则给每个回答打分,然后以组内平均分为基准,高于平均的回答加强、低于平均的削弱,用这个相对差距更新策略。
省在哪:PPO 需要一个价值网络回答「这个状态大概值多少分」,作为基线降低梯度估计的噪声,但它本身是和策略模型差不多大的网络,训练时要占一份显存、算一遍前向反向。GRPO 的观察是:同一组回答的分数互相一比,组平均分天然就是基线,价值网络可以整个去掉。少一份大模型的显存和计算,强化学习的训练门槛就降下来了。
一句总结:GRPO 把「训练一个估分网络」换成「一组回答互相当参照」,省掉价值网络这份大开销。它尤其适合数学、代码这类对错能自动判定的任务,规则判分加组内比较,整条训练链路都比 PPO 轻。
面试官会怎么追问
- 「去掉价值网络,训练还稳吗?」 组内基线本身能降低估计噪声,但对分组设计有要求:组太小,平均分噪声大;组内回答缺乏多样性,比较信号就弱。实践里组的大小和采样温度是要认真调的。
- 「奖励从哪来?」 两类来源:奖励模型打分,或者规则判分,比如数学题对答案、代码运行测试用例。能自动判分的任务用规则奖励更干净,也更好排查问题。
- 「它和 DPO 是一类方法吗?」 不是。DPO 是离线的直接偏好优化,不需要采样循环;GRPO 是在线强化学习,每轮都要模型实际生成、打分、更新。GRPO 省掉价值网络但保留在线采样,DPO 连采样循环也省了。
回答的坑
- 把 GRPO 说成「免费版的 PPO」。它省的是价值网络,靠组内比较补回基线功能,组设计不合理时训练质量会受影响,不是无代价的等价替换。
- 只记得「省显存」说不出机制。面试官要听的是为什么能省:组平均分替代了价值网络的基线作用,这句讲不出来,名词背了也白背。
同系列的题
—— 本题完 ——