训练与微调强化学习GRPO基础概念速答 · 约 6 分钟更新 2026-09-28

策略梯度和价值函数是什么?没这些基础能学 GRPO 吗?

一句话结论

策略梯度决定模型优化的方向,通过奖励加权提升好输出的概率;价值函数估计期望回报,作为基线用来降低训练方差。没有这些基础很难学透 GRPO,因为 GRPO 的核心机制组内均值就是一种最直接的基线替代方案。

先这样答

策略梯度是决定大模型强化学习优化方向的核心机制,价值函数则是控制训练方差的关键工具。两者通过优势函数结合,构成了主流强化学习算法的基石。没有这些基础很难真正理解 GRPO,因为 GRPO 的核心改进正是围绕基线机制展开的。

策略梯度的本质是直接对策略,也就是大模型的输出分布求导并进行优化。它的运作方式是按获得的奖励对动作进行加权,从而提升产生好动作的概率。无论是早期的 REINFORCE 算法,还是后来广泛使用的 PPO,以及目前的 GRPO,底层都依赖策略梯度作为根基。

价值函数 V(s) 的作用是估计某个状态下的期望回报。在训练过程中,它的主要用途是作为基线来降低策略梯度更新的方差。通过计算实际回报与基线的差值,我们可以得到优势值。Actor-Critic 架构正是基于这种思想,同时维护策略模型和价值模型两套网络,两手抓来实现稳定的训练。

这些基础直接决定 GRPO 的学习上限。GRPO 的组内均值就是一个最简基线:先在传统算法里理解基线为什么降方差,再看 GRPO 去掉独立价值网络的逻辑就通了。答题时按「策略梯度定方向、价值函数控方差、优势是结合点」三段展开,后面的深挖都从这三点生长。

面试官会怎么追问

  • 「为什么策略梯度方法中通常需要引入基线?」 主要为了降低梯度估计的方差。如果环境给的奖励全都是正数,那么即使是相对较差的动作,其概率也会被更新提升。引入基线后,只有表现高于基线平均水平的动作才会得到正的优势值,从而使得梯度的更新方向更加明确和稳定。

  • 「GRPO 使用组内均值做基线,相比于训练一个独立的价值网络有什么取舍?」 使用组内均值的好处是计算过程更简单,不需要额外维护和训练一个价值模型,节省了大量的显存和计算开销。代价是这种方式只能反映当前批次内同一提示词下不同输出的相对好坏,无法像独立的价值函数那样提供跨状态的全局期望回报估计。

  • 「如果只用策略梯度不用价值函数,模型训练会出现什么问题?」 这相当于最基础的 REINFORCE 算法。由于每次采样的回报具有随机性,缺乏一个稳定的参考标准来判断当前动作的真实好坏,训练过程的方差会非常大。这会导致模型收敛困难,或者需要极大的采样量才能找到正确的优化方向。

回答的坑

  • 把策略梯度和价值函数割裂开来谈。正确方向是指出它们通过优势函数紧密结合,价值函数为策略梯度的更新提供基线参考,共同指导模型的优化。
  • 认为 GRPO 完全抛弃了基线的概念。正确方向是说明 GRPO 只是去掉了独立的价值网络模型,用组内均值作为一种更轻量级的基线实现来达到控制方差的目的。

相关深度笔记

—— 本题完 ——