训练与微调快手面经高频蚂蚁集团面经高频[强化学习PPO算法基础]速答 · 约 6 分钟更新 2026-09-28

GAE 的公式是什么?λ 和 γ 各是什么含义?为什么有了 Reward Model 还需要 Critic?

一句话结论

GAE是多步TD误差的加权和,γ决定未来奖励视野,λ调节偏差与方差。Reward Model只提供最终的标量奖励,而Critic用于估计状态价值并作为基线,用来降低策略梯度更新时的方差。

先这样答

回答这个问题可以从公式定义、参数意义以及模型分工三个层面展开。GAE即广义优势估计,其公式是各时间步TD误差的指数加权和。具体表达为优势等于从当前步开始,所有未来TD误差乘以因子(γλ)的t次方的累加。这里的TD误差等于当前步奖励加上折扣后的下一步状态价值,再减去当前状态价值。

公式中的两个超参数分别控制不同的机制。γ是折扣因子,决定了模型对未来奖励的关注视野。λ用来控制多步TD误差的混合深度,本质是在偏差和方差之间做折中。当λ等于0时,GAE退化为单步TD误差,此时方差低但偏差高,高度依赖Critic估计的准确性。当λ等于1时,GAE退化为蒙特卡洛回报减去基线,此时无偏但方差非常大。实际中λ通常取中间值来平衡两者。

关于Reward Model和Critic,两者扮演完全不同的角色。Reward Model是环境信号来源,只负责给出当前输出好不好的标量奖励,评判的是最终结果。Critic则是价值估计器,学习的是当前状态的期望回报。如果没有基线,策略梯度的方差会大到无法训练。Critic的作用就是提供状态价值作为基线来减小方差,同时GAE也需要它来计算TD误差。

总结来说,γ决定了回报的计算视野,λ用于调节偏差与方差,而Critic负责提供基线。像GRPO这类省去Critic的算法是用组内均值替代基线,这是工程上的取舍。

面试官会怎么追问

  • 「既然 Critic 这么重要,为什么最近有些大模型训练方法选择把 Critic 砍掉?」 砍掉Critic主要是为了节省显存和训练开销,因为PPO保留Critic虽然样本效率高,但需要多维护一个同等规模的模型。GRPO等方法省掉Critic,是通过利用组内相对比较来替代基线。这种做法的代价是组内采样数较少时基线估计的噪声较大,并且对奖励的尺度更加敏感。
  • 「如果把公式里的 λ 设为 1,模型训练会出现什么现象?」 当λ设为1时,GAE计算完全依赖真实的累积奖励,退化为蒙特卡洛回报减去基线。这时候优势估计是无偏的,但因为整个交互轨迹往往充满随机性,方差会变得极大。方差过大会导致策略梯度更新方向不稳定,模型很难收敛。
  • 「在回合制任务中,γ 通常怎么取值?」 在大模型生成这种典型的回合制任务中,γ通常直接取1。这意味着对未来奖励不打折扣,因为生成任务的长度有限,且最终的奖励往往在生成结束后才给出,直接累加所有奖励能够真实反映完整回答的质量。

回答的坑

  • 常见错误是混淆Reward Model和Critic的功能,认为两者都在评估动作的好坏;正确方向应明确Reward Model是外部环境提供的客观奖励,而Critic是内部对预期总回报的估计。
  • 常见错误是将λ和γ的作用等同,都说成是控制未来奖励的权重;正确方向应区分γ决定物理意义上的回报视野,而λ是处理估计偏差与方差折中的数学技巧。
—— 本题完 ——