五厂面经真题集DeepSeek面经高频DeepSeek真题GRPOAgent算法速答 · 约 5 分钟更新 2026-09-29

GRPO 的 KL 项怎么配置?超参怎么调?

一句话结论

KL 项放在损失函数里,估计器用低方差的 k3;系数在约束策略漂移和保留探索之间取平衡,并结合组大小、生成熵和组内奖励方差一起调。

先这样答

我的配置是把 KL 项加在损失函数上,而不是加到奖励里。这样可以避免奖励尺度干扰 KL 约束。KL 的估计器选低方差的 k3,让训练信号更稳定。

系数需要在策略约束和探索之间取平衡。系数太大,策略被旧策略束缚,模型学不到新的策略。系数太小,策略容易漂移,训练可能崩掉。调参时,我会根据训练表现调整这个系数,而不是只看单个奖励值。

组大小也要一起考虑。组大小就是每个 prompt 采样的数量,它会影响基线估计的稳定性。常见范围是 8 到 64。最后监控生成熵和组内奖励方差。生成熵不能塌,组内奖励方差也不能归零。两个指标都失去变化时,我会重新检查 KL 系数和组大小的配置。

面试官会怎么追问

  • 「为什么不把 KL 惩罚直接加到奖励里?」
    我会把 KL 放到损失上,避免奖励尺度影响 KL 项的作用。这样可以把奖励优化和策略约束分开处理。训练时,KL 系数的含义也更直接。

  • 「KL 系数太大或太小,分别会出现什么现象?」
    系数太大,策略受到的约束太强,模型难以探索新的策略。系数太小,策略会偏离原来的策略,训练可能崩掉。我会结合生成熵和组内奖励方差判断当前方向。

  • 「组大小为什么会影响训练?你会选多大?」
    每个 prompt 的采样数会影响基线估计的稳定性。组太小时,估计可能不稳定;组大小通常可以在 8 到 64 之间选择。我还会观察组内奖励方差是否保持变化。

回答的坑

  • 不要只说 KL 系数越大越稳定,系数过大也会限制探索,让模型学不到新策略。
  • 不要只看奖励判断训练是否正常,还要看生成熵是否塌缩、组内奖励方差是否归零。
—— 本题完 ——