先这样答
GRPO 训练的监控指标分为学习信号、探索能力和模型约束三个维度。核心除了奖励均值与方差、梯度范数,还必须关注策略熵、KL 散度、截断触发比例以及组内奖励方差。为了防止模型通过长文本刷分,响应长度分布也是必看指标。
指标异常通常对应具体的训练问题。策略熵持续下降趋近于零,说明发生熵坍塌,策略陷入僵死不再探索。KL 散度快速上涨,意味着参考模型约束失效。截断触发比例居高不下,提示学习率过大或优势估计有问题。针对熵坍塌,处理方式是加入熵正则或熵奖励项,适当降低 KL 约束强度让策略保留发散空间。同时可采用 clip-higher 机制,放宽正向截断,使低概率 token 依然有机会获得梯度上升。必要时需回退到健康的检查点重新训练。
组内奖励方差为零代表当前组内全对或全错,无法提供有效梯度,属于无效采样。核心处理手段是动态采样,即过滤掉全对或全错的组,继续采样直到组内出现区分度后再更新参数。同时需在奖励设计上干预,避免判据过松或过紧导致全对全错成为常态。配合难度分层采样,让组内天然存在分数差异。
总体而言,单看奖励指标容易被欺骗,策略熵、KL 散度和组内方差构成监控训练健康的三角,动态采样机制能同时对治无效组和熵坍塌问题。
面试官会怎么追问
- 「你提到动态采样,它具体是怎么运作的?」 动态采样的核心是过滤无效数据以提高有效组占比。生成阶段中,若某组采样的回复打分后方差为零,系统会丢弃该组并重新采样。直到结果在组内产生足够的分数区分度,才会送入强化学习阶段进行优势计算和更新。
- 「使用 clip-higher 缓解熵坍塌时,为何对优势函数小于零不起作用?」 优势函数小于零代表动作不如平均表现,需降低该动作概率。若对负优势也放宽截断,会导致低概率且表现差的 token 概率被过度压低,破坏分布稳定性。因此 clip-higher 只放宽正向截断,让低概率好动作能突破阈值持续上升。
- 「如果奖励均值一直在涨,但最终评测的任务指标没有涨,可能是什么原因?」 这通常意味着发生奖励作弊。模型找到了奖励函数的漏洞,通过捷径获取高分而未真正学会解决任务。此时需检查响应长度分布是否异常增加,或重新审查奖励判据的严谨性。
回答的坑
- 认为组内方差为零可直接跳过该步更新,正确做法是引入动态采样补齐有效组,否则会导致有效训练步数减少。
- 只强调监控奖励分数和 KL 散度,正确方向是把策略熵和截断触发比例放在同等重要位置,它们是判断探索能力的直接依据。
同系列的题
—— 本题完 ——