先这样答
结论是,GRPO 训练 MoE 时要同时处理专家负载、组内奖励方差和 KL 估计方差三个问题。RL 采样会让专家负载比普通训练更不均衡。高熵区域的路由容易漂移,部分专家会承受更多样本,部分专家则利用不足。
第二个问题来自稀疏奖励。组内样本的奖励可能全部相同,组内奖励方差就会塌为零。这样一来,GRPO 无法形成有效的相对优势,梯度也会消失。改进时,可以调整负载均衡辅助损失的权重。也要联动设置组大小和采样温度,让采样分组与探索强度配合起来。
第三个问题是 KL 估计的方差。方差过大会影响训练稳定性。我的做法是使用低方差的 k3 估计器,并把 KL 项加在损失里,而不是直接加在奖励里。这样回答时要把三个问题和三个对应改进方向一一对上。
面试官会怎么追问
-
「为什么 RL 采样会让 MoE 的专家负载更不均衡?」 高熵区域的路由决策更容易漂移。采样过程会放大这种路由变化,让不同专家接收到的样本量进一步拉开。改进时需要关注负载均衡辅助损失的权重。
-
「组内奖励方差为什么会塌为零?」 稀疏奖励任务里,组内样本可能拿到相同奖励。奖励没有差异,组内方差就变成零。GRPO 依赖组内相对差异形成训练信号,方差为零时梯度会消失。
-
「KL 为什么用 k3,并且要放进损失而不是奖励?」 KL 估计本身存在方差,方差会影响训练稳定性。可以使用低方差的 k3 估计器。还要把 KL 加到损失中,不要把它直接加入奖励。
回答的坑
- 只说 MoE 需要负载均衡,却不提 RL 采样下的高熵区域路由漂移,回答没有命中问题。
- 只说稀疏奖励会让训练变差,却不说明组内奖励方差归零会导致梯度消失。
同系列的题
—— 本题完 ——