五厂面经真题集DeepSeek面经高频DeepSeek真题Agent 算法MoE速答 · 约 5 分钟更新 2026-09-29

GRPO 训练 MoE 模型会遇到什么问题?怎么改进?

一句话结论

GRPO 训练 MoE 要处理专家负载不均衡、稀疏奖励下组内方差归零和 KL 方差过大三类问题;可调负载均衡损失权重,联动组大小与采样温度,用 k3 估计 KL 并加入损失。

先这样答

结论是,GRPO 训练 MoE 时要同时处理专家负载、组内奖励方差和 KL 估计方差三个问题。RL 采样会让专家负载比普通训练更不均衡。高熵区域的路由容易漂移,部分专家会承受更多样本,部分专家则利用不足。

第二个问题来自稀疏奖励。组内样本的奖励可能全部相同,组内奖励方差就会塌为零。这样一来,GRPO 无法形成有效的相对优势,梯度也会消失。改进时,可以调整负载均衡辅助损失的权重。也要联动设置组大小和采样温度,让采样分组与探索强度配合起来。

第三个问题是 KL 估计的方差。方差过大会影响训练稳定性。我的做法是使用低方差的 k3 估计器,并把 KL 项加在损失里,而不是直接加在奖励里。这样回答时要把三个问题和三个对应改进方向一一对上。

面试官会怎么追问

  • 「为什么 RL 采样会让 MoE 的专家负载更不均衡?」 高熵区域的路由决策更容易漂移。采样过程会放大这种路由变化,让不同专家接收到的样本量进一步拉开。改进时需要关注负载均衡辅助损失的权重。

  • 「组内奖励方差为什么会塌为零?」 稀疏奖励任务里,组内样本可能拿到相同奖励。奖励没有差异,组内方差就变成零。GRPO 依赖组内相对差异形成训练信号,方差为零时梯度会消失。

  • 「KL 为什么用 k3,并且要放进损失而不是奖励?」 KL 估计本身存在方差,方差会影响训练稳定性。可以使用低方差的 k3 估计器。还要把 KL 加到损失中,不要把它直接加入奖励。

回答的坑

  • 只说 MoE 需要负载均衡,却不提 RL 采样下的高熵区域路由漂移,回答没有命中问题。
  • 只说稀疏奖励会让训练变差,却不说明组内奖励方差归零会导致梯度消失。
—— 本题完 ——