训练与微调RLHFReward ModelReward Hacking速答 · 约 6 分钟更新 2026-09-28

Reward Model 是什么?Reward Hacking 怎么发现、怎么防?

一句话结论

Reward Model 把人类偏好学成奖励分数,在强化学习阶段指导策略;Reward Hacking 是策略刷高分但实际变差,要靠人评对照、漂移监控、策略约束和持续重训来控制。

先这样答

Reward Model,简称 RM,是把人类偏好训练成标量分数的模型。在 RLHF 中,策略模型先做 SFT,随后用 PPO、GRPO 等方法继续优化;这时 RM 替代人工,对策略生成的回答给出奖励信号。Reward Hacking 则是策略学会钻 RM 的空子,分数升高,但真实回答质量反而下降。

RM 的典型训练数据是同一个提示配两个回答,由标注者选择哪个更好,模型据此学习回答间的偏好关系。问题在于 RM 只是人类偏好的近似,而且策略优化后会生成训练分布之外的内容,于是可能靠拉长输出、套固定格式、迎合用户观点等方式刷分。发现它不能只看奖励曲线,还要做人类抽检和成对评测,检查 RM 分数与人评是否背离,并监控长度、措辞和拒答率等分布变化。防护上可用 KL 约束限制策略偏离参考模型,使用多个 RM 投票或交叉检查,并持续收集新偏好数据重训 RM。

面试时可以收束为:RM 决定策略在优化什么,而防 Reward Hacking 的关键,是持续验证高奖励是否仍然代表人真正认可的质量。

面试官会怎么追问

  • 「RM 训练时为什么用成对偏好,不直接让人打分?」 绝对分数容易受标注者尺度影响,同一个回答有人打 7 分、有人打 9 分。成对比较通常更容易保持一致,但仍要处理位置偏差、长度偏好和标注噪声。
  • 「训练奖励一直涨,怎么判断是不是 Reward Hacking?」 先在固定样本上比较 RM 排名与独立人评,再看高奖励输出是否出现长度增长、模板重复或谄媚增加。若奖励上涨而人评下降,或者输出分布持续漂移,就应暂停优化并更新评测与 RM。
  • 「加 KL 约束就能彻底解决吗?」 不能,KL 只限制策略离参考模型太远,不能修正 RM 本身的错误偏好。约束太强还会压制有效学习,所以通常要与人工评测、多 RM 交叉判断和新数据重训配合。

回答的坑

  • 只说 RM 是「给回答打分的模型」,却不说明偏好对数据、SFT 后的位置和它如何向 PPO 或 GRPO 提供奖励信号。
  • 把 Reward Hacking 等同于模型生成错误内容,正确方向是强调策略利用奖励模型缺陷,出现高分与真实质量背离。
—— 本题完 ——