先这样答
Reward Model,简称 RM,是把人类偏好训练成标量分数的模型。在 RLHF 中,策略模型先做 SFT,随后用 PPO、GRPO 等方法继续优化;这时 RM 替代人工,对策略生成的回答给出奖励信号。Reward Hacking 则是策略学会钻 RM 的空子,分数升高,但真实回答质量反而下降。
RM 的典型训练数据是同一个提示配两个回答,由标注者选择哪个更好,模型据此学习回答间的偏好关系。问题在于 RM 只是人类偏好的近似,而且策略优化后会生成训练分布之外的内容,于是可能靠拉长输出、套固定格式、迎合用户观点等方式刷分。发现它不能只看奖励曲线,还要做人类抽检和成对评测,检查 RM 分数与人评是否背离,并监控长度、措辞和拒答率等分布变化。防护上可用 KL 约束限制策略偏离参考模型,使用多个 RM 投票或交叉检查,并持续收集新偏好数据重训 RM。
面试时可以收束为:RM 决定策略在优化什么,而防 Reward Hacking 的关键,是持续验证高奖励是否仍然代表人真正认可的质量。
面试官会怎么追问
- 「RM 训练时为什么用成对偏好,不直接让人打分?」 绝对分数容易受标注者尺度影响,同一个回答有人打 7 分、有人打 9 分。成对比较通常更容易保持一致,但仍要处理位置偏差、长度偏好和标注噪声。
- 「训练奖励一直涨,怎么判断是不是 Reward Hacking?」 先在固定样本上比较 RM 排名与独立人评,再看高奖励输出是否出现长度增长、模板重复或谄媚增加。若奖励上涨而人评下降,或者输出分布持续漂移,就应暂停优化并更新评测与 RM。
- 「加 KL 约束就能彻底解决吗?」 不能,KL 只限制策略离参考模型太远,不能修正 RM 本身的错误偏好。约束太强还会压制有效学习,所以通常要与人工评测、多 RM 交叉判断和新数据重训配合。
回答的坑
- 只说 RM 是「给回答打分的模型」,却不说明偏好对数据、SFT 后的位置和它如何向 PPO 或 GRPO 提供奖励信号。
- 把 Reward Hacking 等同于模型生成错误内容,正确方向是强调策略利用奖励模型缺陷,出现高分与真实质量背离。
同系列的题
—— 本题完 ——