五厂面经真题集美团面经高频百度面经高频RLHF偏好对齐大模型面试速答 · 约 5 分钟更新 2026-09-29

讲讲 RLHF 的具体过程,涉及几个模型?

一句话结论

RLHF 具体涉及四个模型:策略模型负责训练,参考模型计算 KL 约束,奖励模型根据人类偏好打分,价值模型计算优势函数以降低方差。

先这样答

RLHF 的具体过程涉及四个模型:策略模型、参考模型、奖励模型和价值模型。策略模型是被训练的模型。参考模型保持冻结,用来计算 KL 约束。奖励模型由人类偏好训练得到,负责给回答打分。价值模型用于计算优势函数,帮助降低方差。

训练时,先用人类标注的偏好对训练奖励模型。偏好对表示人类在两个回答中选出更偏好的一个。奖励模型学会把偏好的回答打更高分。然后进入强化学习阶段,优化策略模型,让它获得更高奖励,同时通过 KL 约束限制策略相对参考模型漂移过大。

价值模型在强化学习阶段参与优势函数计算。优势函数反映当前结果相对预期的好坏。价值模型提供计算所需的估计,从而降低训练方差。面试中可以先按四个模型讲清职责,再补充简化方案:DPO 跳过奖励模型,直接使用偏好对优化策略。

面试官会怎么追问

  • 「为什么参考模型要冻结?」 参考模型不参与训练。它用于计算 KL 约束。这个约束限制策略模型相对参考模型漂移过大。

  • 「奖励模型和价值模型分别解决什么问题?」 奖励模型根据人类偏好给回答打分。价值模型用于计算优势函数,帮助降低训练方差。两者一个负责评分,一个服务于训练计算。

  • 「DPO 和 RLHF 的关系是什么?」 DPO 是一种简化方案。它跳过奖励模型,直接使用人类偏好对优化策略模型。RLHF 则先训练奖励模型,再进入强化学习阶段。

回答的坑

  • 不要把参考模型说成被训练的模型,它在 RLHF 过程中保持冻结。
  • 不要把价值模型说成奖励模型,价值模型用于计算优势函数并降低方差。
—— 本题完 ——