先这样答
RLHF 的具体过程涉及四个模型:策略模型、参考模型、奖励模型和价值模型。策略模型是被训练的模型。参考模型保持冻结,用来计算 KL 约束。奖励模型由人类偏好训练得到,负责给回答打分。价值模型用于计算优势函数,帮助降低方差。
训练时,先用人类标注的偏好对训练奖励模型。偏好对表示人类在两个回答中选出更偏好的一个。奖励模型学会把偏好的回答打更高分。然后进入强化学习阶段,优化策略模型,让它获得更高奖励,同时通过 KL 约束限制策略相对参考模型漂移过大。
价值模型在强化学习阶段参与优势函数计算。优势函数反映当前结果相对预期的好坏。价值模型提供计算所需的估计,从而降低训练方差。面试中可以先按四个模型讲清职责,再补充简化方案:DPO 跳过奖励模型,直接使用偏好对优化策略。
面试官会怎么追问
-
「为什么参考模型要冻结?」 参考模型不参与训练。它用于计算 KL 约束。这个约束限制策略模型相对参考模型漂移过大。
-
「奖励模型和价值模型分别解决什么问题?」 奖励模型根据人类偏好给回答打分。价值模型用于计算优势函数,帮助降低训练方差。两者一个负责评分,一个服务于训练计算。
-
「DPO 和 RLHF 的关系是什么?」 DPO 是一种简化方案。它跳过奖励模型,直接使用人类偏好对优化策略模型。RLHF 则先训练奖励模型,再进入强化学习阶段。
回答的坑
- 不要把参考模型说成被训练的模型,它在 RLHF 过程中保持冻结。
- 不要把价值模型说成奖励模型,价值模型用于计算优势函数并降低方差。
同系列的题
—— 本题完 ——