是什么
RLHF 的训练分为三个阶段。首先进行监督微调提供基础模型。其次是训练奖励模型,收集同一提示词的多输出进行成对排名标注,采用 Bradley-Terry 成对比较损失训练,输出代表人类偏好的标量分数。
最后是强化学习阶段。以奖励模型打分为奖励信号,用 PPO 等算法优化策略模型。优化时通常加入 KL 惩罚项,防止策略模型偏离初始微调模型太远。
该机制在实践中存在人工标注贵、训练不稳定的问题。同时面临奖励骇客风险,即策略模型钻奖励模型的空子获取高分,而非生成符合意图的内容。
解决什么问题
在模型对齐中,好答案难以直接写成可微的损失函数。若无此环节,模型仅靠监督微调只能模仿表面特征,难以捕捉人类意图。
RLHF 解决了此问题。人类偏好可进行成对比较标注,奖励模型将这些抽象偏好转化为可优化的标量信号,为强化学习算法提供明确的优化导向。
面试怎么考
面试常考察为什么要 RLHF 这一步及三段各做什么。答题需阐明监督微调、奖励模型和强化学习的作用。关于奖励模型怎么训,应指出其使用成对比较数据和 Bradley-Terry 损失。
考官常问 KL 惩罚的作用,需回答用于约束策略模型,防止偏离初始模型太远。针对奖励骇客怎么防,答题要点是说明可通过 KL 惩罚限制优化范围来缓解。
又称:RLHF · 人类反馈强化学习 · 基于人类反馈的强化学习
考这个术语的题
接着做点什么
—— 本条完 ——