训练与微调RLHF对齐更新 2026-09-28

RLHFReinforcement Learning from Human Feedback

一句话定义

RLHF 是用人类偏好数据训练奖励模型,并以此作为环境信号对模型做强化学习的对齐方法。预训练模型具备语言能力但不一定符合意图,RLHF 让输出向人类偏好靠拢。

是什么

RLHF 的训练分为三个阶段。首先进行监督微调提供基础模型。其次是训练奖励模型,收集同一提示词的多输出进行成对排名标注,采用 Bradley-Terry 成对比较损失训练,输出代表人类偏好的标量分数。

最后是强化学习阶段。以奖励模型打分为奖励信号,用 PPO 等算法优化策略模型。优化时通常加入 KL 惩罚项,防止策略模型偏离初始微调模型太远。

该机制在实践中存在人工标注贵、训练不稳定的问题。同时面临奖励骇客风险,即策略模型钻奖励模型的空子获取高分,而非生成符合意图的内容。

解决什么问题

在模型对齐中,好答案难以直接写成可微的损失函数。若无此环节,模型仅靠监督微调只能模仿表面特征,难以捕捉人类意图。

RLHF 解决了此问题。人类偏好可进行成对比较标注,奖励模型将这些抽象偏好转化为可优化的标量信号,为强化学习算法提供明确的优化导向。

面试怎么考

面试常考察为什么要 RLHF 这一步及三段各做什么。答题需阐明监督微调、奖励模型和强化学习的作用。关于奖励模型怎么训,应指出其使用成对比较数据和 Bradley-Terry 损失。

考官常问 KL 惩罚的作用,需回答用于约束策略模型,防止偏离初始模型太远。针对奖励骇客怎么防,答题要点是说明可通过 KL 惩罚限制优化范围来缓解。

又称:RLHF · 人类反馈强化学习 · 基于人类反馈的强化学习

相关术语

—— 本条完 ——