先这样答
RLHF 的流程分三步。第一步先用 SFT 训出一个会对话的底子;第二步收集人类偏好数据:同一个问题的多个回答,让人排序或两两比较,用这些数据训练一个奖励模型,它的任务是给任意回答打分,分数代表人的满意程度;第三步用强化学习(经典做法是 PPO)优化对话模型,目标是把奖励模型的分数推高。
为什么要这一步:SFT 的监督信号是模仿,模型只知道「这种答法是对的」,不知道两种都不错的答法里人更喜欢哪种。详略、语气、要不要主动追问,这些判断写不成唯一的标准答案,但人能比较。偏好数据提供的比较信号,比模仿信号更贴近真实需求。训练时还要加一条约束:别偏离 SFT 模型太远,防止模型为了刷分跑偏。
一句总结:SFT 让模型会回答,RLHF 让回答更合人的意。奖励模型是人类偏好的代理人,强化学习是把代理分数推高的优化过程。
面试官会怎么追问
- 「奖励模型有什么风险?」 它只是偏好的近似。模型可能找到它的漏洞,刷出高分但实际回答并不好,这叫奖励投机。所以优化幅度要受限(就是前面说的偏离约束),并且要持续做人工评估看真实生成质量,不能只看分数。
- 「RLHF 只能用 PPO 吗?」 不是。PPO 是经典选择但工程重,要同时维护策略、奖励、价值几份模型。后来的 DPO 干脆去掉奖励模型和强化学习循环,GRPO 则去掉了价值网络,思路都是把这件事做便宜。
- 「偏好数据怎么采集?」 让标注员对同一提示下的多个回答排序或比较,标注规范里通常约定有用、诚实、无害这些维度。奖励模型的上限就是数据质量的上限,标注不一致,后面的训练全白搭。
回答的坑
- 把 RLHF 说成教模型学新知识。它调的是行为偏好和表达质量,模型不会的问题 RLHF 救不了,知识缺口要靠预训练和检索补。
- 只背三步流程,不讲偏离约束。没有「别偏离太远」这条限制,模型会在奖励模型上过拟合、输出越练越怪,主动讲出这一点是很明确的加分信号。
同系列的题
—— 本题完 ——