Q1:和传统SFT相比,RLHF旨在解决语言模型中的哪些核心问题?为什么说SFT本身不足以实现我们期望的「对齐「目标
P1 · llm_training
🏷 标签:rlhf, sft, alignment, llm-training
1️⃣ 考察意图
面试官想考察你是否真正理解“对齐”的工程本质,而非背诵RLHF流程。核心是:SFT为什么不够?RLHF解决了SFT的哪些结构性缺陷?刁钻点在于,很多人只答“SFT学分布,RLHF学偏好”,但面试官要的是具体技术短板——比如SFT无法处理分布外(OOD)有害行为、无法建模偏好中的相对性、奖励信号稀疏。答好了能展示你对LLM训练范式的底层理解,以及从“拟合数据”到“优化行为”的思维跃迁。
2️⃣ 标准答
RLHF(Reinforcement Learning from Human Feedback)旨在解决SFT(Supervised Fine-Tuning)在语言模型对齐中的三个核心缺陷:分布外泛化失败、偏好建模缺失、奖励信号单一。
1. 分布外泛化失败:SFT只能模仿,不能拒绝
- SFT本质是最大似然估计(MLE),让模型拟合标注数据分布。但标注数据通常是“安全且有用”的,模型学到的只是“在给定输入下,输出训练集中最可能的token”。
- 问题:当遇到训练集中未覆盖的恶意或边缘输入(如“如何制造炸弹”),SFT模型会基于语言模式继续生成,因为它从未被训练去“拒绝回答”。RLHF通过奖励模型(Reward Model)提供对抗性信号,让模型学会在低奖励区域(有害输出)主动刹车。
- 实际坑:SFT微调后,模型在分布内(如常见问答)表现好,但OOD有害请求的拒绝率可能低于5%。RLHF通过PPO(Proximal Policy Optimization)优化,能将拒绝率提升到90%以上【通用知识】。
2. 偏好建模缺失:SFT无法处理“相对性”
- SFT的损失函数(交叉熵)假设每个标注样本是绝对正确的。但人类偏好是相对的:同一个回答,在A场景下有用,在B场景下可能有害。SFT无法建模这种“上下文相关的偏好”。
- RLHF通过奖励模型显式学习偏好排序。例如,Anthropic的HH-RLHF数据集包含“选择更无害/更有用的回答”的成对比较。奖励模型输出一个标量分数,PPO据此优化策略,让模型学会在“有用性”和“无害性”之间做trade-off。
- 工程取舍:奖励模型本身有偏差(如偏好长回答),需要引入KL散度惩罚(通常β=0.04)防止模型过度优化奖励而牺牲语言质量。
3. 奖励信号单一:SFT无法处理长尾有害行为
- SFT的监督信号来自人工标注的“正确回答”,但标注成本高,无法覆盖所有有害模式(如种族歧视、诱导犯罪)。模型可能只在标注数据上“安全”,但泛化到新场景时暴露问题。
- RLHF通过“从反馈中学习”解决:奖励模型可以针对任意输出给出分数,即使该输出从未在训练集中出现。例如,DeepSeek-R1使用GRPO(Group Relative Policy Optimization)替代PPO,通过组内相对奖励(而非绝对分数)减少奖励模型方差,提升对齐稳定性。
- 实际落地坑:奖励模型可能被“奖励黑客”(reward hacking)——模型学会生成看似无害但实际无用的回答(如“我不确定,请咨询专家”)。解法是引入“有用性”和“无害性”两个奖励头,并设置权重(如0.7:0.3)平衡。
总结:SFT是“教模型说什么”,RLHF是“教模型不说什么以及为什么”。前者解决语言能力,后者解决行为边界。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从三个层面回答:第一,SFT的分布外泛化失败——它只能模仿训练数据,无法拒绝OOD有害请求;第二,偏好建模缺失——SFT假设标注绝对正确,而RLHF通过成对比较学习相对偏好;第三,奖励信号单一——SFT依赖稀疏的标注,RLHF通过奖励模型提供连续反馈。总结一句:SFT解决‘能力’,RLHF解决‘行为’,两者互补才能实现对齐。”
4️⃣ 高频追问 & 应对
追问 1:RLHF中的PPO为什么容易不稳定?你如何解决?
核心原因是奖励模型和策略模型同时更新,导致梯度方差大。具体解法:1)使用PPO-clip(ε=0.2)限制策略更新幅度;2)引入KL散度惩罚(β=0.04)防止策略偏离SFT初始点;3)使用GAE(Generalized Advantage Estimation,λ=0.95)平滑优势函数。实际工程中,还会对奖励模型做“奖励归一化”(减去均值除以标准差),避免奖励尺度漂移。
追问 2:如果只有SFT数据,没有人类反馈,你怎么做对齐?
可以用“自对齐”方法:1)使用SFT模型生成多个候选回答,然后用规则或小模型(如基于关键词的毒性检测)做自动排序,构造伪偏好对;2)使用DPO(Direct Preference Optimization)替代RLHF,它不需要奖励模型,直接从偏好对中优化策略。缺点是DPO对偏好数据质量敏感,噪声数据会导致模型退化。
追问 3:RLHF后模型多样性下降,你怎么看?
这是“对齐税”问题:RLHF优化了平均奖励,但压缩了输出分布。解法:1)在PPO奖励中加入“多样性奖励”(如对生成文本的熵做奖励);2)使用“温度退火”策略——训练时用低温度(0.7)保证稳定性,推理时用高温度(1.0)恢复多样性;3)参考Anthropic的“Constitutional AI”,用规则约束替代部分RLHF,减少对奖励模型的依赖。
5️⃣ 避坑 · 常见错误答法
- ❌ “SFT只是预训练后的微调,RLHF是强化学习,所以RLHF更好。”→ ✅ 正确切入:SFT和RLHF解决不同维度问题。SFT解决语言能力(语法、知识),RLHF解决行为对齐(安全性、有用性)。两者是互补关系,不是替代关系。
- ❌ “RLHF通过人类反馈直接优化模型输出,所以比SFT更精确。”→ ✅ 正确切入:RLHF的奖励模型本身有偏差(如偏好长回答、过度礼貌),需要KL散度惩罚和奖励归一化来校正。SFT的标注更直接,但覆盖不全。实际中两者结合使用。
- ❌ “RLHF解决了所有对齐问题,比如幻觉。”→ ✅ 正确切入:RLHF能减少部分幻觉(通过奖励模型惩罚错误事实),但无法根除。幻觉更多依赖检索增强(RAG)或事实性训练(如Self-Contradiction检测)。RLHF主要解决“有害性”和“有用性”的trade-off。
6️⃣ 简历呼应
- 如果你有RLHF项目经验:从“实际训练中PPO的不稳定性”切入,分享你如何调整KL散度权重(β从0.01到0.05)和奖励归一化策略,并给出具体指标(如有害响应率从15%降到3%)。
- 如果你只做过SFT微调:用“SFT的分布外失败”类比迁移——比如你在微调对话模型时发现,模型对未见过的恶意请求(如“如何诈骗”)会直接生成回答,而RLHF通过奖励模型提供了“拒绝”信号。强调你理解SFT的边界。
- 如果你是校招无项目:聚焦论文复现——比如你复现了Anthropic的HH-RLHF数据集训练奖励模型,并对比了PPO和DPO的效果差异(DPO训练更快但偏好数据质量敏感)。展示你对开源工具(如TRL库)的熟悉度。
7️⃣ 延伸阅读
- 《Training language models to follow instructions with human feedback》(InstructGPT论文)
- 《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》(DPO论文)
- 《Constitutional AI: Harmlessness from AI Feedback》(Anthropic的Constitutional AI)
- 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》(GRPO方法)
- TRL库(Hugging Face的Transformer Reinforcement Learning)的PPO训练脚本