先这样答
本质上,SFT 学习示范答案,RL 学习高奖励行为。SFT 按 token 计算交叉熵,让模型模仿老师怎么写。它看到什么答案,就尽量复现什么答案。模型主要学习示范数据里的写法,行为分布也相对单一。
RL 按轨迹拿奖励,再根据奖励优化策略。它不只关心某个 token 是否和示范一致,还关心一段行为最后得分高不高。模型因此可以学习什么行为更容易得到高分,也可能超越示范者。它还能学习过程性的策略,而不是只复制一个结果。
两者的代价和适用场景也不同。RL 样本效率低,训练不稳,还需要明确的奖励信号。遇到格式和风格要求,优先用 SFT。遇到价值判断和复杂决策,再考虑 RL。面试里可以把差异概括成一句话:SFT 学“老师怎么写”,RL 学“什么行为得分高”。
面试官会怎么追问
-
「为什么说 RL 能超越示范者?」
示范数据告诉模型老师实际写了什么。RL 根据奖励判断哪些行为得分更高。只要奖励信号认可更好的行为,模型就不必停留在示范者的写法上。 -
「SFT 已经能学到答案,为什么还需要 RL?」
SFT 的目标是逐 token 模仿示范答案。它更适合学习固定的格式和风格。价值判断或复杂决策需要比较整段行为的结果,这时可以用轨迹奖励来优化。 -
「实际做模型微调时,SFT 和 RL 怎么选?」
先看任务是否有明确示范答案。格式和风格任务用 SFT 更直接。任务要求模型判断价值或处理复杂决策时,再选择 RL,并确认能够提供奖励信号。
回答的坑
- 不要把 RL 说成“更强的 SFT”,两者优化目标不同,RL 依赖轨迹奖励,SFT 依赖逐 token 交叉熵。
- 不要只讲 RL 能超越示范者,还要主动说明它样本效率低、训练不稳,并且需要奖励信号。
同系列的题
这家公司的面经实录
—— 本题完 ——