五厂面经真题集拼多多面经高频强化学习监督微调Agent速答 · 约 5 分钟更新 2026-09-29

强化学习微调和监督微调有什么本质不同?

一句话结论

SFT 学老师怎么写,RL 学什么行为得分高;前者适合格式风格,后者适合价值判断和复杂决策。

先这样答

本质上,SFT 学习示范答案,RL 学习高奖励行为。SFT 按 token 计算交叉熵,让模型模仿老师怎么写。它看到什么答案,就尽量复现什么答案。模型主要学习示范数据里的写法,行为分布也相对单一。

RL 按轨迹拿奖励,再根据奖励优化策略。它不只关心某个 token 是否和示范一致,还关心一段行为最后得分高不高。模型因此可以学习什么行为更容易得到高分,也可能超越示范者。它还能学习过程性的策略,而不是只复制一个结果。

两者的代价和适用场景也不同。RL 样本效率低,训练不稳,还需要明确的奖励信号。遇到格式和风格要求,优先用 SFT。遇到价值判断和复杂决策,再考虑 RL。面试里可以把差异概括成一句话:SFT 学“老师怎么写”,RL 学“什么行为得分高”。

面试官会怎么追问

  • 「为什么说 RL 能超越示范者?」
    示范数据告诉模型老师实际写了什么。RL 根据奖励判断哪些行为得分更高。只要奖励信号认可更好的行为,模型就不必停留在示范者的写法上。

  • 「SFT 已经能学到答案,为什么还需要 RL?」
    SFT 的目标是逐 token 模仿示范答案。它更适合学习固定的格式和风格。价值判断或复杂决策需要比较整段行为的结果,这时可以用轨迹奖励来优化。

  • 「实际做模型微调时,SFT 和 RL 怎么选?」
    先看任务是否有明确示范答案。格式和风格任务用 SFT 更直接。任务要求模型判断价值或处理复杂决策时,再选择 RL,并确认能够提供奖励信号。

回答的坑

  • 不要把 RL 说成“更强的 SFT”,两者优化目标不同,RL 依赖轨迹奖励,SFT 依赖逐 token 交叉熵。
  • 不要只讲 RL 能超越示范者,还要主动说明它样本效率低、训练不稳,并且需要奖励信号。

这家公司的面经实录

—— 本题完 ——