训练与微调滴滴面经高频[SFTRL模型训练]速答 · 约 6 分钟更新 2026-09-28

SFT 训到什么程度可以切 RL?切换的判断标准是什么?

一句话结论

SFT 阶段需确保模型掌握基本任务能力且输出格式稳定,当验证集指标进入平台期、格式合规率达标且正确率非零时即可切 RL,避免探索成本过高。

先这样答

回答这个问题需从模型基础能力和训练成本出发。SFT 和 RL 的先后顺序由它们的作用决定,SFT 负责把行为教会,让模型掌握基本任务执行能力和输出格式;RL 负责把正确答案的概率调高。若模型无基本能力时直接切 RL,会导致探索成本爆炸,奖励稀疏。因此,切换的核心前提是模型已有基本完成任务的能力,能偶尔拿到正向奖励。

判断切换的标准具体看三个方面。首先,验证集指标进入平台期,loss 正常收敛且过拟合可控,说明 SFT 带来的增益已经边际化。其次,模型在任务上的输出格式稳定,工具调用的 schema 正确率高。反之如果格式常错就切 RL,模型会因格式错误拿不到奖励,导致训练直接发散。最后,任务正确率不再是零,必须有正样本可供强化,RL 阶段才能运作。

实际操作中,SFT 阶段重点监控验证 loss、任务指标和格式合规率。准备切 RL 前,需在固定评测集上跑一次测试拿基线。进入 RL 阶段后,持续对比 reward 曲线与任务指标是否同向。面试收束可以这样说:格式稳、正确率非零、SFT 增益见顶,三个条件齐了再切,切入后补上 reward 与任务指标同向的监控。

面试官会怎么追问

  • 「SFT 数据从哪里来,怎样防止把错误工具使用方式教给模型?」 答法是强调数据来源必须具备严格的过滤机制。错误的演示会直接教坏模型,因此工具调用轨迹必须按照执行成功与否进行筛选,所有数据在入库前要经过格式校验,剔除错误样本。
  • 「SFT 阶段的数据配比有什么讲究?」 答法是强调数据分布需要覆盖不同的难度梯度。配比时不能全是简单题,要保证难度的阶梯性,这样才能让模型掌握处理复杂场景的能力,为后续 RL 阶段的探索打好基础。
  • 「切入 RL 后怎么防止模型走捷径?」 答法是重点核对 reward 曲线与任务指标是否同向。切 RL 前先在固定评测集上拿基线,RL 阶段若 reward 涨但任务指标下降,说明发生了 reward hacking,需调整奖励函数。

回答的坑

  • 认为只要验证集的 loss 收敛就可以切 RL,而忽略了格式不稳直接做强化会导致训练发散,正确的方向是把格式合规率和任务正确率非零作为硬性前置条件。
  • 混淆 SFT 和 RL 的作用定位,错误地认为可以在 RL 阶段让模型从头学习技能,正确的表述应该是 SFT 负责把行为教会,RL 负责把正确答案的概率调高。
—— 本题完 ——