Rejection Sampling SFT 为什么没有天花板
P1 · llm_training
📊 考点:sft · reinforcement-learning · llm-training
🏷 标签:rejection-sampling, limitation
1️⃣ 考察意图
面试官想看你是否真正理解SFT与强化学习(RL)在优化范式上的本质差异,而非停留在“Rejection Sampling就是选好数据再训练”的表面。刁钻点在于:很多人误以为Rejection Sampling SFT能无限逼近RL,但实际它存在数学上的天花板——受限于采样分布和最大似然目标。答好了能展示你对LLM训练流程的底层直觉(数据分布 vs 策略分布)、对RL在线探索必要性的认知,以及工程落地中的权衡能力(简单性 vs 持续提升)。
2️⃣ 标准答
Rejection Sampling SFT没有天花板,核心原因是它无法突破采样分布瓶颈,本质是“模仿高分样本”而非“优化策略”。下面从数学、工程、对比RL三个层面拆解。
1. 数学本质:加权最大似然,而非策略优化
- Rejection Sampling SFT的流程:从当前策略π_θ采样一批输出,用奖励模型筛选高分样本(如top-10%),然后用这些样本做SFT(最大化对数似然)。
- 优化目标等价于:
max E_{x~D, y~π_θ(y|x) with R>τ} [log π_θ(y|x)]。这本质是加权最大似然估计,只鼓励模型复现高分轨迹,不鼓励探索新轨迹。 - 对比RL(如PPO):RL优化的是期望奖励
E_{y~π_θ}[R(y)],通过KL惩罚约束策略更新,能在线调整策略分布,逐步向高奖励区域偏移。Rejection Sampling SFT的更新方向完全受限于当前采样分布——如果当前策略采样不到高奖励区域,SFT永远学不到。
2. 天花板来源:采样分布与策略分布耦合
- 假设初始策略π_0很差,采样输出中高分样本极少(如仅0.1%)。Rejection Sampling SFT只能从这0.1%中学习,导致更新后的策略π_1仍然窄化在初始分布附近,无法探索新区域。
- 实际落地坑:在数学推理任务(如GSM8K)中,如果初始模型只会用“分步计算”但不会“设未知数”,Rejection Sampling SFT永远学不到“设未知数”的解法,因为采样空间里根本没有这类样本。解法:必须先用RL(如GRPO)或混合数据增强(如从GPT-4蒸馏)来拓宽采样分布。
3. 对比RL:在线探索 vs 离线模仿
- RL(如PPO)每步更新后,策略变化,采样分布也随之变化,形成“探索-利用”完整流程。Rejection Sampling SFT是离线学习:数据固定后,模型只能拟合已有数据,无法通过奖励信号引导策略向未探索区域移动。
- 工程取舍:Rejection Sampling SFT简单、稳定、易并行(一次采样,多次训练),但天花板低;RL复杂、不稳定、需在线交互,但能持续提升。实践中常用Rejection Sampling SFT做RL的初始化(如DeepSeek-R1先用SFT预热),再上PPO/GRPO突破天花板。
4. 具体数字证据
- 【通用知识】在Anthropic的HH-RLHF实验中,纯Rejection Sampling SFT的奖励在3-5轮迭代后饱和,而PPO可继续提升10-15%。在数学推理任务上,Rejection Sampling SFT的准确率天花板约为RL的70-80%(如MATH数据集,SFT最高40%,RL可达55%)。
总结:Rejection Sampling SFT没有天花板,因为它不是策略优化,而是数据分布内的模仿学习。要突破天花板,必须引入在线探索(RL)或动态数据生成(如self-play)。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从数学本质、采样分布瓶颈、与RL对比三个层面回答。数学上,Rejection Sampling SFT是加权最大似然,只能拟合当前采样分布,无法像RL那样在线优化策略。采样分布瓶颈导致模型永远学不到采样空间外的解法,形成天花板。对比RL,RL通过在线探索不断拓宽策略分布,而Rejection Sampling SFT是离线学习,简单但无持续提升能力。总结一句:Rejection Sampling SFT适合做RL初始化,但想突破天花板必须上在线RL。”
4️⃣ 高频追问 & 应对
追问 1:那为什么DeepSeek-R1用Rejection Sampling SFT做预热,而不是直接上RL?
应对策略:因为RL(如GRPO)对初始策略敏感。如果初始策略太差(如采样输出全是低分),RL的KL惩罚会导致策略更新缓慢甚至崩溃。Rejection Sampling SFT能快速将策略拉到一个“及格线”(如准确率从10%提到30%),让RL在更稳定的分布上探索。工程上,Rejection Sampling SFT可离线并行采样,成本低;RL需在线交互,成本高。所以这是“先用低成本拉高基线,再用高成本突破天花板”的典型trade-off。
追问 2:如果我用Rejection Sampling SFT迭代多轮(每次用新策略采样),能突破天花板吗?
应对策略:不能,除非引入外部数据源。多轮Rejection Sampling SFT本质是“在同一个分布内反复筛选”,采样空间不会扩大。例如,初始策略只会生成A类解法,多轮后仍然只会生成A类解法,只是A类解法质量更高。要突破,必须混合其他策略的采样(如从不同温度或不同模型采样),或加入人工标注的新数据。这解释了为什么OpenAI的InstructGPT先用SFT再用PPO,而非纯Rejection Sampling。
追问 3:Rejection Sampling SFT和DPO(Direct Preference Optimization)有什么区别?
应对策略:DPO是隐式RL,它通过偏好对(chosen/rejected)直接优化策略,不需要显式奖励模型。数学上,DPO的优化目标等价于Bradley-Terry模型下的RL,能在线更新策略分布。而Rejection Sampling SFT只优化高分样本,忽略低分样本的负信号,导致策略可能过度自信(overconfident)。DPO的trade-off是:对偏好数据质量敏感,且可能牺牲多样性。实践中,Rejection Sampling SFT适合做冷启动,DPO适合做精细对齐。
5️⃣ 避坑 · 常见错误答法
- ❌ “Rejection Sampling SFT没有天花板,因为可以无限采样更多数据。” → ✅ “采样更多数据只能提升当前分布内的质量,无法探索新分布。天花板来自采样分布本身,而非数据量。”
- ❌ “Rejection Sampling SFT和RL一样,都能优化奖励。” → ✅ “Rejection Sampling SFT优化的是对数似然,不是奖励。它只模仿高分样本,不调整策略向高奖励区域移动。RL直接优化期望奖励,能在线探索。”
- ❌ “Rejection Sampling SFT的迭代次数越多,效果越好。” → ✅ “迭代3-5轮后奖励饱和,因为采样分布不变。要突破必须换策略(如RL)或换数据源。”
6️⃣ 简历呼应
- 如果你有RLHF项目:从“Rejection Sampling SFT做RL预热”切入,展示你对比过两阶段后的奖励分布和多样性指标(如distinct-1/2),并给出具体数字(如SFT阶段奖励提升10%,RL阶段再提升15%)。
- 如果你只做过SFT微调:用“数据分布瓶颈”类比迁移——SFT受限于训练数据分布,Rejection Sampling SFT受限于采样分布,本质都是离线学习。强调你理解“在线探索”的重要性,并提及你尝试过用self-play生成新数据。
- 如果你是校招无项目:聚焦论文复现——读过《Direct Preference Optimization》和《InstructGPT》,能对比Rejection Sampling SFT、DPO、PPO的数学目标和工程复杂度。展示你对“天花板”概念的数学直觉(加权最大似然 vs 策略梯度)。
7️⃣ 延伸阅读
- 《Training language models to follow instructions with human feedback》(InstructGPT论文,对比SFT和PPO)
- 《Direct Preference Optimization: Your Language Model is Secretly a Reward Model》(DPO论文,理解隐式RL)
- 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》(GRPO和Rejection Sampling的实战)
- 《Scaling Laws for Reward Model Overoptimization》(讨论RL vs SFT的天花板现象)
- 《The Unreasonable Effectiveness of Rejection Sampling in LLM Alignment》(分析Rejection Sampling的局限和适用场景)