先给结论
选型核心看任务是否有客观可验证的判据以及对能力上限的具体要求。如果任务存在明确的对错标准或可自动判分的奖励函数,且目标是冲破现有数据限制探索更高能力上限,选 PPO 或 GRPO 等在线强化学习方案。如果任务仅有基于人类偏好的静态标注数据,且工程要求简单稳定、需要快速交付模型,则选 DPO 等离线偏好优化方案。算力资源的消耗情况与团队的强化学习工程积累,是决定能否真正落地在线方案的隐形门槛。
逐项对比
| 对比维度 | 在线强化学习(PPO/GRPO类) | 离线偏好优化(DPO类) |
|---|---|---|
| 定位 | 训练中持续采样并即时反馈更新 | 固定偏好数据集上的监督式训练 |
| 强项 | 探索充分,能超越数据集上限,纠错能力强 | 简单稳定便宜,无采样循环 |
| 弱项 | 训练不稳定,生成慢,陈旧数据管理复杂 | 学不到数据分布外的行为,上限被数据锁死 |
| 典型场景 | 奖励可自动判分,有可验证判据,冲能力上限 | 仅有偏好标注,快速交付 |
| 成本 | 算力消耗大,资源切换频繁,工程积累门槛高 | 算力消耗小,工程实现简单 |
在线强化学习与离线偏好优化的根本差异在于是否包含采样循环。在线方法在训练中持续用当前策略生成新数据并接受即时反馈更新。这种机制就像让模型在试错中自行探路,能充分探索并找到数据分布外的解法,从而持续超越数据集上限。代价是 rollout 工程极重,生成过程缓慢且资源切换复杂,陈旧数据管理非常困难,训练容易陷入不稳定。
离线偏好优化将对齐转化为固定偏好数据集上的监督式训练。剥离了在线生成环节后,方案变得简单稳定便宜,完全规避了复杂的采样循环。但因为没有在线纠错机制,模型学不到数据分布外的行为,能力上限被静态数据质量直接锁死。
工程实践中常采用混合形态。通常先用离线对齐打好基础,再用在线强化学习精修。或者采用拒绝采样的折中路径,即通过在线生成大量数据,经过离线筛选后再进行训练,以此平衡探索收益与工程开销。
面试怎么答
遇到选型题,先向面试官确认具体业务场景的条件,询问任务是否有客观可验证的判据以及当前的算力储备情况。确认这些前置条件后,再按条件给出对应方案:若有自动判分且需冲刺能力上限则答在线强化学习,若只有偏好标注且需快速交付则答离线偏好优化,最后补充两者的混合形态作为进阶理解。
常见的错误答法是脱离工程现实盲目推崇在线方案。面试中常被追问异步 rollout 的旧数据为什么不能直接当 on-policy 用,此时必须指出重要性权重偏差会导致更新出现错误,以此证明你真正了解背后的工程细节。