是什么
DPO的起点是RLHF的目标函数。由于最优策略与奖励函数存在闭式对应关系,它将奖励模型与强化学习阶段改写为直接在策略模型上的偏好损失。具体通过比较被采纳与被拒绝回答相对参考模型的对数概率差,拉开差距实现优化。
训练形态上,该方法只需偏好对数据集和参考模型,采用监督学习方式训练。无生成采样循环,无独立奖励模型,对显存和稳定性友好。
局限在于依赖离线数据,分布外泛化与在线探索弱于在线强化学习方法。训练中被采纳与被拒绝回答概率同降的病态现象,通常与数据质量有关。
解决什么问题
传统RLHF流程长,包含训练奖励模型和强化学习两阶段,且强化学习训练脆弱、调试困难。
DPO解决了流程复杂与训练不稳定的问题。它将偏好对齐压缩成一个稳定的监督训练任务,去除了强化学习阶段,使对齐过程更易执行。
面试怎么考
常考DPO与PPO的区别及优缺点。答题需指出DPO是离线方法,训练稳定省显存;PPO是在线方法,泛化与探索更强。
另一考点是为何团队改用DPO,可从工程难度和稳定性作答。此外,针对训练中被采纳与被拒绝概率同时下降的原因,答题要点应指向数据质量问题。
又称:DPO · Direct Preference Optimization · 直接偏好优化
接着做点什么
—— 本条完 ——