训练与微调DPO对齐更新 2026-09-28

DPODirect Preference Optimization

一句话定义

DPO是一种跳过奖励模型与强化学习采样循环的偏好对齐方法。它直接用偏好对计算偏好损失来优化策略模型,训练稳定,但依赖离线数据且探索较弱,效果受制于数据质量。

是什么

DPO的起点是RLHF的目标函数。由于最优策略与奖励函数存在闭式对应关系,它将奖励模型与强化学习阶段改写为直接在策略模型上的偏好损失。具体通过比较被采纳与被拒绝回答相对参考模型的对数概率差,拉开差距实现优化。

训练形态上,该方法只需偏好对数据集和参考模型,采用监督学习方式训练。无生成采样循环,无独立奖励模型,对显存和稳定性友好。

局限在于依赖离线数据,分布外泛化与在线探索弱于在线强化学习方法。训练中被采纳与被拒绝回答概率同降的病态现象,通常与数据质量有关。

解决什么问题

传统RLHF流程长,包含训练奖励模型和强化学习两阶段,且强化学习训练脆弱、调试困难。

DPO解决了流程复杂与训练不稳定的问题。它将偏好对齐压缩成一个稳定的监督训练任务,去除了强化学习阶段,使对齐过程更易执行。

面试怎么考

常考DPO与PPO的区别及优缺点。答题需指出DPO是离线方法,训练稳定省显存;PPO是在线方法,泛化与探索更强。

另一考点是为何团队改用DPO,可从工程难度和稳定性作答。此外,针对训练中被采纳与被拒绝概率同时下降的原因,答题要点应指向数据质量问题。

又称:DPO · Direct Preference Optimization · 直接偏好优化

相关术语

—— 本条完 ——