先这样答
DPO 不需要显式奖励模型,因为最优策略与奖励函数存在闭式对应关系。推导的出发点正是这种数学等价性。传统的做法是先训练一个奖励模型,再用强化学习去优化策略。DPO 将偏好概率直接改写成策略的函数。算法把隐式奖励定义为当前策略与参考模型输出概率的对数比。这让算法跳过了训练独立奖励模型的步骤。模型直接使用偏好对数据来优化策略本身。
DPO 的成立依赖两个核心假设。第一是偏好数据覆盖的分布足够广。模型只能在离线数据包含的状态空间内学习对齐。第二是偏好数据必须可靠。标注结果需要真实反映期望的对齐目标。
这种机制带来了三个局限。首先,离线数据限制了模型探索新策略的能力。模型无法在环境中主动试错。其次,算法对偏好对的质量极度敏感。少量错误标注会导致策略严重偏移。最后,算法会放大长度等偏差。如果偏好数据倾向于长文本,模型会迅速学会输出更长的内容。
面试官会怎么追问
-
「DPO 里的隐式奖励具体是怎么计算的?」 隐式奖励是当前策略与参考模型的对数比。算法分别计算当前策略和参考模型生成某个回答的概率。将这两个概率相除后取自然对数,就得到了该回答的隐式奖励值。
-
「为什么 DPO 对偏好对质量极度敏感?」 DPO 直接用偏好数据更新策略参数。算法跳过了奖励模型的平滑作用。错误标注的偏好对会产生错误的梯度方向。模型会直接记住这些错误的偏好倾向。
-
「离线数据不能探索新策略会带来什么具体问题?」 模型只能在给定偏好对的分布内进行优化。它无法生成超出训练数据范围的全新高质量回答。当遇到未见过的输入分布时,策略模型的表现容易退化。
回答的坑
- 解释隐式奖励时混淆了策略模型和参考模型,说反了对数比的分子和分母。
- 遗漏离线数据无法探索新策略这一核心局限,把答案说成了普通监督微调的缺点。
同系列的题
—— 本题完 ——