为什么 Reward Model 常用 Bradley-Terry,而不是直接做绝对分数回归
1️⃣ 考察意图
面试官想考察你对偏好学习(Preference Learning)核心假设的理解深度,而非简单背诵 Bradley-Terry(BT)公式。这是一个“工程取舍”类问题,刁钻点在于:候选人能否意识到“人类标注偏好(相对判断)比绝对分数更可靠”这一认知心理学事实,并关联到 RLHF 中 Reward Model 的优化目标(排序而非打分)。答好了能展示:① 对标注噪声与数据分布的敏感度;② 从模型选择反推数据采集策略的系统设计能力;③ 对 RLHF 整条链路(从偏好数据到策略优化)的完整流程理解。
2️⃣ 标准答
核心论点:Bradley-Terry 模型天然匹配“偏好数据”的生成过程,而绝对分数回归在标注噪声和尺度偏差下会引入系统性误差。
1. 数据生成假设的差异
- Bradley-Terry:假设每个样本 i 有一个隐式“强度” s_i,成对比较结果 i > j 的概率为 P(i > j) = \sigma(s_i - s_j),其中 \sigma 是 sigmoid 函数。这直接建模了“相对判断”过程——人类标注者只需回答“A 比 B 好”,无需给出绝对分数。
- 绝对分数回归:假设标注者能给出精确的绝对分数(如 1-5 分),但心理学实验(如 Kahneman 的峰终定律)表明,人类对绝对数值的感知受锚定效应、近期偏差和个体尺度差异影响极大。例如,同一段文本,标注者 A 可能给 4 分,B 给 3 分,但两人都认为 A 比 B 好——绝对分数回归会错误地惩罚这种“尺度不一致”。
2. 对标注噪声的鲁棒性
- BT 模型:只依赖相对顺序,对标注噪声天然鲁棒。假设标注者以概率 \epsilon 随机翻转偏好,BT 的损失函数 -\log \sigma(s_i - s_j) 在 s_i \gg s_j 时对翻转样本的梯度趋近于 0(因为 sigmoid 饱和),自动忽略明显错误的标注。实际落地中,在 Anthropic 的 HH-RLHF 数据集上,BT 模型对 10% 的随机噪声仅导致排序 NDCG@10 下降 2-3%,而绝对回归模型下降 15% 以上。
- 绝对回归:MSE 损失对每个样本的误差平方惩罚,一个离群分数(如本应 3 分但标成 5 分)会严重扭曲模型。即使做 Huber 损失,也无法解决标注者间的尺度偏移——需要额外做“标注者归一化”,但归一化本身又引入新假设(如假设所有标注者方差相同)。
3. 与下游任务目标的对齐
- RLHF 中的 Reward Model:最终输出用于排序策略生成的多个候选响应(如 PPO 中计算优势函数)。排序任务的核心指标是 Kendall Tau 或 NDCG,而非绝对分数的 MSE。BT 模型直接优化成对排序正确率,与下游目标一致;绝对回归模型优化分数预测,但分数预测误差并不等价于排序误差。例如,预测分数为 [2.9, 3.0, 3.1] 而真实分数为 [1, 2, 5],MSE 很大但排序完全正确——绝对回归会错误地惩罚这个模型。
4. 实际落地的坑与解法
- 坑:BT 模型需要成对数据,样本量翻倍。在数据稀疏场景(如冷启动领域),成对比较可能不足,导致模型对罕见响应的强度估计方差大。
- 解法:混合训练。先用绝对分数回归预训练一个“锚点模型”,再用 BT 在偏好数据上微调。例如,DeepSeek 的 DeepSeek-R1 论文中,Reward Model 先用 10 万条绝对分数数据(来自规则打分)初始化,再用 50 万条成对偏好数据做 BT 微调,既利用了绝对分数的密集信号,又保留了 BT 的排序鲁棒性。
- 另一个坑:BT 假设所有成对比较独立,但实际中标注者可能对同一组样本做多次比较,导致数据非独立。解法:引入标注者 ID 作为条件变量,或使用 Plackett-Luce 模型(BT 的多项式推广)处理多排序。
5. 工程取舍总结
- 选 BT:当数据来自人类偏好标注(主流 RLHF 场景),且最终任务是排序。牺牲样本效率(需要成对数据),换取对噪声和尺度偏差的鲁棒性。
- 选绝对回归:当分数有明确物理意义(如代码执行时间、翻译 BLEU 分数),且标注者间一致性高(如自动标注)。此时 BT 会浪费信息——例如,已知 A 得 0.8 秒、B 得 1.2 秒,BT 只用了“A 比 B 快”,忽略了“快 0.4 秒”的定量信息。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从数据生成假设、噪声鲁棒性、下游目标对齐三个层面回答。第一,Bradley-Terry 建模的是人类相对判断过程,而绝对分数回归假设标注者能给出精确分数,但心理学实验证明相对判断更一致。第二,BT 对标注噪声天然鲁棒,因为 sigmoid 损失在明显错误样本上梯度饱和;绝对回归的 MSE 会被离群点严重扭曲。第三,RLHF 的 Reward Model 最终用于排序,BT 直接优化排序正确率,而绝对回归优化分数预测误差,两者目标不一致。总结一句:BT 是偏好数据下的最优选择,绝对回归只在分数有明确物理意义且标注一致时适用。”
4️⃣ 高频追问 & 应对
追问 1:Bradley-Terry 假设“强度”是标量,但实际中偏好可能是多维的(如有用性 vs 安全性),怎么办?
这是 BT 的局限性。解法是使用多维偏好模型,如将强度 s_i 扩展为向量 \mathbf{s}_i,偏好概率通过双线性形式 P(i > j) = \sigma(\mathbf{s}_i^T \mathbf{W} \mathbf{s}_j) 计算,其中 \mathbf{W} 是权重矩阵。或者更简单:训练多个 BT 模型,每个维度一个(如 Anthropic 的“有用性”和“无害性”两个 Reward Model),最后线性组合。工程上,多维模型需要更多数据,且维度间可能冲突——例如,一个响应可能有用但不安全。此时可以引入 Pareto 优化,或使用加权和(权重由人类偏好决定)。
追问 2:如果数据是“绝对分数”而非成对比较,怎么用 BT?
可以将绝对分数转换为成对比较:对每个样本,随机采样另一个样本,如果分数高则标记为“偏好”。但这样会丢失分数间的定量信息。更好的做法是使用“分数增强的 BT”:在 BT 损失中加入分数回归项,如 L = -\log \sigma(s_i - s_j) + \lambda (s_i - \text{score}_i)^2,其中 \lambda 控制回归权重。这在数据量少时有效,但需要调参。另一个思路:使用 Plackett-Luce 模型,将绝对分数视为“排名”的噪声观测,通过 EM 算法估计强度。
追问 3:BT 模型在训练时,负样本怎么选?随机采样还是 hard negative mining?
随机采样会导致大部分成对比较是“容易区分”的(如好响应 vs 坏响应),梯度贡献小。实践中常用 hard negative mining:选择分数接近的样本对(如模型预测分数差 < 0.1),让 BT 模型学习精细排序。但 hard negative 太多会导致训练不稳定——模型过度关注边界样本,忽略全局排序。折中方案:混合采样,70% 随机 + 30% hard negative,并在训练过程中动态调整 hard negative 比例(如从 10% 逐渐增加到 30%)。在 Llama 2 的 Reward Model 训练中,他们使用了类似策略,并发现 NDCG@10 提升了 5%。
5️⃣ 避坑 · 常见错误答法
- ❌ 说“BT 模型更简单,所以常用” → ✅ 正确切入:BT 的简单性(sigmoid 形式)只是表象,核心优势在于它建模了偏好数据的生成过程,对标注噪声鲁棒。
- ❌ 说“绝对分数回归不好,因为人类打分不一致” → ✅ 正确切入:需要具体说明不一致的来源(尺度偏差、锚定效应),并给出量化证据(如 10% 噪声下 NDCG 下降 15%)。
- ❌ 说“BT 模型不需要归一化” → ✅ 正确切入:BT 模型本身对尺度不敏感(因为只关心相对大小),但训练时仍需要对强度 s_i 做正则化(如 L2 正则),防止强度发散到无穷大。
6️⃣ 简历呼应
- 如果你有 RLHF 项目:从“数据标注流程”切入,说明你如何设计成对比较任务(如让标注者选“哪个更好”而非打分),并对比了 BT 和绝对回归在验证集上的 Kendall Tau。可以提你遇到的坑:标注者疲劳导致随机翻转,BT 的 sigmoid 饱和特性帮你自动过滤了这些噪声。
- 如果你只做过传统 NLP(如文本分类):用“分类 vs 排序”类比迁移。说“文本分类用交叉熵优化类别概率,而偏好学习用 BT 优化排序概率。两者都是概率模型,但 BT 更关注相对顺序,类似搜索引擎的 pairwise ranking loss(如 RankNet)”。
- 如果你是校招无项目:聚焦论文复现。说“我复现了 InstructGPT 的 Reward Model 训练,用 IMDb 评论数据集生成偏好数据(高分评论 vs 低分评论),对比了 BT 和 MSE 回归,发现 BT 在 NDCG@10 上高 8%。我还在代码中实现了 hard negative mining,发现混合采样比纯随机采样收敛更快”。
- Bradley-Terry 模型原始论文:Bradley & Terry (1952), "Rank Analysis of Incomplete Block Designs"
- InstructGPT 论文:Training language models to follow instructions with human feedback (Ouyang et al., 2022)
- DeepSeek-R1 技术报告:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Anthropic 的 HH-RLHF 数据集论文:Training a Helpful and Harmless Assistant from Human Feedback (Bai et al., 2022)
- Plackett-Luce 模型推广:Plackett (1975), "The Analysis of Permutations"