五厂面经真题集百度面经高频数据工程RLHFSFT速答 · 约 6 分钟更新 2026-09-28

SFT 数据和 RLHF 对齐数据,在筛选标准和用途上有什么核心区别?

一句话结论

SFT 数据教模型学会做任务,核心是筛选正确且多样的示范数据;RLHF 数据教模型按人类偏好做得更好,核心是筛选具有真实优劣对比和高标注一致性的偏好对。前者决定能力上限,后者决定行为对齐。

先这样答

用途差异决定了筛选标准的差异。SFT 的核心用途是教模型学会做任务,掌握特定模式与格式,因此数据必须是包含输入输出对的正确示范,输出质量直接决定了模型能力的上限。RLHF 的核心用途是教模型在会做的基础上做得更好,按人类偏好进行排序,因此数据的核心是同提示词下的优劣对比信号。

在筛选标准上,SFT 数据重点考察正确性、覆盖面和多样性。正确性要求答案准确、格式合规,如果是工具调用任务则要求轨迹切实可执行。覆盖面和多样性要求数据包含不同任务类型与难度梯度,并做好去重与去噪,防止模型坍缩到少数固定的模板。在量级上,SFT 数据宁少而精,脏示范会直接教坏模型。

RLHF 数据的筛选标准聚焦于可比性、标注一致性以及对失败模式的覆盖。可比性要求同一个提示词下的两个输出必须存在真实的优劣差距,差距太小会让模型学不到有效的偏好边界。由于偏好标注主观性强,必须通过多人标注并取一致子集来保证标注一致性。此外,偏好数据必须包含模型真实会犯的错误类型,这样才能教会它在生成时避开实际陷阱。同时,奖励模型的训练集与验证集需要严格分离。

总结来说,SFT 数据是在筛选对不对,数据污染会导致模型学错;偏好数据是在筛选好不好以及可比不可比,数据污染会导致模型学偏。

面试官会怎么追问

  • 「RLHF 阶段如果不用人工偏好数据,有什么替代方案?」 可以使用基于规则或可验证判据生成奖励的方法,采用类似 GRPO 的思路。这种方式不依赖人工标注的偏好数据,而是将数据构建问题转化为了判据设计问题,适用于数学推理或代码生成等答案对错客观可验证的场景。
  • 「SFT 数据如果出现格式错误或者脏数据,对模型有什么具体影响?」 脏数据会直接导致模型输出格式错乱或产生事实错误。因为 SFT 是在建立输入和输出的直接映射,模型会记住错误数据中的特定模式,哪怕只有少量脏数据,也可能降低模型在特定任务上的表现。
  • 「构建偏好数据时,为什么一定要覆盖模型真实会犯的错误类型?」 如果偏好数据里的劣势回答是人工生硬编造的,模型在实际推理中可能根本不会生成那样的回答。只有用模型自己生成的失败案例作为负样本,才能让奖励模型学到针对当前策略的准确偏好信号,从而有效引导强化学习阶段避开真实的错误路径。

回答的坑

  • 混淆两种数据的质量要求,认为数据量越大越好。正确的方向是强调 SFT 数据宁缺毋滥,而 RLHF 数据更看重对比对的质量和标注的一致性。
  • 忽略偏好数据的相对性特征,只强调负样本必须是错的。正确的方向是指出偏好数据中的两个样本必须具有真实的优劣差距,且要包含模型真实的失败模式。
—— 本题完 ——