五厂面经真题集美团面经高频SFT数据难例覆盖数据泄漏速答 · 约 5 分钟更新 2026-09-29

为骑手助手构造 SFT 数据,怎么覆盖难例并避免数据泄漏?

一句话结论

先做脱敏,再从高频申诉、改判 case 和边界场景挖难例,分层采样并标注依据,按时间和骑手切分数据。

先这样答

结论是:先做脱敏,再从真实业务中的申诉、改判和边界场景挖难例,分层采样并标注决策依据。训练集和评测集要按时间与骑手维度切分,评测集骑手不能进入训练集。标签只能使用当时可见的信息。

难例不能只靠随机抽样。可以先看骑手高频申诉,收集模型或人工处理后发生改判的 case,再补充恶劣天气超时免责这类边界场景。然后按问题类型分层采样,让不同类型的问题都进入数据。每条样本都要让人工写清楚当时为什么这样判断,避免只留下结论。

防泄漏要先定切分规则,再生成训练和评测数据。时间切分可以避免把后发生的信息带回过去。骑手维度切分可以避免同一骑手的表达习惯和历史问题同时出现在两边。还要检查标签和输入,只保留当时能看到的内容。正式处理样本前先脱敏,避免身份等信息进入数据。

面试官会怎么追问

  • 「为什么要专门看改判 case?」 改判 case 说明原来的判断和后续结果之间存在差异。它能暴露模型容易判断错的情况。人工需要补上正确决策依据,不能只把最终结果当标签。

  • 「恶劣天气超时免责这种场景,应该怎么做?」 把它作为边界场景单独挖样本。样本要保留当时可见的信息,并标注当时采用免责判断的依据。不能用事后才出现的信息修改当时的标签。

  • 「只按时间切分,为什么还要按骑手切分?」 同一骑手可能在不同样本中重复出现。即使时间不同,模型也可能借到这个骑手的表达习惯或历史信息。评测集骑手不进训练集,才能减少这种泄漏。

回答的坑

  • 只说增加数据量,不说明从申诉、改判和边界场景覆盖难例,也不说明按问题类型分层采样。
  • 只按随机比例切训练集和评测集,忽略时间、骑手维度、当时可见信息和脱敏要求。
—— 本题完 ——