五厂面经真题集腾讯面经高频腾讯真题数据采样数据泄漏速答 · 约 5 分钟更新 2026-09-29

金融风控构造 SFT 数据,怎么覆盖难例并避免数据泄漏?

一句话结论

难例从拒贷申诉、审批改判和边界额度案例中挖掘,按拒绝原因分层采样并标注依据;训练评测按时间和客户切分,先脱敏,再复核并保证样本可追溯。

先这样答

构造金融风控 SFT 数据,我会从真实难例中挖掘样本,按拒绝原因分层采样,训练和评测再按时间、客户维度切分,避免信息泄漏。难例不能只靠随机抽样。重点看拒贷申诉、审批改判、边界额度这类真实案例。它们更容易暴露模型对决策依据的理解问题。

采样时,我先按拒绝原因分层,再从各层选择案例。人工标注时,不只标最终结果,还要标清决策依据。这样能让样本覆盖不同拒绝原因,也能检查模型是否根据正确依据作答。评测集的客户不能出现在训练集中。训练数据也不能混入未来才能知道的标签或信息。

金融数据处理要先脱敏,再进入标注和训练流程。标注结果需要双人复核,减少单人理解偏差。每个样本都要保留来源和处理记录,保证后续可以追溯。最后,我会分别检查时间切分、客户切分和标签信息,确认评测结果反映泛化能力,而不是记住客户或未来信息。

面试官会怎么追问

  • 「你会怎么判断一个样本是不是难例?」
    我会优先看拒贷申诉、审批改判和边界额度案例。它们通常包含决策结果和依据之间的冲突,能检验模型是否真正理解风控判断。样本还要按拒绝原因分层,避免难例只集中在少数原因上。

  • 「为什么训练集和评测集要同时按时间、客户维度切分?」
    按时间切分,可以避免训练数据使用评测时点之后的信息。按客户切分,可以避免同一客户的信息同时出现在训练集和评测集。评测集客户不能出现在训练集,否则结果可能反映记忆,而不是泛化。

  • 「金融风控数据的标注质量怎么保证?」
    我会先做脱敏,再由人工标注决策依据和最终结果。标注结果需要双人复核,发现分歧后回看案例和依据。样本还要保留来源与处理记录,保证后续能够追溯。

回答的坑

  • 只说随机抽样和扩大数据量,却没有说明如何覆盖拒贷申诉、审批改判和边界额度难例。
  • 只按时间切分,却忽略客户维度和未来标签,仍可能让评测结果被泄漏污染。
—— 本题完 ——