先这样答
构造金融风控 SFT 数据,我会从真实难例中挖掘样本,按拒绝原因分层采样,训练和评测再按时间、客户维度切分,避免信息泄漏。难例不能只靠随机抽样。重点看拒贷申诉、审批改判、边界额度这类真实案例。它们更容易暴露模型对决策依据的理解问题。
采样时,我先按拒绝原因分层,再从各层选择案例。人工标注时,不只标最终结果,还要标清决策依据。这样能让样本覆盖不同拒绝原因,也能检查模型是否根据正确依据作答。评测集的客户不能出现在训练集中。训练数据也不能混入未来才能知道的标签或信息。
金融数据处理要先脱敏,再进入标注和训练流程。标注结果需要双人复核,减少单人理解偏差。每个样本都要保留来源和处理记录,保证后续可以追溯。最后,我会分别检查时间切分、客户切分和标签信息,确认评测结果反映泛化能力,而不是记住客户或未来信息。
面试官会怎么追问
-
「你会怎么判断一个样本是不是难例?」
我会优先看拒贷申诉、审批改判和边界额度案例。它们通常包含决策结果和依据之间的冲突,能检验模型是否真正理解风控判断。样本还要按拒绝原因分层,避免难例只集中在少数原因上。 -
「为什么训练集和评测集要同时按时间、客户维度切分?」
按时间切分,可以避免训练数据使用评测时点之后的信息。按客户切分,可以避免同一客户的信息同时出现在训练集和评测集。评测集客户不能出现在训练集,否则结果可能反映记忆,而不是泛化。 -
「金融风控数据的标注质量怎么保证?」
我会先做脱敏,再由人工标注决策依据和最终结果。标注结果需要双人复核,发现分歧后回看案例和依据。样本还要保留来源与处理记录,保证后续能够追溯。
回答的坑
- 只说随机抽样和扩大数据量,却没有说明如何覆盖拒贷申诉、审批改判和边界额度难例。
- 只按时间切分,却忽略客户维度和未来标签,仍可能让评测结果被泄漏污染。
同系列的题
—— 本题完 ——