五厂面经真题集蚂蚁集团面经高频SFT数据配比大模型面试速答 · 约 5 分钟更新 2026-09-29

SFT 的数据是越大越好吗?有 Scaling Law 吗?

一句话结论

不是。SFT 更看重数据质量和多样性。低质数据继续增加可能收益归零,甚至带来模板过拟合。SFT 没有预训练式的大规模 Scaling Law。

先这样答

不是。SFT 的数据不是越大越好。数据质量和多样性比数量更重要。低质量数据增加到一定量后,收益会归零,甚至变负。模型可能过拟合数据里的固定模板,回答看起来统一,却不一定更好。

从经验上看,千级高质量指令数据已经能带来明显的对齐效果。数据增加到万级、十万级后,如果仍然精挑细选,通常还能继续带来收益,但边际会逐渐递减。这里的关键不是单纯扩充条数,而是补充新的任务类型、表达方式和有效监督信号。

SFT 阶段没有预训练那种大规模的 Scaling Law。面试里不能直接套用预训练的结论,用数据量硬堆。更合理的做法是先保证样本质量,再检查数据是否覆盖目标能力,最后观察新增数据是否还带来实际收益。

面试官会怎么追问

  • 「为什么低质量数据会让收益变负?」 低质量数据会把错误表达或固定模板重复教给模型。数据积累到一定量后,模型可能更依赖这些模板,泛化表现反而变差。此时继续增加同类数据不能解决问题。

  • 「万级和十万级数据还有没有价值?」 有价值,但不能只看数量。精挑的数据可以覆盖更多任务和表达方式,继续带来收益。随着规模扩大,新增数据的边际收益会递减,所以要评估新增样本的质量和差异。

  • 「既然没有 Scaling Law,SFT 应该怎么扩数据?」 先筛选高质量指令,再补足任务和表达的多样性。每次增加数据后,都要观察实际对齐效果。不能把数据条数本身当成效果保证。

回答的坑

  • 把预训练阶段的大规模 Scaling Law 直接套到 SFT 上,用数量替代数据质量。
  • 只说“数据越多越好”,忽略低质量重复数据可能造成模板过拟合。
—— 本题完 ——