先这样答
从数据角度看,大模型主要有六类问题:质量、分布、时效、隐私、偏见和污染。回答时我会按训练前清洗、训练中配比、训练后评测三段展开。
训练前先处理数据质量和隐私。质量问题包括噪声、重复和低质数据。它们会进入语料,影响训练数据本身。还要检查敏感信息,避免敏感信息进入语料。训练数据还可能带有偏见,模型会放大其中的刻板印象,所以清洗时也要识别这类内容。
训练中要关注数据分布。长尾内容覆盖不足,领域数据又可能偏斜,都会让模型的知识分布失衡。配比时要看不同领域和长尾内容是否得到合理覆盖。还要考虑时效问题,因为训练数据里的知识可能过期。训练后通过评测检查偏见、时效和污染等问题。污染指测试集混进训练数据,会让测试结果失真。这样可以分别检查数据进入训练前、训练过程中和训练后的问题。
面试官会怎么追问
-
「训练前清洗具体要看哪些数据问题?」
先看噪声、重复和低质数据,保证语料质量。还要检查是否包含敏感信息,避免隐私进入语料。最后关注数据里的偏见,避免模型放大刻板印象。 -
「训练中为什么要关注数据配比?」
因为数据分布可能存在长尾覆盖不足,也可能存在领域偏斜。配比时要看不同领域和长尾内容是否得到合理覆盖。还要考虑知识时效,避免训练数据里的知识过期。 -
「测试集污染会带来什么问题?」
先检查测试集是否混进训练数据。测试集一旦进入训练数据,测试结果就不能直接反映模型的实际表现。因此,训练后评测要把污染作为重点检查项。
回答的坑
- 只罗列六类数据问题,不按训练前清洗、训练中配比、训练后评测来组织答案。
- 把测试集污染当成模型能力变强,忽略它会让测试结果失真。
同系列的题
—— 本题完 ——