先这样答
准备流程四步。第一步定任务:模型要做什么、输入长什么样、输出要什么格式,先写一份标注规范,把边界情况约定清楚。第二步收数据:真实业务日志(脱敏)、人工撰写、或强模型生成后人工校对,都可以。第三步清洗:去重、纠错、去敏感信息,格式和风格对齐。第四步切分:留出一部分做验证集,训练时靠它判断有没有过拟合。
数量没有标准答案。任务越窄、格式越固定,需要的条数越少;任务面越宽、要求泛化,对数据量和多样性的要求越高。几千到几万条这个量级常见,但这是经验范围不是定论。比条数更要紧的是质量和覆盖:错误答案教出错误行为,覆盖不足则真实输入一偏模型就露怯。
一句总结:先定规范,再把质量做上去,最后才看数量;验证集从第一天就要保留,它和真实场景的输入分布,比训练集条数更能决定微调成不成功。
面试官会怎么追问
- 「能用大模型生成训练数据吗?」 常见做法,但必须人工抽检:生成数据自带模型的毛病,幻觉和错误会原样进训练集。生成加人工校对、再混入一部分真实数据保持分布,比纯生成可靠得多。
- 「数据多样性指什么?」 同一任务的不同问法、不同难度、不同边界情况都要覆盖。全是同一种模板的数据,模型只会应对那一种问法,用户换个说法就出问题。
- 「怎么发现数据有问题?」 训练损失正常下降、验证集却不见好,多半是训练集有错或分布偏;模型输出莫名带上奇怪的口头禅或错误格式,回头查数据通常能找到源头。
回答的坑
- 一开口就报「要多少条」。顺序反了:先看任务复杂度和数据质量,数量是最后才定的变量,上来就报数字多半说明没亲手做过。
- 忽略输出格式一致。答案风格忽长忽短、格式忽而 JSON 忽而纯文本,模型学到的就是混乱本身,这种数据越多越糟。
同系列的题
—— 本题完 ——