五厂面经真题集快手面经高频合成数据数据质量Agent面试速答 · 约 5 分钟更新 2026-09-29

合成数据的优缺点是什么?怎么控制质量?

一句话结论

合成数据能低成本扩大标注规模,控制数据分布并覆盖长尾,但要防止分布偏移、质量不稳和自采自训带来的误差累积,需结合人工抽检、自动过滤与多样性控制。

先这样答

合成数据的核心价值,是低成本获得大量标注,同时控制数据分布并覆盖长尾场景。它可以补充真实数据难以覆盖的部分,也方便围绕目标分布生成数据。

它的风险主要有三类。第一是分布偏移,生成数据的分布可能和真实任务不一致。第二是质量不可控,数据中可能混入错误内容。第三是 model collapse 风险。模型用自己采集的数据继续训练时,错误可能不断累积。

质量控制要同时做生成前和生成后的控制。生成时要控制多样性,避免数据过于集中,减少单一模式重复出现。生成后可以采用人工抽检加自动过滤。人工抽检用于确认整体质量和问题类型。自动过滤可以结合规则和裁判模型,筛掉明显错误或不符合要求的数据。最后还要关注数据分布,检查合成数据是否偏离目标任务。这样才能在扩大数据规模的同时,控制数据质量和训练风险。

面试官会怎么追问

  • 「为什么合成数据能覆盖长尾场景?」 合成数据可以围绕指定分布生成。工程上可以针对较少出现的场景补充数据。这样能减少真实数据中长尾样本不足带来的限制。

  • 「你会怎么设计合成数据的质控流程?」 我会先在生成时控制多样性,再对结果做人工抽检和自动过滤。自动过滤使用规则加裁判模型,人工抽检用来发现过滤规则和裁判模型没有覆盖的问题。之后再检查数据分布是否偏移。

  • 「怎么理解自采自训带来的 model collapse 风险?」 如果模型用自己采集的数据继续训练,数据中的错误可能被重复学习。错误不断累积后,训练数据和目标分布都会受到影响。控制方法包括提高生成多样性,并用人工抽检、规则和裁判模型过滤问题数据。

回答的坑

  • 只讲合成数据便宜、规模大,却不提分布偏移、质量不可控和 model collapse 风险。

  • 只说用模型自动评估质量,却没有说明人工抽检、规则过滤和多样性控制。

这家公司的面经实录

—— 本题完 ——