五厂面经真题集华为面经高频数据清洗数据质量训练数据速答 · 约 5 分钟更新 2026-09-29

项目里的数据怎么处理的?讲讲数据清洗流程。

一句话结论

我会按去重、去噪、去毒、难度分层、领域均衡处理数据,通常砍掉三到五成原始数据,坚持质量优先于数量。

先这样答

我会按去重、去噪、去毒、难度分层、领域均衡的顺序处理数据。清洗通常会砍掉原始数据的三到五成。我的原则是质量优先于数量。

第一步是去重。先用精确 hash 去掉完全相同的数据。再用 minhash 或 embedding 聚类识别内容相近的数据。这样可以同时处理完全重复和近似重复的样本。

第二步是去噪。先处理格式乱码,再过滤低质量内容。低质过滤结合规则和裁判模型打分。规则负责明确的格式问题,裁判模型用于判断内容质量。

第三步是去毒,识别并处理有害内容。之后做难度分层,把数据分成易、中、难,并控制三类数据的配比。最后做领域均衡,避免数据集中在少数领域。整个流程不是追求保留更多原始数据,而是优先保留更适合使用的数据。

面试官会怎么追问

  • 「为什么去重还要做 minhash 或 embedding 聚类?」 精确 hash 只能识别完全相同的数据。minhash 或 embedding 聚类可以识别内容相近的数据。两种方法结合,才能覆盖精确重复和近似重复。

  • 「低质量数据具体怎么过滤?」 我会先检查格式乱码等明确问题。然后结合规则和裁判模型打分过滤低质内容。规则处理固定模式,裁判模型补充对内容质量的判断。

  • 「为什么清洗要砍掉三到五成数据?」 清洗的目标不是尽量保留原始数据,而是优先保留质量更高的数据。去重、去噪、去毒后,还要满足难度配比和领域均衡。数据量减少时,我会坚持质量优先于数量。

回答的坑

  • 不要只说“去重、去噪”,要说清楚精确 hash、minhash 或 embedding 聚类,以及规则和裁判模型打分。
  • 不要把清洗说成只删除数据,还要补上有害内容识别、难度分层和领域均衡。
—— 本题完 ——