训练与微调合成数据数据工程更新 2026-09-28

合成数据Synthetic Data

一句话定义

合成数据是用强模型生成训练数据的方法,涵盖指令种子扩展、自我问答与轨迹模拟。它解决了人工标注成本高与数据稀缺的问题,但存在自我循环放大偏差的风险,必须配合严格的过滤。

是什么

合成数据的生成方式包括基于种子指令扩展的Self-Instruct、强模型回答弱模型问题的蒸馏式生成、Agent任务成功轨迹的伪造与重放,以及难度分层采样。其用途涵盖SFT冷启动、构建工具调用轨迹和生成RL可验证任务实例。

为保证质量,管线需设置多道闸门:通过规则过滤格式和长度,由模型对质量、难度和多样性进行评分,最后进行语义级去重并完成配比与课程化。

使用合成数据的主要风险是同源数据自我循环会导致模式坍缩与偏见放大,且污染评测集会让指标虚高。实际应用中必须混入真实数据并设置人工抽检作为锚定。

解决什么问题

模型能力的竞争逐渐后移到数据层面,获取高质量真实数据的成本急剧上升。合成数据解决了人工标注昂贵与特定垂直领域数据稀缺的问题。在当前技术条件下,它是实现数据规模化的唯一可行路径,弥补了模型训练对海量多样化数据的需求缺口,因此也成为面试的考察热点。

面试怎么考

面试常考合成管线的搭建方式,答题时需按生成、过滤、评分、去重的顺序说明数据流转过程。

考察如何防止质量坍缩时,要点在于强调真实数据的混入比例控制与人工抽检机制。

考察合成数据与蒸馏的关系时,需指出两者在强弱模型依赖上的相似性及应用目标的差异。

针对评测集为什么必须隔离的考问,答题要点是说明同源数据泄露会导致评测指标虚高,无法真实反映模型的泛化能力。

又称:合成数据 · Synthetic Data · 数据合成 · Self-Instruct

—— 本条完 ——