训练与微调蒸馏模型压缩更新 2026-09-28

知识蒸馏Knowledge Distillation

一句话定义

知识蒸馏是用大模型的输出或概率分布训练小模型的压缩方法。学生模型学习教师行为而非仅学标签,使推理成本下降,代价是需一次性训练投入且能力受限。

是什么

知识蒸馏依赖软硬两种训练信号。硬标签是响应级别的信号,直接将教师模型生成的数据作为训练集;软标签是词元级别的信号,要求学生模型匹配教师的概率分布。在大语言模型场景中,主流做法是合成数据蒸馏——由教师生成大量高质量问答或推理轨迹,学生模型在此基础上进行监督微调。

蒸馏与量化在模型压缩中分工不同且可叠加。蒸馏通过改变架构获得小模型,是一次性操作且能力上限受损;量化保持架构不变压缩数值,支持即插即用与回滚。此外,投机解码的草稿模型通常也是通过蒸馏得到的特殊形态。

解决什么问题

在计算资源受限或对推理延迟要求严格的场景中,直接部署大模型成本过高。部署小模型的前提是拥有一个具备较强能力的小模型,知识蒸馏是获得它的标准路径。

它将大模型蕴含的逻辑能力与知识转移到小参数架构中,弥补从零训练小模型收敛困难的缺陷,解决推理成本与模型能力的平衡问题。

面试怎么考

面试常考软硬标签的差异,需指出软标签对齐分布而硬标签对齐生成结果。关于蒸馏数据构造,重点说明利用教师模型生成高质量问答与推理轨迹的过程。

遇到蒸馏与量化的选型对比,需明确蒸馏换架构而量化压数值的区别。投机解码与蒸馏的关系也是常见考点,应点明投机解码的草稿模型常通过蒸馏大模型获得,以保证分布一致性。

又称:蒸馏 · Knowledge Distillation · 蒸馏模型

相关术语

—— 本条完 ——