是什么
知识蒸馏依赖软硬两种训练信号。硬标签是响应级别的信号,直接将教师模型生成的数据作为训练集;软标签是词元级别的信号,要求学生模型匹配教师的概率分布。在大语言模型场景中,主流做法是合成数据蒸馏——由教师生成大量高质量问答或推理轨迹,学生模型在此基础上进行监督微调。
蒸馏与量化在模型压缩中分工不同且可叠加。蒸馏通过改变架构获得小模型,是一次性操作且能力上限受损;量化保持架构不变压缩数值,支持即插即用与回滚。此外,投机解码的草稿模型通常也是通过蒸馏得到的特殊形态。
解决什么问题
在计算资源受限或对推理延迟要求严格的场景中,直接部署大模型成本过高。部署小模型的前提是拥有一个具备较强能力的小模型,知识蒸馏是获得它的标准路径。
它将大模型蕴含的逻辑能力与知识转移到小参数架构中,弥补从零训练小模型收敛困难的缺陷,解决推理成本与模型能力的平衡问题。
面试怎么考
面试常考软硬标签的差异,需指出软标签对齐分布而硬标签对齐生成结果。关于蒸馏数据构造,重点说明利用教师模型生成高质量问答与推理轨迹的过程。
遇到蒸馏与量化的选型对比,需明确蒸馏换架构而量化压数值的区别。投机解码与蒸馏的关系也是常见考点,应点明投机解码的草稿模型常通过蒸馏大模型获得,以保证分布一致性。
又称:蒸馏 · Knowledge Distillation · 蒸馏模型
考这个术语的题
接着做点什么
—— 本条完 ——