先这样答
蒸馏是让小模型向大模型学习输出行为,把老师的能力压进一个更小、更便宜的学生模型。经典做法用老师模型的概率分布当软标签;放到大模型语境,更常见的形态是:用强模型生成高质量问答数据,再用这些数据微调小模型,让学生模仿老师的表达方式和推理步骤。共同点是:学生不是对人工答案学习,而是对老师的行为学习。
为什么有效:强模型的完整回答本身就是高信息量的教材,不只给结论,还给了推理路径、格式和详略的分寸,这些是人工标注很难批量给全的。小模型参数少、推理快、成本低,学会老师的路数之后,就能在成本敏感、响应要求高的场景里顶上。
怎么做才有效,卡三处:老师的输出要过滤,错答和幻觉不能进训练集;数据要贴着目标任务的真实分布收,不能只挑简单样本;学生容量要够,任务需要长推理链时学生太小就学不动。一句总结:蒸馏是用老师的输出换学生的成本,质量关卡在数据上。
面试官会怎么追问
- 「学生能达到老师的水平吗?」 整体达不到,能力有折损;但把范围收窄到具体任务,学生可以接近甚至比通用大模型更稳,因为任务窄、数据集中。这是一笔「通用换专精」的交易,预期要摆对。
- 「为什么不直接用人工标注?」 规模和一致性:老师生成数据快、风格统一、能带完整推理步骤,人工标注贵且标准容易漂。常见组合是老师生成、人工审核,两头的好处都拿到。
- 「蒸馏有什么风险?」 老师的错误和偏见会被学生原样学走;学生模型在任务边界外更容易一本正经地错,缺乏自知。所以数据审核和学生模型的边界评测都不能省。
回答的坑
- 把「生成数据再微调」和经典蒸馏算法混为一谈。两者机制不同,面试时先说清自己指的是哪一种再展开,比混着讲可信得多。
- 只讲「大教小」不谈数据质量。蒸馏的上限由老师数据的质量决定,不提过滤和审核环节,基本可以判断没有实际跑过。
同系列的题
—— 本题完 ——