先给结论
如果需要快速降低推理成本且保留模型的通用能力,首选量化。量化是直接在原有模型上降低权重位宽,能够在无训练成本的前提下,按比例减少显存占用与内存带宽需求。量化的实现极快,但对具体任务的精度有损风险需要实测评估。 如果应用场景十分确定,且对单次调用的成本有严格限制,例如端侧部署或高频调用,应选择蒸馏。蒸馏通过大模型生成数据微调小模型,能从结构上降低推理开销,并针对特定数据分布进行优化,但代价是训练成本十分高昂。
逐项对比
| 对比维度 | 量化 | 蒸馏 |
|---|---|---|
| 定位 | 保留原模型架构,压缩数值位宽 | 替换原模型架构,训练独立小模型 |
| 强项 | 实现快,即插即用,保留通用能力 | 推理成本结构性下降,特定分布表现好 |
| 弱项 | 存在精度有损风险,低位宽较明显 | 训练成本高,通用能力受限于小模型容量 |
| 典型场景 | 快速降本,通用大模型部署 | 端侧部署,高频调用的固定任务场景 |
| 成本 | 无训练成本,仅需测试评估 | 需要较高的数据生成与模型训练成本 |
两者的本质差异在压缩对象。量化不改动模型架构,只把权重从高精度数值换成低位宽数值(INT8、INT4、FP8),训练后量化即插即用,回滚容易。蒸馏则训练出一个更小的新模型:用大模型生成训练数据,或让小模型对齐大模型的输出分布,训练一次定型,能力上限受小模型容量限制。
在实际业务部署中,量化和蒸馏经常被组合使用或者并行评估。一种常见的组合做法是,先通过蒸馏训练出一个参数量较小的模型,再对这个小模型进行量化,从而满足更加苛刻的硬件限制。另一种策略是两条路线并行,一边测试量化大模型的成本与效果,另一边尝试蒸馏小模型,对比两者在特定任务上的投入产出比。
此外,投机解码技术在推理时的小模型初步生成加大模型验证机制,其实也是借用了蒸馏思路的推理时变体。
面试怎么答
面试遇到这类问题,建议先确认具体的业务约束,再给出技术选型。可以先问当前场景的瓶颈是显存不够、推理太慢,还是缺乏训练算力。明确前提后,如果算力有限且需要快速上线,回答首选量化;如果是长期的固定场景且有充足算力资源,回答选择蒸馏。
常见的错误答法是脱离场景直接比较绝对优劣,或者把两者视为互斥关系。不要单方面强调量化会掉精度,也不要忽略蒸馏的高昂训练成本。主动提及先蒸馏后量化的方案能让回答更加完整。