Q4推理与部署对比选型AgentAlpha 社区约 6 分钟更新 2026-09-29

量化 vs 蒸馏:模型压缩两条路怎么选

量化同架构压数值、蒸馏换架构压参数。这篇给两条压缩路线的对比表与组合用法。

面试官原题

压显存和教小模型,什么时候用哪个?

面试官 · Agent 岗面试现场

先给结论

如果需要快速降低推理成本且保留模型的通用能力,首选量化。量化是直接在原有模型上降低权重位宽,能够在无训练成本的前提下,按比例减少显存占用与内存带宽需求。量化的实现极快,但对具体任务的精度有损风险需要实测评估。 如果应用场景十分确定,且对单次调用的成本有严格限制,例如端侧部署或高频调用,应选择蒸馏。蒸馏通过大模型生成数据微调小模型,能从结构上降低推理开销,并针对特定数据分布进行优化,但代价是训练成本十分高昂。

逐项对比

对比维度量化蒸馏
定位保留原模型架构,压缩数值位宽替换原模型架构,训练独立小模型
强项实现快,即插即用,保留通用能力推理成本结构性下降,特定分布表现好
弱项存在精度有损风险,低位宽较明显训练成本高,通用能力受限于小模型容量
典型场景快速降本,通用大模型部署端侧部署,高频调用的固定任务场景
成本无训练成本,仅需测试评估需要较高的数据生成与模型训练成本

两者的本质差异在压缩对象。量化不改动模型架构,只把权重从高精度数值换成低位宽数值(INT8、INT4、FP8),训练后量化即插即用,回滚容易。蒸馏则训练出一个更小的新模型:用大模型生成训练数据,或让小模型对齐大模型的输出分布,训练一次定型,能力上限受小模型容量限制。

在实际业务部署中,量化和蒸馏经常被组合使用或者并行评估。一种常见的组合做法是,先通过蒸馏训练出一个参数量较小的模型,再对这个小模型进行量化,从而满足更加苛刻的硬件限制。另一种策略是两条路线并行,一边测试量化大模型的成本与效果,另一边尝试蒸馏小模型,对比两者在特定任务上的投入产出比。

此外,投机解码技术在推理时的小模型初步生成加大模型验证机制,其实也是借用了蒸馏思路的推理时变体。

面试怎么答

面试遇到这类问题,建议先确认具体的业务约束,再给出技术选型。可以先问当前场景的瓶颈是显存不够、推理太慢,还是缺乏训练算力。明确前提后,如果算力有限且需要快速上线,回答首选量化;如果是长期的固定场景且有充足算力资源,回答选择蒸馏。

常见的错误答法是脱离场景直接比较绝对优劣,或者把两者视为互斥关系。不要单方面强调量化会掉精度,也不要忽略蒸馏的高昂训练成本。主动提及先蒸馏后量化的方案能让回答更加完整。

—— 本场面试完 ——

我们不做玩具级 Demo 教学。训练营的作业是开源项目和论文——我们想陪伴你,做出能改变生活、最后改变世界的项目。