是什么
模型量化的对象主要包括权重、KV Cache 和激活。权重量化最常见,直接降低存储和带宽需求;KV Cache 量化针对长上下文场景中占大头的显存消耗;激活量化受限于异常值问题,难度较高。
量化方法分为训练后量化与量化感知训练。训练后量化中,GPTQ 通过逐层最小化重构误差实现,AWQ 根据激活分布保护重要通道。低位宽常配合分组缩放使用。
INT8 权重量化损失通常很小。INT4 会有可感知损失,影响模型能力与长任务稳定性,需按任务实测。部署时常采用混合精度策略,保留敏感层的高精度作为折中。
解决什么问题
大模型推理的瓶颈在于显存容量与内存带宽,未经压缩的模型在并发请求增加时受制于带宽而导致速度下降。量化通过降低数据位宽,减少了显存空间和数据搬运量,让同等硬件能运行更大参数规模的模型,并维持更高的并发。
面试怎么考
面试常考 INT4 或 INT8 是否损伤效果,应回答 INT8 损失较小,INT4 存在能力折损,需结合任务评估或采用混合精度。
针对 KV Cache 是否能量化,需指出其在长上下文推理中的必要性。遇到量化方法如何选择,需对比 GPTQ 和 AWQ 的原理差异。此外,边缘设备部署也是常见考法,需结合量化给出整体方案。
又称:量化 · Quantization · INT8 · INT4 · GPTQ · AWQ
接着做点什么
—— 本条完 ——