先给结论
面对大模型推理的 KV Cache 压缩选型,直接根据工程能力与资源约束进行判断。从基线 MHA 结构迁移求稳,选择分组查询注意力 GQA,这是当前主流开源模型的默认配置,在生成质量与显存之间取得平衡。处于显存极限承压场景可试用多查询注意力 MQA,它速度最快且显存最省,但必须评估质量损耗。若团队具备工程能力且追求极致压缩,选择低秩注意力 MLA,其压缩率高于 GQA 且质量保持好。无论选哪种路线,INT8 或 FP8 量化技术均可作为正交方案叠加。
逐项对比
| 对比维度 | MQA | GQA | MLA |
|---|---|---|---|
| 定位 | 所有头共享一组 K/V | 若干头为一组共享 K/V | K/V 投影到低维潜在空间 |
| 强项 | 显存最省,推理速度最快 | 质量接近 MHA,显存下降明显 | 压缩率高于 GQA,质量保持好 |
| 弱项 | 质量损失相对明显 | 压缩率不及极限方案 | 实现复杂,工程门槛高 |
| 典型场景 | 早期追求极致推理的模型 | 当前主流开源模型的默认选择 | 追求极致压缩且有工程能力的场景 |
| 成本 | 低 | 中等 | 高(需处理权重吸收与潜在表示) |
基线 MHA 为每个注意力头保留独立的 K/V 缓存,质量最好但显存开销最大。MQA 和 GQA 采用共享机制降低开销。MQA 让所有头共享一组 K/V,显存最省且速度最快,但质量损失相对明显,多见于早期追求极致推理的模型。GQA 通过分组共享 K/V 作为两者的折中,在降低显存的同时将质量维持在接近 MHA 的水平,成为当前主流选择。
MLA 转向低秩压缩路线,不再单纯依靠减少组数,而是将 K/V 投影到低维潜在空间进行存储,用时配合矩阵吸收技巧解压。该机制使 MLA 获得比 GQA 更高的压缩率并保持良好质量。但其工程门槛高,需要处理复杂的权重吸收逻辑,且实际缓存的是潜在表示,增加了底层实现的难度。
架构层面的选型与数据维度的压缩是正交的。无论选用哪种注意力变体,在部署时都可以叠加 INT8 或 FP8 的 KV Cache 量化技术。这种组合用法能够在既定架构下,利用较低精度的数据格式进一步压榨显存空间,获取额外的推理收益。
面试怎么答
面试遇此类选型题,不要直接抛出单一方案,先向面试官确认当前的约束条件:是处于从 MHA 迁移的求稳阶段,面临显存极限压力,还是团队具备改造底层算子的工程能力。
明确前提后按框架作答:常规业务求稳选 GQA,极限环境试探 MQA,有技术深度追求极致压缩选 MLA,最后补充量化技术可与上述方案正交叠加。常见错误答法是脱离工程成本空谈 MLA 的压缩率,或认为选择了 MQA 就不必再做数据量化,没有真正理解架构变体与数据维度的量化之间的正交关系。