推理与部署推理优化显存速答 · 约 5 分钟更新 2026-09-19

部署一个 7B、70B 模型要多少显存?怎么估算

一句话结论

记住一个加法:权重等于参数量乘每参数字节数,加 KV Cache(随上下文和并发涨),加运行时开销,最后乘一点二到一点五的余量,就是你要准备的显存。

先这样答

估显存不用背表格,用一个加法就够:模型权重,加 KV Cache,加运行时开销,整体再乘一个安全余量。第一块最好算,权重显存等于参数量乘每个参数占的字节数。FP16 和 BF16 每参数两字节,INT8 一字节,INT4 半字节。所以 7B 模型 FP16 权重约 14 GB,INT4 压到 4 GB 上下,量级就是这么定的。

第二块 KV Cache 用前面的算法:键值头总维度、层数、上下文长度、并发数连乘,再乘精度字节,并发一多,它涨得比权重快。第三块是运行时开销:激活值、框架内存池、驱动上下文,几个 GB 起步。最后整体乘 1.2 到 1.5 的余量,因为实际请求的长短和并发很难压到估算那么准,调度器总要按偏坏的情况留余地。

套回题目。7B 模型 FP16 权重约 14 GB,加缓存和开销,一张 24 GB 的卡跑小并发没问题;要上量就得控制上下文长度或者直接量化。70B 模型 FP16 权重要 140 GB 上下,单张卡装不下,要么多卡张量并行拼显存,要么量化到 INT4,权重压到 35 GB 上下,一张 48 GB 的卡有机会装下小并发场景。回答时把估算过程讲出来,比背一串数字更可信,因为模型、精度、上下文一变,背的数就作废了。

面试官会怎么追问

  • 「并发上来显存怎么变?」 权重不变,KV Cache 按并发数成倍涨,所以显存吃紧时第一反应应该是砍单请求上下文或降并发,而不是急着换卡。这也是批调度器要给缓存设上限的原因。
  • 「为什么实际占用总比估算高?」 估算用的是平均负载,实际请求长短不一,框架内存池还会预占一块不释放的空间。余量乘 1.2 到 1.5 就是给这些不确定性留的,估出来刚好顶满卡容量反而危险。
  • 「上下文从 4K 涨到 128K 呢?」 权重一分不变,KV Cache 涨三十倍以上,这就是长上下文部署贵的原因,也是 GQA、缓存量化、前缀缓存这些技术在长上下文场景值钱的原因。

回答的坑

  • 背一张「7B 要多少 G」的表,说不出算法。参数量、精度、上下文、并发四个变量一变,表就失效,面试官要的是你会估。
  • 只算权重不算 KV Cache。推理阶段显存的大头常常是缓存不是权重,长上下文场景漏掉这块,估算能差出一个量级。
—— 本题完 ——