LLM 基础概念模型架构显存估算算力评估速答 · 约 6 分钟更新 2026-09-28

7B 模型的 7B 是怎么算出来的?给你一个架构怎么估参数量?

一句话结论

估算参数量主要看 Transformer 层的数量和隐藏层维度。核心口诀是每层参数约为 12 倍维度的平方,加上词表嵌入和输出头参数,代入 32 层和 4096 维度即可推导出 7B 量级。

先这样答

估算模型参数量可以拆分为三个部分:词表嵌入层、Transformer 堆叠层和输出头。其中绝对的大头在 Transformer 层。只要记住隐藏层维度 d 这个核心变量,就能快速完成整体规模的估算。

具体到每一个 Transformer 层,参数主要由注意力和前馈神经网络构成。在注意力机制中,查询、键、值以及输出投影(Q、K、V、O)通常各自对应一个 d 乘 d 的权重矩阵,这部分加起来是 4 倍的 d 平方。在前馈神经网络部分,如果采用主流的 SwiGLU 激活函数,会包含三个权重矩阵,中间维度 h 通常是 d 的三分之八左右。将这三个矩阵的参数量相加,大约是 8 倍的 d 平方。把注意力和前馈网络合并,每一个 Transformer 层的参数量大约是 12 倍的 d 平方。

拿到一个具体的架构,比如经典的 7B 模型配置,通常包含 32 个 Transformer 层,隐藏层维度 d 为 4096。每层的参数量代入 12 乘 4096 的平方,单层大约是两亿。乘以 32 层后,主体参数量在 64 亿左右。再加上词表大小乘以维度 d 得到的嵌入层参数,以及末端的输出头参数,整体规模正好落在 70 亿左右,也就是我们常说的 7B。

掌握这个估算方法,主要是为了在实际工程中快速建立显存和算力的直觉。向面试官展示推导过程,能够证明你具备评估底层硬件消耗的基础能力。

面试官会怎么追问

  • 「算出了 7B 参数,那推理和训练分别需要多大显存?」 推理时如果采用 fp16 半精度数据格式,每个参数占用 2 个字节,7B 模型的基础权重占用约 14GB 显存。训练时的消耗要大得多,通常每个参数需要约 16 个字节来存储权重、梯度和优化器状态,7B 模型的基础训练显存需求在 112GB 量级。

  • 「知道参数量后,怎么估算前向传播的计算量?」 每个 token 在前向传播时的计算量(FLOPs)大约是模型参数量的 2 倍。这是因为每个参数在矩阵乘法中都会参与一次乘法和一次加法运算。对于 7B 模型,生成一个 token 的前向计算量大约是 140 亿次浮点运算。

  • 「除了 Transformer 层,词表嵌入和输出头的参数量怎么算?」 这两部分的参数量计算方式都是词表大小乘以隐藏层维度 d。在 7B 模型中,如果词表大小在几万到十万的量级,这两部分加起来通常占几亿的参数量。它们虽然不是参数大头,但在完整估算时是补齐 7B 规模的最后一部分。

回答的坑

  • 误以为注意力机制的参数量比前馈神经网络大,正确的直觉是在主流 SwiGLU 结构下前馈网络的参数量大约是注意力机制的两倍。
  • 估算时死记硬背最终的参数总数,正确的做法是向面试官展示通过隐藏层维度和层数推导「每层 12 倍 d 平方」的过程。
—— 本题完 ——