五厂面经真题集小红书面经高频小红书真题大模型面试模型规模速答 · 约 5 分钟更新 2026-09-29

大模型参数量为什么是 7B、13B 这些特殊数字?

一句话结论

7B、13B、70B不是数学规定的固定档位,而是由hidden size、层数、头数等超参组合形成,并受GPU并行、Scaling Law、工程与算力约束共同影响的常见规模。

先这样答

大模型参数量出现 7B、13B 这类数字,主要由模型超参数组合决定,不是人为规定的特殊常数。hidden size、层数、头数等设置会一起决定参数总量。它们常取 2 的幂或其倍数,方便 GPU 做矩阵分块和并行计算。参数规模因此常落在一些相近但不规则的档位上。

Scaling Law 会在给定算力预算下,指导模型选择更合适的规模和配置。工程团队还要同时考虑硬件并行方式与可用算力。7B、13B、70B 这样的跳档,就是这些约束共同形成的经验结果。它们不是数学上的必然序列。换一个 hidden size、层数或头数,参数量就可能落到另一个数值。

面试官会怎么追问

  • 「7B 和 13B 是人为规定的标准档位吗?」 不是。参数量由 hidden size、层数、头数等超参数组合得到。7B 到 13B 的跳档,是工程与算力约束共同形成的经验结果。

  • 「为什么 hidden size 和其他超参常取 2 的幂或倍数?」 这类取值有利于 GPU 并行。矩阵分块更容易对齐,计算过程也更适合硬件执行。它首先是工程选择,不是参数量必须满足的数学规律。

  • 「Scaling Law 在选择模型规模时起什么作用?」 Scaling Law 会结合给定的算力预算,指导模型寻找更合适的配置。它帮助判断模型规模如何和算力约束匹配。它不能推出 7B、13B 这样的数字必然出现。

回答的坑

  • 把 7B、13B 说成行业规定的固定档位,会忽略参数量由多个超参数共同决定这一点。

  • 把 2 的幂或其倍数说成数学硬性要求,会混淆 GPU 并行的工程便利和模型设计的必然规律。

这家公司的面经实录

—— 本题完 ——