先这样答
B 是 Billion(十亿),7B 就是约七十亿个参数,70B 就是约七百亿个。参数指神经网络里那些可学习的权重数值,是模型存储知识和模式的载体,训练做的事就是不断调整这些数值。
参数量的影响分三条线说。能力上,参数是容量,同系列、同训练条件下,更大的模型通常理解更深、推理更强,但不是每个任务差距都明显,简单任务小模型就够。速度上,每生成一个 token 都要把全部参数过一遍,参数越多单步越慢。成本上,参数量直接决定显存占用,决定一张卡能装多大模型、要不要多卡。工程上还有量化这条路:把参数用更低的数值精度存储,用少量效果损失换显存和速度。
收一句:参数量是能力上限和部署成本的共同变量。选模型看任务难度,别只看大小;也别把参数量当唯一指标,数据质量和训练方法同样决定最终水平。
面试官会怎么追问
- 「参数越多一定越强吗?」 同系列、同训练配方下大致成立,跨系列不能直接比:数据差的大模型可能输给数据好的小模型。训练方法的进步让小模型不断逼近大模型,参数量只是变量之一。
- 「知识存在参数里吗?」 事实性知识分布在参数数值里,这是「参数小了记不住足够知识」的原因。但推理时给的参考资料在上下文里,不占参数,这正是 RAG 能补知识、还能随时更换的原理。
- 「为什么同参数量的模型速度也不一样?」 速度还取决于架构和实现:MoE 模型总参数大但每步只激活一小部分,速度可以接近小模型;量化精度、批处理方式、硬件利用率都在影响最终速度。参数量只是起点,不是全部。
回答的坑
- 拿参数量直接横比不同厂商的模型。训练数据和后训练方法不同,同样参数量表现可能差很远;参数量只在同系列内比较才有参考意义。
- 认为参数翻倍速度就减半。实际速度和架构、量化、批处理、硬件都有关,结论要实测,不能只按参数量线性推算。
同系列的题
—— 本题完 ——