LLM 基础概念大语言模型理论基础速答 · 约 6 分钟更新 2026-09-28

大模型的涌现能力是什么?和 Scaling Law 什么关系?

一句话结论

Scaling Law 描述整体损失随算力、数据、参数增加呈幂律可预测下降,而涌现能力是规模跨过阈值后,模型在特定任务上表现从随机突变到可用的非平滑现象。

先这样答

大模型的涌现能力与 Scaling Law 是一对紧密关联的概念,分别描述了特定任务表现的突变与整体损失的可预测下降。面试时可从两者定义、相互关系及学术争议三个层次展开。

Scaling Law 是指模型的训练损失随参数量、数据量和算力的增加,按幂律呈现可预测下降的规律,它是业界堆算力与数据的量化依据。涌现能力则指当模型规模跨过某个阈值后,在多步推理、指令跟随或上下文学习等特定任务上,表现从接近随机猜测突然跳变到可用水平。这种非平滑提升在小模型上不可见。两者的关系在于,Scaling Law 描述平均损失的平滑变化,涌现描述特定任务表现的相变。工程意义是,整体损失虽可预估,但模型在特定复杂任务上何时具备可用能力,在训前很难精确预测。

学术界对涌现现象存在争议。部分研究认为涌现可能是度量方式造成的假象。若采用非连续的严格匹配指标测算,能力表现呈现非平滑跳变;若换成连续的概率指标评估,曲线其实是平滑的。在回答最后,可以这样向面试官收束:虽然涌现现象在学术界有度量指标上的辨析,但在工程实践中,Scaling Law 依然是规划算力的基础,而涌现能力的不可预测性要求我们在训后进行充分的任务评测。

面试官会怎么追问

  • 「既然涌现可能是度量指标造成的假象,那我们在工程上还需要关注它吗?」 依然需要关注。即使底层概率的变化是连续平滑的,实际应用中的用户体验往往由非连续的成功或失败决定。比如代码生成任务,只有完全正确的代码才有业务价值,业务层面的可用性依然存在明显的阈值效应。
  • 「在训练新模型时,具体如何利用 Scaling Law 规划算力和数据?」 通常先在较小规模上训练多个实验模型,记录不同算力和数据量下的损失变化并拟合出幂律曲线。随后根据曲线外推,预测目标规模模型所需的算力、参数量和数据量配比,在有限预算下寻找整体损失最小化的方案。
  • 「如果模型规模没达到涌现的阈值,还有办法激发多步推理这种能力吗?」 可以通过高质量微调数据或调整提示词弥补。例如在较小模型上使用思维链提示,或用大模型生成的推理过程数据进行微调。在特定垂直领域内进行针对性优化,能降低某些能力对绝对规模的依赖。

回答的坑

  • 错误地将涌现能力等同于 Scaling Law,未区分整体平均损失的连续下降与特定任务表现的非连续突变。
  • 把涌现能力当成毫无争议的物理定律,忽略了关于连续概率与非连续度量指标导致假象的辨析,错失加分项。
—— 本题完 ——