先这样答
Scaling Law 是一组经验规律:在一定范围内,模型的测试 loss 随参数量、训练数据量、训练算力的增长,按幂律平滑下降。幂律的意思是在对数坐标上近似一条直线:投入按倍数增长,loss 沿一条可预测的曲线稳定下降。这组关系在 2020 年由 OpenAI 整理发表,2022 年 DeepMind 的 Chinchilla 研究给出修正:同等算力预算下,参数量和数据量应该按比例一起扩,此前的模型普遍参数偏大、数据喂得少。
为什么大家相信堆算力有用:这条曲线在观察范围内足够平稳,没有突然失效的迹象,于是「投多少算力、期待多少提升」变成了可以算账的工程决策,不是赌运气。头部模型一路做大,很大程度上就是沿着这条曲线执行;行业敢提前锁定巨额算力投入,依据也是它。
边界也要说:Scaling Law 描述的是 loss,不是各项具体能力,loss 平滑下降不等于推理、代码这些能力同步平滑变强,「涌现能力」的争论就在这里。另外高质量文本数据的供给有现实上限,单纯堆算力的路线已经被迫和合成数据、后训练这些方向结合。
面试官会怎么追问
- 「Chinchilla 修正了什么?」 在同等算力预算下重新分配参数量和数据量:不是把预算全砸给参数,而是参数和数据大致同比例扩大,才能在同样算力下拿到更低的 loss。这直接改变了之后几年的训练配比思路。
- 「Scaling Law 会一直成立吗?」 未知。它是观察拟合出的经验规律,不是定理;数据耗尽、收益递减、某些区间失配都有讨论。但「更大仍然更强」目前仍是行业实践的默认假设,只是从「只堆参数」变成了「参数、数据、数据质量一起堆」。
- 「涌现能力和 Scaling Law 矛盾吗?」 两边都有证据。一种观点认为部分能力在规模跨过某个范围后突然出现;另一种观点认为是评测指标造成的观感,换成连续指标后能力也是平滑增长的。面试里把两面都摆出来,比急着站队更稳。
回答的坑
- 把 Scaling Law 说成定律。它是经验拟合,成立范围靠观察,外推有风险,历史上 Chinchilla 就修正过前人的结论。
- 只盯参数量一个变量。Scaling Law 说的是参数、数据、算力三个量的关系,只堆参数不喂等比数据,钱花在低效区。
同系列的题
—— 本题完 ——