五厂面经真题集阿里巴巴面经高频阿里真题机器学习数学基础速答 · 约 5 分钟更新 2026-09-29

L1 和 L2 正则的稀疏性有什么区别?

一句话结论

L1正则产生稀疏解,最优解常落在坐标轴上,权重精确为零。L2正则产生平滑解,权重被整体压小但不为零。两者的差异源于几何等高线分布与先验分布的不同。

先这样答

L1正则产生稀疏解。L2正则产生平滑解。L1是对权重施加绝对值惩罚。从概率论角度看,L1等价于引入拉普拉斯分布作为先验。拉普拉斯分布在零点处存在尖峰。模型优化时,权重参数倾向于精确变为零。这种机制让L1自带特征选择功能。L2是对权重施加平方惩罚。它的先验假设是高斯分布。高斯分布在零点周围十分平滑。模型优化时,权重参数会被整体压小。这些权重趋近于零但不等于零。

从几何角度看,两者的差异更加直观。目标函数等高线与正则项约束图形的交点就是最优解。L1正则的约束图形是菱形。菱形的顶点非常突出。这些顶点正好落在坐标轴上。目标函数的等高线向外膨胀时,极容易与菱形的顶点相切。交点在坐标轴上意味着部分维度的权重精确为零。L2正则的约束图形是圆形。圆形的边缘平滑。目标函数的等高线可以切在圆周的任意位置。交点极少落在坐标轴上。

面试官会怎么追问

  • 「你提到L1的最优解容易落在坐标轴上,能详细解释一下几何相切的过程吗?」 优化过程是寻找目标函数等高线与正则项图形的交点。等高线从中心向外一圈圈扩大。L1的菱形图形顶点固定在坐标轴上。扩大的等高线最先触碰的往往是这些突出的顶点。

  • 「从概率角度看,为什么拉普拉斯先验会比高斯先验更容易产生零权重?」 拉普拉斯分布的概率密度函数在零点处呈尖峰状。高斯分布在零点处呈平滑的钟形。最大后验估计寻找概率密度最大的参数值。尖峰形状迫使参数以更大概率精确取到零。

  • 「如果我希望保留所有特征但降低模型复杂度,应该选哪个?」 应该选择L2正则。L2的圆形等高线交点通常不在坐标轴上。它会将所有特征的权重按比例压小。这种方式既保留了完整的特征维度,又限制了参数规模。

回答的坑

描述几何解释时记混约束图形,错误地将L1的菱形等高线说成圆形。

误以为L2正则也能直接用于剔除冗余特征,忽略了L2权重只变小但不为零的事实。

—— 本题完 ——