先这样答
L1正则产生稀疏解。L2正则产生平滑解。L1是对权重施加绝对值惩罚。从概率论角度看,L1等价于引入拉普拉斯分布作为先验。拉普拉斯分布在零点处存在尖峰。模型优化时,权重参数倾向于精确变为零。这种机制让L1自带特征选择功能。L2是对权重施加平方惩罚。它的先验假设是高斯分布。高斯分布在零点周围十分平滑。模型优化时,权重参数会被整体压小。这些权重趋近于零但不等于零。
从几何角度看,两者的差异更加直观。目标函数等高线与正则项约束图形的交点就是最优解。L1正则的约束图形是菱形。菱形的顶点非常突出。这些顶点正好落在坐标轴上。目标函数的等高线向外膨胀时,极容易与菱形的顶点相切。交点在坐标轴上意味着部分维度的权重精确为零。L2正则的约束图形是圆形。圆形的边缘平滑。目标函数的等高线可以切在圆周的任意位置。交点极少落在坐标轴上。
面试官会怎么追问
-
「你提到L1的最优解容易落在坐标轴上,能详细解释一下几何相切的过程吗?」 优化过程是寻找目标函数等高线与正则项图形的交点。等高线从中心向外一圈圈扩大。L1的菱形图形顶点固定在坐标轴上。扩大的等高线最先触碰的往往是这些突出的顶点。
-
「从概率角度看,为什么拉普拉斯先验会比高斯先验更容易产生零权重?」 拉普拉斯分布的概率密度函数在零点处呈尖峰状。高斯分布在零点处呈平滑的钟形。最大后验估计寻找概率密度最大的参数值。尖峰形状迫使参数以更大概率精确取到零。
-
「如果我希望保留所有特征但降低模型复杂度,应该选哪个?」 应该选择L2正则。L2的圆形等高线交点通常不在坐标轴上。它会将所有特征的权重按比例压小。这种方式既保留了完整的特征维度,又限制了参数规模。
回答的坑
描述几何解释时记混约束图形,错误地将L1的菱形等高线说成圆形。
误以为L2正则也能直接用于剔除冗余特征,忽略了L2权重只变小但不为零的事实。
同系列的题