请解释机器学习中正则化的作用,并对比 L1 与 L2 正则化在惩罚方式、解的稀疏性以及对特征选择的影响上有哪些不同?
考察说明
考查对机器学习正则化概念及 L1/L2 差异的理解,包括数学形式、解的特性及适用场景。
回答思路
- 【回答框架 1】正则化是一种防止模型过拟合的技术,通过在损失函数中加入模型复杂度惩罚项,限制参数大小。L1 正则化使用参数绝对值之和作为惩罚,L2 正则化使用参数平方和。
- 【回答框架 2】L1 正则化倾向产生稀疏解,即许多参数为0,因此具有特征选择作用,适用于特征维度高且可能有冗余特征的场景。L2 正则化使参数整体变小但不会为0,更适合多数特征都有贡献的情况。
- 【回答框架 3】从优化角度看,L1 在零点不可导,导致参数可能精确为0;L2 梯度与参数成正比,使参数平滑缩减。L1 对异常值更鲁棒,但损失函数非光滑,求解稍复杂,通常使用近端梯度法等。
- 【回答框架 4】实际应用中,L1 可用于特征筛选,L2 常用于防止过拟合,二者也可结合使用(如 ElasticNet)。选择 L1 或 L2 需根据特征解释性要求和数据维度决定。
- 【关键点 1】L1 惩罚项为参数的绝对值之和,L2 为参数平方和。
- 【关键点 2】L1 使参数稀疏化,可做特征选择;L2 使参数平滑缩小,不产生稀疏解。
- 【关键点 3】两者都通过限制参数复杂度来缓解过拟合,L2 更常用于常规回归和神经网络。
- 【易错点 1】混淆 L1 与 L2 的几何特性,L1 得到稀疏解并不是由于参数必须为零,而是因为在约束区域顶点处最优化。
- 【易错点 2】认为 L2 也能进行特征选择,实际上 L2 不会将系数压缩到零。
- 【易错点 3】忽视正则化强度的调节,过高的正则化会导致欠拟合。