机器学习数学基础 120 章

L1/L2 正则化、稀疏性与几何解释

层级:A|必学

1. 正则化在表达什么

训练损失只关心拟合样本。正则化加入对参数或函数结构的偏好,在多解、噪声和有限数据下选择更稳定的模型。它可改善泛化、可辨识性和数值条件,但不保证任何任务都更好。

2. 两种常见目标

L2(ridge/weight decay 相关):

minwR^(w)+λ2w22.\min_w\hat R(w)+\frac\lambda2\|w\|_2^2.

L1(Lasso):

minwR^(w)+λw1.\min_w\hat R(w)+\lambda\|w\|_1.

λ0\lambda\ge0 越大,正则偏好越强。特征未缩放时,同一个 λ\lambda 对不同单位的系数不公平。

3. 惩罚形式与约束形式

minwR^(w)+λw\min_w\hat R(w)+\lambda\|w\|

常与

minwR^(w)s.t. wt\min_w\hat R(w) \quad\text{s.t. }\|w\|\le t

对应:对合适的 λ,t\lambda,t 可能有相同解。λ\lambda 是惩罚价格,tt 是预算。映射依数据与问题,不应把数值直接互换。

4. L2 的作用

梯度为 λw\lambda w,持续把权重拉向零,但在光滑损失下通常不会让其精确等于零。岭回归闭式解:

w^=(XTX+λI)1XTy.\hat w=(X^TX+\lambda I)^{-1}X^Ty.

X=UΣVTX=U\Sigma V^T,每个奇异方向的最小二乘系数被因子

σi2σi2+λ\frac{\sigma_i^2}{\sigma_i^2+\lambda}

收缩。数据支持弱的小奇异方向收缩更多。

5. L1 为何产生稀疏

L1 在 0 有尖角,次梯度为区间 [1,1][-1,1]。最优条件可让一个范围内的损失梯度被该区间抵消,从而 wj=0w_j=0

二维几何:损失椭圆向外扩张,首次接触 L1 菱形约束往往发生在坐标轴尖角;接触点某坐标为零。L2 圆边界光滑,接触点一般不在轴上。

6. 一维软阈值

考虑

minw12(wz)2+λw.\min_w\frac12(w-z)^2+\lambda|w|.

解为

Sλ(z)=sign(z)max(zλ,0).S_\lambda(z)= \operatorname{sign}(z)\max(|z|-\lambda,0).
  • z>λz>\lambda:减去 λ\lambda
  • z<λz<-\lambda:加上 λ\lambda
  • zλ|z|\le\lambda:直接变为 0。

这清楚展示 L1 的稀疏阈值机制。

7. Elastic Net

R^(w)+λ1w1+λ22w22.\hat R(w)+\lambda_1\|w\|_1 +\frac{\lambda_2}{2}\|w\|_2^2.

它结合稀疏与稳定收缩。高度相关特征中,纯 Lasso 可能任意选一个、路径不稳定;Elastic Net 更倾向成组保留,同时 L2 项改善强凸性。

8. Bayesian 解释

MAP 估计中:

  • 高斯先验 wN(0,τ2I)w\sim\mathcal N(0,\tau^2I) 对应 L2 惩罚;
  • Laplace 先验 p(w)ew/bp(w)\propto e^{-|w|/b} 对应 L1 惩罚。

这是目标函数层面的对应。MAP 单点估计不等同完整 Bayesian 后验;“L2 就是高斯先验”还需匹配尺度与似然。

9. 正则化与特征缩放

若把特征 xjx_j 放大 cc 倍,为保持预测,对应 wjw_j 缩小 cc 倍,正则代价随之改变。故 L1/L2 回归通常先标准化数值特征,并把变换保存到部署 pipeline。

one-hot 与连续特征是否用同样尺度、组特征是否整体惩罚,需要业务判断。

10. 截距与归一化参数

截距通常不正则,因为它表示整体基线,且惩罚会使结果依赖标签平移。神经网络中偏置、BatchNorm/LayerNorm 的 scale/bias 常从 weight decay 中排除,但不是绝对规则。

11. L1 不等于可靠特征选择

Lasso 得到零系数不自动证明特征无因果/业务价值:

  • 高相关特征会互相替代;
  • 选择随样本波动;
  • 非线性与交互可能被线性模型漏掉;
  • 标准化和 λ\lambda 改变选择;
  • 数据泄漏会让虚假特征被选中。

应通过稳定性选择、重采样、领域知识和独立验证确认。

12. 其他正则化

  • Group Lasso:整组参数一起进入/退出;
  • 核范数:鼓励矩阵低秩;
  • total variation:鼓励分段平滑;
  • dropout、数据增强、早停:具有隐式/显式正则效果;
  • 图 Laplacian 正则:鼓励相邻节点预测平滑。

正则化应匹配希望的结构,而不是默认只选 L2。

易错点

  1. L2 通常收缩但不产生精确稀疏。
  2. 特征不标准化会让正则惩罚不可比。
  3. Adam 中 L2 梯度与解耦 weight decay 不等价。
  4. 稀疏系数不等于真实特征不重要。
  5. λ\lambda 应只用训练/验证流程选择,不能看测试集调参。

常见问答

Q1:正则化越强泛化越好吗?

不是。过强会欠拟合。验证性能通常呈折衷,需要在无泄漏验证集上选择。

Q2:为什么岭回归能解决共线性?

它给 XTXX^TX 所有特征值加 λ\lambda,使解唯一并降低小特征值方向的噪声放大。

Q3:Lasso 特征数是否不超过样本数?

在一般位置和标准线性 Lasso 条件下常有类似性质,但退化、实现与推广模型会有例外,不应当无条件定律使用。

练习

  1. 一维软阈值中 z=3,λ=1z=3,\lambda=1 的解是什么?
  2. z=0.5,λ=1z=0.5,\lambda=1 呢?
  3. 为什么 L2 改善条件数?
  4. 解释 L1 球尖角与稀疏的关系。
  5. 为什么标准化应在训练折内拟合?

答案与提示

  1. 2。
  2. 0。
  3. 特征值从 λi\lambda_i 变为 λi+λ\lambda_i+\lambda,最小值抬升。
  4. 损失等高线更易在坐标轴尖角接触约束边界,对应零坐标。
  5. 用全数据均值/方差会把验证信息泄漏进训练。