机器学习数学基础 120 章

最小二乘与正规方程

层级:A|必学

1. 最小二乘是机器学习的原型问题

它把线性代数、几何投影、概率高斯噪声和凸优化连接起来。即使实际模型更复杂,理解最小二乘也能帮助你理解损失、闭式解、正则化、条件数和残差诊断。

2. 模型与矩阵形式

每行一个样本:

yi=wTxi+b+ϵi.y_i=w^Tx_i+b+\epsilon_i.

可把一列 1 加到设计矩阵并把 bb 合入参数。记

y=Xβ+ϵ,y=X\beta+\epsilon,

XRn×pX\in\mathbb R^{n\times p}βRp\beta\in\mathbb R^p。最小二乘求

β^=argminβ12Xβy22.\hat\beta=\arg\min_\beta \frac12\|X\beta-y\|_2^2.

1/21/2 只为简化导数。

3. 梯度推导

L(β)=12(Xβy)T(Xβy).L(\beta)=\frac12(X\beta-y)^T(X\beta-y).

梯度:

βL=XT(Xβy).\nabla_\beta L=X^T(X\beta-y).

令其为零:

XTXβ^=XTy.X^TX\hat\beta=X^Ty.

这就是正规方程。Hessian 为

2L=XTX0,\nabla^2L=X^TX\succeq0,

所以目标凸,任何解都是全局最优。

4. 闭式解的条件

XX 满列秩,XTX0X^TX\succ0 可逆:

β^=(XTX)1XTy.\hat\beta=(X^TX)^{-1}X^Ty.

若不满列秩,参数解不唯一,但最优预测 Xβ^X\hat\beta 仍唯一;伪逆给最小范数解:

β^=X+y.\hat\beta=X^+y.

实现不要显式求逆,应调用 QR/SVD 的 lstsq 或稳定求解器。

5. 几何投影

XβX\beta 永远在 XX 的列空间。最小二乘从列空间中找离 yy 最近的点:

y^=Xβ^=PXy.\hat y=X\hat\beta=P_Xy.

残差

r=yy^r=y-\hat y

与列空间正交:

XTr=0.X^Tr=0.

这正是正规方程的另一写法。若设计矩阵包含全一截距列,则 1Tr=0\boldsymbol1^Tr=0,残差和为零。

6. 一元线性回归

含截距模型 yi=wxi+b+ϵiy_i=wx_i+b+\epsilon_i

w^=i(xixˉ)(yiyˉ)i(xixˉ)2,\hat w=\frac{\sum_i(x_i-\bar x)(y_i-\bar y)} {\sum_i(x_i-\bar x)^2}, b^=yˉw^xˉ.\hat b=\bar y-\hat w\bar x.

斜率是样本协方差与 xx 样本方差的比。若所有 xix_i 相同,分母为 0,无法识别斜率。

7. 高斯噪声与极大似然

假设

ϵiiidN(0,σ2).\epsilon_i\overset{iid}\sim\mathcal N(0,\sigma^2).

p(yX,β)exp(12σ2yXβ22).p(y|X,\beta) \propto\exp\left(-\frac1{2\sigma^2} \|y-X\beta\|_2^2\right).

最大化似然等价于最小化平方误差。平方损失隐含了关于噪声的统计假设,不只是计算方便。

8. 岭回归

minβ12Xβy2+λ2β2.\min_\beta \frac12\|X\beta-y\|^2 +\frac\lambda2\|\beta\|^2.

正规方程:

(XTX+λI)β^=XTy.(X^TX+\lambda I)\hat\beta=X^Ty.

λ>0\lambda>0 使矩阵正定、解唯一,并收缩病态方向。通常不惩罚截距,因此合并截距时正则化矩阵对应位置应为 0。

9. 加权最小二乘

不同样本噪声方差不同时,可设正权重:

minβ12(yXβ)TW(yXβ),\min_\beta \frac12(y-X\beta)^TW(y-X\beta),

WW 常为对角矩阵。正规方程:

XTWXβ^=XTWy.X^TWX\hat\beta=X^TWy.

若权重与逆噪声方差成正比,来自异方差高斯似然。

10. 数值问题

形成 XTXX^TX 会把 2-范数条件数平方:

κ(XTX)=κ(X)2.\kappa(X^TX)=\kappa(X)^2.

因此:

  • 中等满秩问题用 QR;
  • 秩亏或病态用 SVD;
  • 大规模稀疏问题用迭代最小二乘;
  • 特征缩放和岭正则化改善条件。

11. 残差与建模假设

残差图可检查:

  • 非线性结构;
  • 方差随预测变化(异方差);
  • 异常点;
  • 时间/群组相关。

最小二乘总能输出一个代数解,但统计解释需要噪声均值、独立性、方差等条件。预测与因果解释又是不同目标。

易错点

  1. 闭式公式不表示代码要显式求逆。
  2. XX 不满列秩时参数不唯一,预测可仍唯一。
  3. 正规方程数值上可能比 QR/SVD 差。
  4. 高斯噪声假设对应平方损失;重尾噪声可能更适合鲁棒损失。
  5. 默认惩罚截距会依赖标签基线,不一定合理。

常见问答

Q1:为什么叫“最小二乘”?

“二乘”是旧译,指残差的平方;目标是让平方和最小。

Q2:R² 高是否模型就好?

不一定。它可能来自泄漏、过拟合或非独立数据,也不保证因果、校准和部署分布性能。

Q3:绝对误差为什么没有相同闭式解?

L1 目标分段线性且在零不可微;一维位置最优是中位数,多元回归通常用线性规划、次梯度或专用方法。

练习

  1. 推导 β12Xβy2\nabla_\beta\frac12\|X\beta-y\|^2
  2. 为什么正规方程表示残差与每列特征正交?
  3. XX 不满列秩时为什么参数不唯一?
  4. 岭回归如何改变 XTXX^TX 的特征值?
  5. 高斯噪声下负对数似然为何得到平方误差?

答案与提示

  1. XT(Xβy)X^T(X\beta-y)
  2. 置梯度为零即 XT(Xβy)=0X^T(X\beta-y)=0
  3. 存在非零 vv 使 Xv=0Xv=0,若 β\beta 是解,则 β+cv\beta+cv 预测相同。
  4. 每个特征值增加 λ\lambda
  5. 高斯指数项为残差平方除以 2σ22\sigma^2,其余项与 β\beta 无关。