机器学习数学基础 120 章

线性回归的统计解释

层级:B|按需

1. 线性回归不只是解最小二乘

代数层面,最小二乘总能寻找最佳线性拟合;统计层面,要解释无偏、标准误、区间与检验,必须说明数据生成假设。预测、关联解释与因果效应又是不同层次。

2. 经典模型

y=Xβ+ϵ.y=X\beta+\epsilon.

常见固定设计假设:

  1. 对参数线性;
  2. XX 满列秩;
  3. E[ϵX]=0E[\epsilon|X]=0(外生性);
  4. Var(ϵX)=σ2IVar(\epsilon|X)=\sigma^2I(同方差且不相关);
  5. 若做有限样本精确 t/F 推断,常再假设条件高斯。

不同结论需要不同子集,不要把“线性回归要求所有变量高斯”当规则。

3. OLS 估计

β^=(XTX)1XTy=β+(XTX)1XTϵ.\hat\beta=(X^TX)^{-1}X^Ty =\beta+(X^TX)^{-1}X^T\epsilon.

给定 XX,若 E[ϵX]=0E[\epsilon|X]=0

E[β^X]=β.E[\hat\beta|X]=\beta.

若同方差不相关:

Var(β^X)=σ2(XTX)1.Var(\hat\beta|X)=\sigma^2(X^TX)^{-1}.

共线性使 XTXX^TX 小特征值方向逆很大,系数方差增大。

4. Gauss–Markov 定理

在线性、外生、同方差不相关等条件下,OLS 是所有线性无偏估计量中方差最小者(BLUE)。

它不要求误差高斯;高斯主要给精确分布推断。BLUE 不代表在所有有偏/非线性估计量中 MSE 最好,岭回归可通过偏差换方差。

5. 残差与误差

真实误差

ϵ=yXβ\epsilon=y-X\beta

不可观测;残差

e=yXβ^=(IH)y,e=y-X\hat\beta=(I-H)y,

其中帽子矩阵

H=X(XTX)1XT.H=X(X^TX)^{-1}X^T.

残差并非独立同方差,即使误差是;其协方差为 σ2(IH)\sigma^2(I-H)。不要把残差直方图完全等同误差分布。

6. 杠杆值与影响

hii=Hiih_{ii}=H_{ii} 是 leverage,衡量样本特征位置对自身拟合值影响。平均 leverage 为 p/np/n(含截距参数数 pp)。高杠杆点不一定有大残差,却可能强影响系数。

Cook's distance 等结合杠杆与残差衡量删除样本对拟合的影响。应调查数据来源,不机械删除。

7. 误差方差估计

σ^2=e2np\hat\sigma^2=\frac{\|e\|^2}{n-p}

在经典条件下无偏。自由度 npn-p 因估计了 pp 个独立参数。

系数标准误:

SE(β^j)=σ^2[(XTX)1]jj.SE(\hat\beta_j) =\sqrt{\hat\sigma^2[(X^TX)^{-1}]_{jj}}.

用于 t 区间/检验。

8. 异方差

Var(ϵiX)=σi2Var(\epsilon_i|X)=\sigma_i^2 不同,OLS 在外生性下仍可无偏/一致,但经典标准误错误且不再 BLUE。处理:

  • HC sandwich robust SE;
  • 加权最小二乘(若方差模型可信);
  • 变换响应;
  • 直接建模条件方差;
  • 使用稳健损失处理极端尾部(与异方差不同问题)。

9. 自相关与群组相关

时间/群内误差相关使经典 SE 过小。使用 cluster-robust、HAC、GLS、混合效应或时间序列模型。聚类层级数太少时普通 cluster SE 也不可靠,需小样本修正或随机化推断。

10. 遗漏变量偏差

真实模型含 zz

y=βxx+βzz+ϵ.y=\beta_xx+\beta_zz+\epsilon.

若省略 zzzzxx 相关,xx 系数吸收部分 zz 作用,外生性失败。加入更多变量不总修复:控制 collider、中介或测量后处理变量会产生其他偏差。

因果解释需要结构假设与研究设计,不由回归本身提供。

11. 系数解释

线性模型中,在“其他变量保持不变”条件下,xjx_j 增加一单位,条件均值改变 βj\beta_j。但:

  • 单位和编码决定数值;
  • 有交互时主效应依其他变量值;
  • log 变换有百分比解释;
  • 共线性使“保持其他变量不变”可能脱离数据支持;
  • 非因果数据只能解释条件关联。

12. 置信区间与预测区间

新点 x0x_0 的均值预测方差:

σ^2x0T(XTX)1x0.\hat\sigma^2x_0^T(X^TX)^{-1}x_0.

新观测预测还加噪声:

σ^2[1+x0T(XTX)1x0].\hat\sigma^2[1+x_0^T(X^TX)^{-1}x_0].

所以预测区间更宽。远离训练特征区域时 leverage 项大,外推不确定性增大。

13. 诊断不是通过/失败清单

检查 residual vs fitted、Q–Q、scale-location、leverage/influence、时间/群组残差、非线性部分残差。诊断目的是定位模型错设并决定变换、非线性、方差模型或数据修复,不是让每张图“看起来完美”。

易错点

  1. 线性回归不要求特征高斯。
  2. 残差不等于真实误差。
  3. robust SE 不修复遗漏变量偏差。
  4. 系数显著不等于因果。
  5. R2R^2 不保证模型正确或外推好。

常见问答

Q1:特征相关会让 OLS 有偏吗?

只要不完全共线且外生性成立,不必有偏,但方差大、解释不稳定。遗漏相关混杂才常导致偏差。

Q2:误差不高斯还能预测吗?

OLS 点估计仍可有良好性质;小样本精确 t/F 推断改变。大样本 robust SE 或非参数/稳健方法可用。

Q3:标准化后系数能比较重要性吗?

比原单位更可比,但相关、非线性、测量误差与目标分布仍影响,不能作为唯一特征重要性。

练习

  1. 写出 OLS 条件方差。
  2. Gauss–Markov 保证什么,不保证什么?
  3. 残差自由度为什么是 npn-p
  4. 异方差主要破坏什么经典结论?
  5. 为什么回归系数不自动是因果效应?

答案与提示

  1. σ2(XTX)1\sigma^2(X^TX)^{-1}
  2. 线性无偏类中最小方差;不保证所有估计中最小 MSE或因果。
  3. 拟合消耗 pp 个独立参数/投影维度。
  4. 经典方差/标准误与 BLUE 效率;外生性仍在时点估计可无偏一致。
  5. 可能有混杂、反向因果、选择与错误控制变量。