机器学习数学基础 120 章

点估计、偏差、方差、MSE 与一致性

层级:A|必学

1. 怎样评价一个参数估计规则

估计量不仅看当前数据上数值是否“合理”,还看重复抽样性质:是否系统偏、是否波动、样本增大能否接近真值、是否充分利用信息。偏差—方差权衡是正则化和模型复杂度的统计基础。

2. 偏差

估计量 θ^\hat\theta 的偏差:

Bias(θ^)=E[θ^]θ.Bias(\hat\theta)=E[\hat\theta]-\theta.

无偏若对所有参数值

E[θ^]=θ.E[\hat\theta]=\theta.

样本均值对总体均值无偏。高斯方差 MLE(分母 nn)对总体方差有向下偏差;分母 n1n-1 修正无偏。

无偏是重复抽样平均性质,不表示当前误差为零。

3. 方差

Var(θ^)=E[(θ^Eθ^)2].Var(\hat\theta) =E[(\hat\theta-E\hat\theta)^2].

它衡量换一批数据估计值的波动。两个无偏估计量中,方差小者通常更精确,但还要看适用模型与稳健性。

参数向量用协方差矩阵描述估计不确定性。

4. MSE 分解

MSE(θ^)=E[(θ^θ)2].MSE(\hat\theta) =E[(\hat\theta-\theta)^2].

加减 Eθ^E\hat\theta 展开:

MSE=Var(θ^)+Bias(θ^)2.MSE=Var(\hat\theta)+Bias(\hat\theta)^2.

因此有偏估计可能比无偏估计 MSE 更小。岭回归收缩参数,引入偏差但可大幅降低病态方向方差。

5. 一致性

若样本量增大:

θ^nPθ,\hat\theta_n\xrightarrow P\theta,

称依概率一致。它是大样本性质,允许有限样本有偏。

例如方差 MLE 分母 nn 有偏但一致,因为偏差随 nn 消失。

一致性不说明有限样本好,也不提供收敛速度。

6. 渐近无偏与渐近正态

渐近无偏:

Bias(θ^n)0.Bias(\hat\theta_n)\to0.

渐近正态:

n(θ^nθ)N(0,V).\sqrt n(\hat\theta_n-\theta) \Rightarrow N(0,V).

后者支持标准误和置信区间。若估计量有 1/n1/\sqrt n 量级偏差,中心可能需要修正。

7. 效率

在无偏估计量类中,方差达到 Cramér–Rao 下界称有效。标量参数在正则条件下:

Var(θ^)1In(θ),Var(\hat\theta) \ge\frac1{I_n(\theta)},

InI_n 为 Fisher 信息。MLE 在许多正则模型下渐近有效。

正则条件、模型正确与固定维度很重要;超参数边界、混合模型和高维问题可能不满足。

8. 稳健性

估计量可能在理想模型下高效,却对少量污染极敏感。

  • 均值:高斯下高效,但 breakdown point 为 0;
  • 中位数:对极端值稳健,breakdown point 接近 50%;
  • Huber M-estimator:中心平方、尾部线性,折衷效率与稳健。

只用偏差方差评价理想模型不够,还要检查模型错设与污染。

9. 充分性

统计量 T(X)T(X) 对参数充分,若在给定 TT 后样本条件分布不再依参数。Fisher–Neyman 因子分解:

p(xθ)=g(T(x),θ)h(x).p(x|\theta)=g(T(x),\theta)h(x).

Bernoulli 样本成功数对 pp 充分。充分性说明为该模型估参数无需原始顺序,但不代表压缩对其他任务无损。

10. Rao–Blackwell

TT 是充分统计量,对无偏估计 UU

U=E[UT]U^*=E[U|T]

仍无偏且方差不大于 UU。条件期望平均掉与参数信息无关的随机性。

11. 收缩估计

把高方差估计向共同中心收缩:

θ~=(1α)θ^+alphaθ0.\tilde\theta=(1-\alpha)\hat\theta+alpha\theta_0.

偏差增加,方差乘 (1α)2(1-\alpha)^2。多参数问题中 James–Stein 现象表明维度至少 3 时,样本均值向中心适当收缩可在总平方风险上优于逐坐标无偏均值。

这给层级 Bayesian、target encoding 平滑和多任务共享提供直觉。

12. 模型选择后的估计偏差

先在许多特征/模型中选效果最好,再报告同数据上的系数、p 值或性能,会有 selection bias。传统标准误把模型当预先指定,通常过于乐观。可用独立验证、嵌套 CV、选择后推断或完整 pipeline bootstrap。

13. 预测估计量的偏差—方差

对固定 xx,训练集随机导致预测 f^D(x)\hat f_D(x) 变化:

ED[(Yf^D(x))2]=σnoise2+BiasD(f^(x))2+VarD(f^(x)).E_D[(Y-\hat f_D(x))^2] =\sigma^2_{noise} +Bias_D(\hat f(x))^2 +Var_D(\hat f(x)).

模型越灵活通常偏差降低、方差升高,但“双下降”等现代现象说明简单单调曲线不是普适定律。

易错点

  1. 无偏不等于低误差或好预测。
  2. 一致是大样本性质,不保证小样本。
  3. MLE 不必有限样本无偏。
  4. 理想模型效率不等于污染下稳健。
  5. 数据驱动选择后传统不确定性会过度乐观。

常见问答

Q1:为什么机器学习允许偏差?

目标通常是最小预测风险而非无偏参数估计;适当偏差换来的方差下降可改善测试 MSE。

Q2:正则化估计一致吗?

取决于 λn\lambda_n 随样本量的变化、模型和维度。固定强正则可能保留渐近偏差,衰减得当可一致。

Q3:低训练方差如何测?

用多次独立训练集/重采样或不同随机种子估计预测波动;种子波动与数据抽样波动是不同来源。

练习

  1. 写出 MSE 偏差—方差分解。
  2. 有偏但一致是否可能?举例。
  3. 无偏估计方差更大,MSE 能否更差?
  4. Rao–Blackwell 的作用是什么?
  5. 为什么模型选择后同数据性能乐观?

答案与提示

  1. Var(θ^)+Bias2Var(\hat\theta)+Bias^2
  2. 可以,如分母 nn 的样本方差 MLE。
  3. 可以。
  4. 对充分统计量条件化,保持无偏并降低/不增方差。
  5. 选择专门利用了候选中的随机好波动。