方差、标准差与高阶矩
层级:A|必学
1. 均值不描述波动
两个分布可有相同均值,却一个集中、一个分散。方差衡量随机变量相对均值的平均平方偏离,标准差把单位恢复为原变量单位。
2. 方差定义
若 μ=E[X]:
Var(X)=E[(X−μ)2].
标准差:
SD(X)=Var(X).
方差单位是原单位平方,标准差与原变量同单位。方差非负,等于 0 当且仅当 X 几乎必然为常数。
3. 计算公式
展开:
Var(X)=E[X2]−(E[X])2.
推导:
E[X2−2μX+μ2]=E[X2]−2μ2+μ2.
该公式理论简洁,但浮点中若 E[X2] 与 E[X]2 都很大且接近,相减会严重消去;计算样本方差应使用稳定两遍法或 Welford 在线算法。
4. 平移与缩放
Var(X+c)=Var(X),
Var(aX+b)=a2Var(X).
加常数只平移,不改变波动;放大 a 倍使标准差放大 ∣a∣ 倍、方差放大 a2。
5. 随机变量之和
Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y).
若不相关,协方差为 0,方差相加。独立蕴含不相关(有限二阶矩下),所以独立时也相加。
一般:
Var(i∑aiXi)=i∑j∑aiajCov(Xi,Xj).
6. 样本均值方差
若 Xi iid,方差 σ2:
Var(Xˉ)=Var(n1i∑Xi)=nσ2.
标准误为 σ/n。样本量扩大 4 倍,均值标准误约减半,不是降到四分之一。
若样本正相关,协方差项使有效样本量低于 n。
7. 总体方差与样本方差
数据 x1,ldots,xn:
sn2=n1i∑(xi−xˉ)2
是经验分布方差/MLE(高斯均值同时估计时),但对总体方差有向下偏差。无偏样本方差:
s2=n−11i∑(xi−xˉ)2.
分母 n−1 来自估计均值消耗一个自由度。预测/描述时选哪个要明确语境,库的默认 ddof 可能不同。
8. 矩与中心矩
k 阶原点矩:
E[Xk].
k 阶中心矩:
E[(X−μ)k].
一阶原点矩是均值,二阶中心矩是方差。
偏度
标准化三阶中心矩:
γ1=E[(σX−μ)3].
衡量分布非对称方向。
峰度
标准化四阶中心矩:
γ2=E[(σX−μ)4].
高斯峰度为 3,超额峰度为 0。它更与尾部/极端值相关,不应简单解释为图形“尖不尖”。
9. 均方误差
估计量 θ^:
MSE(θ^)=E[(θ^−θ)2]=Var(θ^)+Bias(θ^)2.
这说明有偏估计可能通过显著降低方差获得更小 MSE,正则化的统计动机之一。
10. 变异系数
CV=∣μ∣σ
提供无量纲相对波动,但均值接近 0 时不稳定,负均值与区间尺度变量也需谨慎。不能用于所有数据类型。
11. 鲁棒尺度
标准差对离群值敏感。常用:
- MAD:中位绝对偏差;
- IQR:四分位距;
- 截尾/winsorized 尺度。
数据探索时同时看分位数和标准差,尤其对延迟、收入等重尾分布。
易错点
- 方差不是平均绝对偏差。
- Var(X+Y) 一般不能直接方差相加,要有协方差项。
- 标准差与标准误不同;前者描述个体波动,后者描述估计均值波动。
- 样本方差分母 n 与 n−1 服务不同目的。
- 直接用 E[X2]−E[X]2 算浮点方差可能不稳定。
常见问答
Q1:方差大是否数据质量差?
不一定。它可能是真实异质性、有用信号、单位尺度,也可能是噪声。需结合条件分布与任务。
Q2:为什么平均多个模型能降低方差?
若误差不完全相关,平均的方差包含缩小的个体方差与协方差;多样性越大,降低越明显。
Q3:神经网络初始化为什么关心方差?
层层线性组合会放大或缩小激活/梯度方差,Xavier/He 初始化试图让尺度跨层稳定。
练习
- Bernoulli(p) 方差是多少?
- 若 Var(X)=4,求 Var(3X+5)。
- iid 均值取 100 个样本,单样本方差 25,均值标准误是多少?
- 为什么样本方差用 n−1 可无偏?
- 写出 Var(X−Y)。
答案与提示
- p(1−p)。
- 36。
- 25/100=0.5。
- 样本偏差相对估计均值受一个线性约束、自由度为 n−1;正式期望计算给修正。
- Var(X)+Var(Y)−2Cov(X,Y)。