机器学习数学基础 120 章

一元高斯分布

层级:A|必学

1. 高斯分布为何重要

许多小独立影响相加后近似高斯;平方误差对应高斯噪声似然;均值估计在大样本下近似高斯;多种解析推断以高斯为基础。但现实数据并不因为常见就自动高斯,尤其重尾、偏态和多峰数据。

2. 密度

XN(μ,σ2),quadσ>0,X\sim\mathcal N(\mu,\sigma^2),quad\sigma>0, f(x)=12πσ2exp[(xμ)22σ2].f(x)=\frac1{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right].
  • μ\mu:位置/均值;
  • σ2\sigma^2:方差;
  • σ\sigma:标准差。

密度关于 μ\mu 对称,均值=中位数=众数=μ\mu

3. 标准高斯

ZN(0,1).Z\sim\mathcal N(0,1).

标准化:

Z=Xμσ.Z=\frac{X-\mu}{\sigma}.

于是

P(Xx)=Φ(xμσ),P(X\le x)=\Phi\left(\frac{x-\mu}{\sigma}\right),

Φ\Phi 为标准高斯 CDF,没有初等闭式,使用数值库。

4. 68–95–99.7 规则

近似:

P(Xμσ)0.683,P(|X-\mu|\le\sigma)\approx0.683, P(Xμ2σ)0.954,P(|X-\mu|\le2\sigma)\approx0.954, P(Xμ3σ)0.997.P(|X-\mu|\le3\sigma)\approx0.997.

它只适用于高斯分布。对重尾数据,“3 sigma” 异常率会远高于 0.3%。

5. 线性变换与相加

XN(μ,σ2)X\sim N(\mu,\sigma^2)

aX+bN(aμ+b,a2σ2).aX+b\sim N(a\mu+b,a^2\sigma^2).

独立高斯 XiX_i 的线性组合仍高斯:

iaiXiN(iaiμi,iai2σi2).\sum_ia_iX_i \sim N\left(\sum_ia_i\mu_i, \sum_ia_i^2\sigma_i^2\right).

联合高斯变量即使相关,线性组合仍高斯,方差需协方差项。

6. 对数密度

logf(x)=12log(2π)logσ(xμ)22σ2.\log f(x) =-\frac12\log(2\pi) -\log\sigma -\frac{(x-\mu)^2}{2\sigma^2}.

固定 σ\sigma 时,最大化高斯似然等价于最小化平方误差。若还估计 σ\sigma,不能丢掉 logσ-\log\sigma,否则可通过无意义增大方差减小平方项。

7. MLE

iid 数据:

μ^MLE=xˉ,\hat\mu_{MLE}=\bar x, σ^MLE2=1ni(xixˉ)2.\hat\sigma^2_{MLE} =\frac1n\sum_i(x_i-\bar x)^2.

方差 MLE 对总体方差有偏;无偏估计分母用 n1n-1。MLE 目标和无偏性是不同评价标准。

8. 高斯噪声与最小二乘

回归假设

Y=fθ(X)+ϵ,ϵN(0,σ2).Y=f_\theta(X)+\epsilon, \quad\epsilon\sim N(0,\sigma^2).

条件密度:

p(yx,θ)=N(yfθ(x),σ2).p(y|x,\theta)=N(y|f_\theta(x),\sigma^2).

负对数似然包含平方残差。若误差方差随 xx 变化,可让模型同时预测 μ(x)\mu(x)logσ2(x)\log\sigma^2(x),形成异方差高斯回归。

9. 共轭性

已知方差、均值高斯先验与高斯似然共轭,后验仍高斯。后验精度(方差倒数)等于先验精度与数据精度相加:

τpost=τprior+n/σ2.\tau_{post}=\tau_{prior}+n/\sigma^2.

后验均值是先验均值与样本均值按精度加权平均。未知均值方差的共轭族为 Normal–Inverse-Gamma 等。

10. 高斯最大熵性质

在均值与方差固定的所有连续分布中,高斯具有最大微分熵。它表示只知道前两阶矩时,选择高斯引入的额外结构最少之一。但“最大熵”依约束和连续坐标,不能用来宣称所有噪声都高斯。

11. 正态性诊断

  • histogram/KDE 受 bin/带宽影响;
  • Q–Q 图比较分位数,尾部偏离清楚;
  • Shapiro 等检验大样本时对微小偏离过于敏感;
  • 更重要的是检查推断/预测是否对偏离稳健。

线性回归通常要求条件残差近似满足假设,不要求输入特征本身高斯。

12. 数值计算

尾概率使用 logcdf/logsf,不要用 1-cdf;多个高斯密度相乘在 log 域求和;优化方差用 s=logσ2s=\log\sigma^2 参数化保证正数,并对极端值设合理稳定限制。

易错点

  1. 参数是方差 σ2\sigma^2 还是标准差 σ\sigma 要看记号/API。
  2. 数据均值方差像高斯不证明分布高斯。
  3. 中心极限定理说和/均值近似高斯,不说原数据高斯。
  4. 固定方差时平方误差等价;估计方差时不能丢归一化项。
  5. 输入特征无需高斯,回归误差假设是条件性的。

常见问答

Q1:为什么高斯尾部常低估线上极端延迟?

延迟受排队、重试、共享故障和混合状态影响,常右偏重尾。应建模 log-delay、Gamma/Log-normal、分位数或极值尾部。

Q2:z-score 大于 3 就一定异常吗?

不一定。阈值依分布、样本量、多重比较和业务代价;估计均值方差本身也有不确定性。

Q3:L2 正则与高斯有何联系?

参数高斯先验的负 log 密度是二次项,MAP 对应 L2 惩罚。

练习

  1. XN(2,9)X\sim N(2,9) 的均值、标准差。
  2. Z=(X2)/3Z=(X-2)/3 的分布。
  3. 独立 XN(1,4),YN(2,9)X\sim N(1,4),Y\sim N(2,9),求 X+YX+Y 分布。
  4. 高斯 MLE 方差分母是什么?无偏估计呢?
  5. 为什么异方差高斯损失不能只最小化残差除方差?

答案与提示

  1. 2 与 3。
  2. N(0,1)N(0,1)
  3. N(3,13)N(3,13)
  4. nnn1n-1
  5. 还需 logσ\log\sigma 归一化惩罚,否则模型会把方差任意放大。