机器学习数学基础 120 章

数学期望与期望的运算

层级:A|必学

1. 期望是概率加权的长期平均

机器学习中的风险、均方误差、交叉熵、偏差—方差和 Monte Carlo 估计都以期望为中心。期望不是“最可能值”,也不一定是一个可能取到的值;它是分布整体的加权中心。

2. 离散期望

XX 取值 xx,PMF 为 p(x)p(x)

E[X]=xx,p(x),\mathbb E[X]=\sum_xx,p(x),

前提是相应和绝对收敛或期望有定义。

公平骰子:

E[X]=1+2+3+4+5+66=3.5.E[X]=\frac{1+2+3+4+5+6}{6}=3.5.

骰子不可能掷出 3.5,但它是长期平均。

3. 连续期望

密度 p(x)p(x)

E[X]=x,p(x)dx.\mathbb E[X]=\int_{-\infty}^{\infty}x,p(x)dx.

例如 U(a,b)U(a,b)

E[X]=a+b2.E[X]=\frac{a+b}{2}.

有些重尾分布总概率为 1,却期望不存在或发散,例如标准 Cauchy 分布。不能假设每个随机变量都有有限均值。

4. 随机变量函数的期望(LOTUS)

无需先求 Y=g(X)Y=g(X) 的分布:

E[g(X)]=xg(x)pX(x)\mathbb E[g(X)] =\sum_xg(x)p_X(x)

E[g(X)]=g(x)pX(x)dx.\mathbb E[g(X)] =\int g(x)p_X(x)dx.

多变量:

E[g(X,Y)]=g(x,y)p(x,y)dxdy.E[g(X,Y)]=\iint g(x,y)p(x,y)dxdy.

损失风险 E[(f(X),Y)]E[\ell(f(X),Y)] 就是这个形式。

5. 期望的线性性

对常数 ai,ba_i,b

E[iaiXi+b]=iaiE[Xi]+b.E\left[\sum_i a_iX_i+b\right] =\sum_i a_iE[X_i]+b.

不要求 XiX_i 独立。它是最重要、最常被低估的性质。

例:nn 个事件发生总数

N=i1{Ai}.N=\sum_i\mathbf1\{A_i\}.

即使事件依赖:

E[N]=iP(Ai).E[N]=\sum_iP(A_i).

6. 乘积期望

一般

E[XY]E[X]E[Y].E[XY]\ne E[X]E[Y].

X,YX,Y 独立且期望存在,才可分解:

E[XY]=E[X]E[Y].E[XY]=E[X]E[Y].

零协方差也给同一等式,但不必独立。对非线性 gg,通常

E[g(X)]g(E[X]).E[g(X)]\ne g(E[X]).

Jensen 不等式给凸/凹时的方向。

7. 指示变量技巧

E[1{A}]=P(A).E[\mathbf1\{A\}]=P(A).

因为指示变量取 1 的概率为 P(A)P(A)。许多计数的期望可以拆为指示变量和,而无需计算完整分布。

分类 0-1 风险:

R(f)=E[1{f(X)Y}]=P(f(X)Y).R(f)=E[\mathbf1\{f(X)\ne Y\}] =P(f(X)\ne Y).

8. 样本均值的期望

XiX_i 同均值 μ\mu

Xˉ=1niXi,\bar X=\frac1n\sum_iX_i, E[Xˉ]=1niE[Xi]=μ.E[\bar X]=\frac1n\sum_iE[X_i]=\mu.

这不要求独立,只要求同均值;独立性主要影响方差和集中程度。

9. 向量与矩阵期望

对随机向量逐分量取期望:

E[X]=(E[X1],,E[Xd])T.E[\boldsymbol X] =(E[X_1],\ldots,E[X_d])^T.

线性变换:

E[AX+b]=AE[X]+b.E[A\boldsymbol X+b]=AE[\boldsymbol X]+b.

矩阵随机变量也逐元素取期望。常量矩阵可移出期望,但随机量乘积不能随意拆。

10. 期望风险与经验风险

R(θ)=E(X,Y)P[θ(X,Y)].R(\theta)=E_{(X,Y)\sim P}[\ell_\theta(X,Y)].

未知 PP 使它无法精确计算。经验风险

R^n(θ)=1niθ(xi,yi)\hat R_n(\theta)=\frac1n\sum_i\ell_\theta(x_i,y_i)

是 Monte Carlo/样本平均估计。对固定 θ\theta、iid 数据,它通常无偏:

ED[R^n(θ)]=R(θ).E_D[\hat R_n(\theta)]=R(\theta).

但用同一数据选择 θ^\hat\theta 后,训练风险对所选模型通常乐观,不能简单套固定参数无偏性。

11. 交换期望与求导

在适当条件下:

θE[(θ;X)]=E[θ(θ;X)].\nabla_\theta E[\ell(\theta;X)] =E[\nabla_\theta\ell(\theta;X)].

mini-batch 梯度因此估计总体/全量梯度。条件包括可微性与支配可积等;极端重尾、支持依参数或不连续时要谨慎。

12. 尾和公式

对非负整数随机变量:

E[X]=k=1P(Xk).E[X]=\sum_{k=1}^{\infty}P(X\ge k).

它把期望写成尾概率之和,常用于等待时间和算法运行步数分析。

易错点

  1. 期望不一定是可取值,也不等于众数。
  2. 期望线性不需要独立。
  3. 乘积期望分解通常需要独立/零协方差条件。
  4. E[g(X)]E[g(X)] 一般不等于 g(E[X])g(E[X])
  5. 某些重尾分布期望不存在。

常见问答

Q1:均值为什么对离群值敏感?

观测值线性进入平均,极端值贡献不受界;中位数只依排序,更稳健。

Q2:期望概率损失可以用一个 batch 精确得到吗?

不能,只是随机估计;batch 越大通常方差越小,但数据代表性也关键。

Q3:训练损失是否是总体风险的无偏估计?

对预先固定模型可近似无偏;模型由同一训练集选择后,训练损失有选择乐观偏差。

练习

  1. 求 Bernoulli(pp) 的期望。
  2. 公平骰子的平方期望 E[X2]E[X^2] 是多少?
  3. 证明样本均值期望为总体均值。
  4. 事件发生数 N=i1{Ai}N=\sum_i1\{A_i\} 的期望是什么?
  5. 给出 E[g(X)]g(E[X])E[g(X)]\ne g(E[X]) 的例子。

答案与提示

  1. pp
  2. (1+4+9+16+25+36)/6=91/6(1+4+9+16+25+36)/6=91/6
  3. 用期望线性性。
  4. iP(Ai)\sum_iP(A_i),不要求独立。
  5. 非退化 XXg(x)=x2g(x)=x^2,差为方差。