机器学习数学基础 120 章

随机变量函数与分布变换

层级:B|按需

1. 变换后分布不能只“代入公式”

标准化、平方、指数、最大值和神经网络变换都会把随机变量变成新随机变量。概率质量必须守恒:变换拉伸坐标时密度要降低,折叠多个原像时概率贡献要相加。

2. 离散变量变换

Y=g(X)Y=g(X)

pY(y)=x:g(x)=ypX(x).p_Y(y)=\sum_{x:g(x)=y}p_X(x).

gg 多对一,所有原像概率相加。

例:X{2,1,0,1,2}X\in\{-2,-1,0,1,2\}Y=X2Y=X^2

P(Y=1)=P(X=1)+P(X=1).P(Y=1)=P(X=-1)+P(X=1).

不能只选一个平方根。

3. CDF 法

先求

FY(y)=P(g(X)y),F_Y(y)=P(g(X)\le y),

再微分得到密度。它适合非单调变换和极值。

Y=X2Y=X^2:对 y0y\ge0

FY(y)=P(yXy)=FX(y)FX(y).F_Y(y)=P(-\sqrt y\le X\le\sqrt y) =F_X(\sqrt y)-F_X(-\sqrt y).

再求导可得两个原像贡献。

4. 一维单调变换

Y=g(X)Y=g(X) 严格单调可微、逆为 x=g1(y)x=g^{-1}(y)

fY(y)=fX(g1(y))ddyg1(y).f_Y(y)=f_X(g^{-1}(y)) \left|\frac{d}{dy}g^{-1}(y)\right|.

等价:

fY(g(x))=fX(x)g(x).f_Y(g(x))=\frac{f_X(x)}{|g'(x)|}.

拉伸倍数 g|g'| 越大,密度越薄。

5. 线性变换

Y=aX+b,quada0.Y=aX+b,quad a\ne0.

逆为 (yb)/a(y-b)/a

fY(y)=1afX(yba).f_Y(y)=\frac1{|a|}f_X\left(\frac{y-b}{a}\right).

并且

E[Y]=aE[X]+b,Var(Y)=a2Var(X).E[Y]=aE[X]+b, \qquad Var(Y)=a^2Var(X).

XN(μ,σ2)X\sim\mathcal N(\mu,\sigma^2),则 YN(aμ+b,a2σ2)Y\sim\mathcal N(a\mu+b,a^2\sigma^2)

6. 标准化

Z=Xμσ,quadσ>0.Z=\frac{X-\mu}{\sigma},quad\sigma>0.

E[Z]=0,Var(Z)=1E[Z]=0,Var(Z)=1。若 XX 高斯,ZZ 是标准高斯;一般分布标准化后并不会变高斯,只改变位置和尺度。

样本标准化使用估计的 xˉ,s\bar x,s,训练数据内部结果不完全等同用真实参数的随机变量变换。

7. 非单调可微变换

g(x)=yg(x)=y 有多个原像 xjx_j,且导数非零:

fY(y)=jfX(xj)g(xj).f_Y(y)=\sum_j \frac{f_X(x_j)}{|g'(x_j)|}.

Y=X2Y=X^2y>0y>0

fY(y)=fX(y)+fX(y)2y.f_Y(y)=\frac{f_X(\sqrt y)+f_X(-\sqrt y)}{2\sqrt y}.

临界点导数为零时密度可能无界,但仍可积。

8. 多元变换

可逆 y=g(x)y=g(x)

pY(y)=pX(g1(y))detJg1(y).p_Y(y)=p_X(g^{-1}(y)) \left|\det J_{g^{-1}}(y)\right|.

线性仿射 Y=AX+bY=AX+bAA 可逆):

pY(y)=pX(A1(yb))detA1.p_Y(y)=p_X(A^{-1}(y-b))|\det A|^{-1}.

均值与协方差:

μY=AμX+b,ΣY=AΣXAT.\mu_Y=A\mu_X+b, \qquad\Sigma_Y=A\Sigma_XA^T.

9. 概率积分变换

若连续 CDF FXF_X

U=FX(X)U(0,1).U=F_X(X)\sim U(0,1).

反之 X=F1(U)X=F^{-1}(U) 可生成目标分布。它用于采样、校准诊断和 copula。离散情形需随机化或广义逆,不能直接声称严格均匀。

10. 最大值与最小值

iid X1,ldots,XnX_1,ldots,X_n,最大值 MM

P(Mm)=P(X1m,ldots,Xnm)=F(m)n.P(M\le m)=P(X_1\le m,ldots,X_n\le m) =F(m)^n.

最小值 LL

P(L>l)=[1F(l)]n.P(L>l)=[1-F(l)]^n.

极值分布用于阈值、多重比较、可靠性与异常最大分数分析。

11. 重参数化技巧

X=μ+σϵ,ϵN(0,1),X=\mu+\sigma\epsilon, \quad\epsilon\sim\mathcal N(0,1),

随机性移到与参数无关的 ϵ\epsilon。于是对

EXpθ[f(X)]E_{X\sim p_\theta}[f(X)]

可改写为 Eϵ[f(gθ(ϵ))]E_\epsilon[f(g_\theta(\epsilon))],通过路径求导。这是变分自编码器的 reparameterization trick。

离散变量通常无法用同样平滑可逆方式,需要 score-function、Gumbel-Softmax 松弛等方法。

易错点

  1. 密度变换不能只把 x=g1(y)x=g^{-1}(y) 代入,还要 Jacobian。
  2. 多对一变换要把所有原像贡献相加。
  3. 标准化不会把任意分布变成高斯。
  4. 绝对值 Jacobian 不能漏。
  5. 离散概率积分变换不直接连续均匀。

常见问答

Q1:为什么 log-normal 变量总为正?

Y=eXY=e^X,指数输出始终正;其密度由高斯密度和 1/y1/y Jacobian 因子得到。

Q2:BatchNorm 的输出一定标准正态吗?

不是。它在 batch/特征维上近似中心化缩放,未改变分布形状为高斯,且还有可学习仿射参数。

Q3:可逆流为什么要求输入输出同维?

普通 change-of-variables 需要局部可逆方阵 Jacobian;维度变化会产生低维流形或需更一般公式。

练习

  1. XU(0,1),Y=2X+1X\sim U(0,1),Y=2X+1,求 YY 支持与密度。
  2. Y=X2Y=X^2,为何要考虑正负两个原像?
  3. 写出多元仿射变换均值与协方差。
  4. iid CDF 为 FF 的三个样本最大值 CDF 是什么?
  5. 重参数化技巧解决了什么求导困难?

答案与提示

  1. 支持 [1,3][1,3],密度 1/21/2
  2. 两个不同 XX 结果映射到同一正 YY,概率质量都要计入。
  3. Aμ+b,AΣATA\mu+b,A\Sigma A^T
  4. F(m)3F(m)^3
  5. 把依赖参数的采样分布改成参数确定变换加固定噪声,使梯度可沿计算图传播。