随机变量函数与分布变换
层级:B|按需
1. 变换后分布不能只“代入公式”
标准化、平方、指数、最大值和神经网络变换都会把随机变量变成新随机变量。概率质量必须守恒:变换拉伸坐标时密度要降低,折叠多个原像时概率贡献要相加。
2. 离散变量变换
若 Y=g(X):
pY(y)=x:g(x)=y∑pX(x).
若 g 多对一,所有原像概率相加。
例:X∈{−2,−1,0,1,2},Y=X2:
P(Y=1)=P(X=−1)+P(X=1).
不能只选一个平方根。
3. CDF 法
先求
FY(y)=P(g(X)≤y),
再微分得到密度。它适合非单调变换和极值。
例 Y=X2:对 y≥0,
FY(y)=P(−y≤X≤y)=FX(y)−FX(−y).
再求导可得两个原像贡献。
4. 一维单调变换
若 Y=g(X) 严格单调可微、逆为 x=g−1(y):
fY(y)=fX(g−1(y))dydg−1(y).
等价:
fY(g(x))=∣g′(x)∣fX(x).
拉伸倍数 ∣g′∣ 越大,密度越薄。
5. 线性变换
Y=aX+b,quada=0.
逆为 (y−b)/a:
fY(y)=∣a∣1fX(ay−b).
并且
E[Y]=aE[X]+b,Var(Y)=a2Var(X).
若 X∼N(μ,σ2),则 Y∼N(aμ+b,a2σ2)。
6. 标准化
Z=σX−μ,quadσ>0.
则 E[Z]=0,Var(Z)=1。若 X 高斯,Z 是标准高斯;一般分布标准化后并不会变高斯,只改变位置和尺度。
样本标准化使用估计的 xˉ,s,训练数据内部结果不完全等同用真实参数的随机变量变换。
7. 非单调可微变换
若 g(x)=y 有多个原像 xj,且导数非零:
fY(y)=j∑∣g′(xj)∣fX(xj).
对 Y=X2、y>0:
fY(y)=2yfX(y)+fX(−y).
临界点导数为零时密度可能无界,但仍可积。
8. 多元变换
可逆 y=g(x):
pY(y)=pX(g−1(y))detJg−1(y).
线性仿射 Y=AX+b(A 可逆):
pY(y)=pX(A−1(y−b))∣detA∣−1.
均值与协方差:
μY=AμX+b,ΣY=AΣXAT.
9. 概率积分变换
若连续 CDF FX:
U=FX(X)∼U(0,1).
反之 X=F−1(U) 可生成目标分布。它用于采样、校准诊断和 copula。离散情形需随机化或广义逆,不能直接声称严格均匀。
10. 最大值与最小值
iid X1,ldots,Xn,最大值 M:
P(M≤m)=P(X1≤m,ldots,Xn≤m)=F(m)n.
最小值 L:
P(L>l)=[1−F(l)]n.
极值分布用于阈值、多重比较、可靠性与异常最大分数分析。
11. 重参数化技巧
若
X=μ+σϵ,ϵ∼N(0,1),
随机性移到与参数无关的 ϵ。于是对
EX∼pθ[f(X)]
可改写为 Eϵ[f(gθ(ϵ))],通过路径求导。这是变分自编码器的 reparameterization trick。
离散变量通常无法用同样平滑可逆方式,需要 score-function、Gumbel-Softmax 松弛等方法。
易错点
- 密度变换不能只把 x=g−1(y) 代入,还要 Jacobian。
- 多对一变换要把所有原像贡献相加。
- 标准化不会把任意分布变成高斯。
- 绝对值 Jacobian 不能漏。
- 离散概率积分变换不直接连续均匀。
常见问答
Q1:为什么 log-normal 变量总为正?
若 Y=eX,指数输出始终正;其密度由高斯密度和 1/y Jacobian 因子得到。
Q2:BatchNorm 的输出一定标准正态吗?
不是。它在 batch/特征维上近似中心化缩放,未改变分布形状为高斯,且还有可学习仿射参数。
Q3:可逆流为什么要求输入输出同维?
普通 change-of-variables 需要局部可逆方阵 Jacobian;维度变化会产生低维流形或需更一般公式。
练习
- 若 X∼U(0,1),Y=2X+1,求 Y 支持与密度。
- 若 Y=X2,为何要考虑正负两个原像?
- 写出多元仿射变换均值与协方差。
- iid CDF 为 F 的三个样本最大值 CDF 是什么?
- 重参数化技巧解决了什么求导困难?
答案与提示
- 支持 [1,3],密度 1/2。
- 两个不同 X 结果映射到同一正 Y,概率质量都要计入。
- Aμ+b,AΣAT。
- F(m)3。
- 把依赖参数的采样分布改成参数确定变换加固定噪声,使梯度可沿计算图传播。