多重积分与变量替换
层级:B|按需
1. 多变量概率必须在区域上累积
联合密度 p(x,y) 给二维位置附近的概率密度。事件概率不再是曲线下面积,而是在平面区域上累积;d 维随机向量则在高维区域积分。边缘化、期望、归一化和生成模型变量变换都依赖多重积分。
2. 二重积分
对区域 D⊆R2:
∬Df(x,y)dxdy.
可理解为把区域切成小矩形,累加 f(xi,yj)ΔxΔy。若 D=[a,b]×[c,d]:
∫ab∫cdf(x,y)dydx.
内层先对 y 积分,把 x 暂作常量;再对 x 积分。
3. Fubini 定理与交换顺序
在连续、绝对可积等适当条件下:
∫ab∫cdf(x,y)dy,dx=∫cd∫abf(x,y)dx,dy.
对非矩形区域,交换顺序时上下限必须重新描述区域。概率密度非负时 Tonelli 定理通常允许交换积分,即使需先判断有限性。
4. 联合、边缘与条件密度
联合密度满足
p(x,y)≥0,∬p(x,y)dxdy=1.
边缘化掉 y:
pX(x)=∫p(x,y)dy.
若 pX(x)>0:
p(y∣x)=pX(x)p(x,y).
“积分掉”一个变量表示把它所有可能取值的概率贡献加起来。离散变量对应求和。
5. 多元期望
E[g(X,Y)]=∬g(x,y)p(x,y)dxdy.
特别地
E[X]=∬x,p(x,y)dxdy=∫x,pX(x)dx.
先边缘化再求期望与直接联合积分一致。
6. 独立时的分解
若 X,Y 独立:
p(x,y)=pX(x)pY(y).
对可积分函数乘积:
E[g(X)h(Y)]=E[g(X)]E[h(Y)].
一般相关时不能拆开。
7. 多元变量替换
设可逆光滑变换
y=g(x),
Jacobian 矩阵
Jg(x)=∂x∂y.
局部体积元素变化:
dy=∣detJg(x)∣dx.
因此积分变换为
∫g(D)f(y)dy=∫Df(g(x))∣detJg(x)∣dx.
绝对值去掉取向翻转的符号。
8. 密度变换
若 Y=g(X) 且 g 可逆:
pY(y)=pX(g−1(y))detJg−1(y).
也可写成
pY(g(x))=∣detJg(x)∣pX(x).
直觉:变换把局部体积放大时,同样概率质量摊得更薄,密度降低。
9. 极坐标例子
x=rcosθ,y=rsinθ.
Jacobian 行列式绝对值为 r,所以
dxdy=r,drdθ.
这个额外的 r 不能漏。半径为 R 的圆面积:
∫02π∫0Rr,drdθ=πR2.
高斯积分的经典证明正是转为极坐标。
10. 线性变量变换
若
y=Ax+b
且 A 可逆,Jacobian 为常矩阵 A:
pY(y)=pX(A−1(y−b))∣detA∣−1.
对多元高斯,线性变换后仍为高斯,均值与协方差变为 Aμ+b 和 AΣAT。
11. 不可逆变换
若从高维压到低维,普通方阵 Jacobian 行列式不存在,输出分布可能位于低维流形。需用边缘化、广义换元、Dirac delta 或流形测度等工具。PCA 降维不是普通可逆密度变换;正规化流则特意使用维度相同且可逆的映射。
12. 计算困难与近似
高维积分常遭遇维数灾难:规则网格每维取 k 点需要 kd 个点。机器学习常用:
- Monte Carlo 采样;
- 重要性采样;
- MCMC;
- 变分推断;
- Laplace 近似;
- 可利用因子结构的动态规划/消息传递。
易错点
- 边缘化连续变量用积分,离散变量用求和。
- 交换积分顺序需条件和正确区域边界。
- 多元换元必须乘 Jacobian 行列式绝对值。
- 密度变换使用逆变换 Jacobian或正变换行列式的倒数。
- 降维映射不可直接套可逆变换公式。
常见问答
Q1:为什么边缘化会“丢掉”变量?
它不是随意删除,而是把该变量所有可能状态的联合概率加总,得到剩余变量的完整概率描述。
Q2:Jacobian 行列式为零表示什么?
局部体积被压到零,变换在该点不可局部逆,普通换元公式需谨慎或失效。
Q3:高维 Monte Carlo 为什么反而常用?
其均方误差通常按 1/N 收敛,对维度的显式指数依赖较弱,尽管常数和方差仍可能随维度恶化。
练习
- 若 p(x,y)=1 在单位正方形上,求 P(X<1/2,Y<1/3)。
- 求边缘密度 pX(x)。
- 变换 y=2x 的一维密度为什么包含因子 1/2?
- 极坐标换元为什么出现 r?
- 若 A 把二维面积放大 6 倍,密度局部怎样变化?
答案与提示
- 区域面积 1/6。
- 在 [0,1] 上为 1,其他为 0。
- 逆变换导数为 1/2;长度扩大两倍,密度减半。
- Jacobian 行列式绝对值为 r。
- 在一一映射下密度变为原来的 1/6(在对应点)。