机器学习数学基础 120 章

多重积分与变量替换

层级:B|按需

1. 多变量概率必须在区域上累积

联合密度 p(x,y)p(x,y) 给二维位置附近的概率密度。事件概率不再是曲线下面积,而是在平面区域上累积;dd 维随机向量则在高维区域积分。边缘化、期望、归一化和生成模型变量变换都依赖多重积分。

2. 二重积分

对区域 DR2D\subseteq\mathbb R^2

Df(x,y)dxdy.\iint_D f(x,y)\,dx\,dy.

可理解为把区域切成小矩形,累加 f(xi,yj)ΔxΔyf(x_i,y_j)\Delta x\Delta y。若 D=[a,b]×[c,d]D=[a,b]\times[c,d]

abcdf(x,y)dydx.\int_a^b\int_c^df(x,y)\,dy\,dx.

内层先对 yy 积分,把 xx 暂作常量;再对 xx 积分。

3. Fubini 定理与交换顺序

在连续、绝对可积等适当条件下:

abcdf(x,y)dy,dx=cdabf(x,y)dx,dy.\int_a^b\int_c^df(x,y)dy,dx =\int_c^d\int_a^bf(x,y)dx,dy.

对非矩形区域,交换顺序时上下限必须重新描述区域。概率密度非负时 Tonelli 定理通常允许交换积分,即使需先判断有限性。

4. 联合、边缘与条件密度

联合密度满足

p(x,y)0,p(x,y)dxdy=1.p(x,y)\ge0, \qquad \iint p(x,y)dxdy=1.

边缘化掉 yy

pX(x)=p(x,y)dy.p_X(x)=\int p(x,y)dy.

pX(x)>0p_X(x)>0

p(yx)=p(x,y)pX(x).p(y\mid x)=\frac{p(x,y)}{p_X(x)}.

“积分掉”一个变量表示把它所有可能取值的概率贡献加起来。离散变量对应求和。

5. 多元期望

E[g(X,Y)]=g(x,y)p(x,y)dxdy.\mathbb E[g(X,Y)] =\iint g(x,y)p(x,y)dxdy.

特别地

E[X]=x,p(x,y)dxdy=x,pX(x)dx.\mathbb E[X]=\iint x,p(x,y)dxdy =\int x,p_X(x)dx.

先边缘化再求期望与直接联合积分一致。

6. 独立时的分解

X,YX,Y 独立:

p(x,y)=pX(x)pY(y).p(x,y)=p_X(x)p_Y(y).

对可积分函数乘积:

E[g(X)h(Y)]=E[g(X)]E[h(Y)].\mathbb E[g(X)h(Y)] =\mathbb E[g(X)]\mathbb E[h(Y)].

一般相关时不能拆开。

7. 多元变量替换

设可逆光滑变换

y=g(x),y=g(x),

Jacobian 矩阵

Jg(x)=yx.J_g(x)=\frac{\partial y}{\partial x}.

局部体积元素变化:

dy=detJg(x)dx.dy=|\det J_g(x)|dx.

因此积分变换为

g(D)f(y)dy=Df(g(x))detJg(x)dx.\int_{g(D)}f(y)dy =\int_Df(g(x))|\det J_g(x)|dx.

绝对值去掉取向翻转的符号。

8. 密度变换

Y=g(X)Y=g(X)gg 可逆:

pY(y)=pX(g1(y))detJg1(y).p_Y(y)=p_X(g^{-1}(y)) \left|\det J_{g^{-1}}(y)\right|.

也可写成

pY(g(x))=pX(x)detJg(x).p_Y(g(x))=\frac{p_X(x)}{|\det J_g(x)|}.

直觉:变换把局部体积放大时,同样概率质量摊得更薄,密度降低。

9. 极坐标例子

x=rcosθ,y=rsinθ.x=r\cos\theta, \qquad y=r\sin\theta.

Jacobian 行列式绝对值为 rr,所以

dxdy=r,drdθ.dxdy=r,drd\theta.

这个额外的 rr 不能漏。半径为 RR 的圆面积:

02π0Rr,drdθ=πR2.\int_0^{2\pi}\int_0^Rr,drd\theta=\pi R^2.

高斯积分的经典证明正是转为极坐标。

10. 线性变量变换

y=Ax+by=Ax+b

AA 可逆,Jacobian 为常矩阵 AA

pY(y)=pX(A1(yb))detA1.p_Y(y)=p_X(A^{-1}(y-b))|\det A|^{-1}.

对多元高斯,线性变换后仍为高斯,均值与协方差变为 Aμ+bA\mu+bAΣATA\Sigma A^T

11. 不可逆变换

若从高维压到低维,普通方阵 Jacobian 行列式不存在,输出分布可能位于低维流形。需用边缘化、广义换元、Dirac delta 或流形测度等工具。PCA 降维不是普通可逆密度变换;正规化流则特意使用维度相同且可逆的映射。

12. 计算困难与近似

高维积分常遭遇维数灾难:规则网格每维取 kk 点需要 kdk^d 个点。机器学习常用:

  • Monte Carlo 采样;
  • 重要性采样;
  • MCMC;
  • 变分推断;
  • Laplace 近似;
  • 可利用因子结构的动态规划/消息传递。

易错点

  1. 边缘化连续变量用积分,离散变量用求和。
  2. 交换积分顺序需条件和正确区域边界。
  3. 多元换元必须乘 Jacobian 行列式绝对值。
  4. 密度变换使用逆变换 Jacobian或正变换行列式的倒数。
  5. 降维映射不可直接套可逆变换公式。

常见问答

Q1:为什么边缘化会“丢掉”变量?

它不是随意删除,而是把该变量所有可能状态的联合概率加总,得到剩余变量的完整概率描述。

Q2:Jacobian 行列式为零表示什么?

局部体积被压到零,变换在该点不可局部逆,普通换元公式需谨慎或失效。

Q3:高维 Monte Carlo 为什么反而常用?

其均方误差通常按 1/N1/\sqrt N 收敛,对维度的显式指数依赖较弱,尽管常数和方差仍可能随维度恶化。

练习

  1. p(x,y)=1p(x,y)=1 在单位正方形上,求 P(X<1/2,Y<1/3)P(X<1/2,Y<1/3)
  2. 求边缘密度 pX(x)p_X(x)
  3. 变换 y=2xy=2x 的一维密度为什么包含因子 1/21/2
  4. 极坐标换元为什么出现 rr
  5. AA 把二维面积放大 6 倍,密度局部怎样变化?

答案与提示

  1. 区域面积 1/61/6
  2. [0,1][0,1] 上为 1,其他为 0。
  3. 逆变换导数为 1/21/2;长度扩大两倍,密度减半。
  4. Jacobian 行列式绝对值为 rr
  5. 在一一映射下密度变为原来的 1/61/6(在对应点)。