机器学习数学基础 120 章

联合分布、边缘分布与条件分布

层级:A|必学

1. 多个变量如何共同随机

单变量分布不能描述特征之间的依赖。联合分布给出所有变量一起取值的规律;边缘分布忽略其他变量;条件分布在观察部分变量后更新剩余变量。

2. 离散联合 PMF

pX,Y(x,y)=P(X=x,Y=y),p_{X,Y}(x,y)=P(X=x,Y=y),

满足

p(x,y)0,xyp(x,y)=1.p(x,y)\ge0, \qquad\sum_x\sum_yp(x,y)=1.

可用列联表表示。行和、列和分别给边缘概率。

3. 边缘化

离散:

pX(x)=ypX,Y(x,y).p_X(x)=\sum_yp_{X,Y}(x,y).

连续:

pX(x)=pX,Y(x,y)dy.p_X(x)=\int p_{X,Y}(x,y)dy.

“边缘”名称来自列联表边缘的行列和。它把不关心变量的所有可能取值求和/积分掉。

4. 条件分布

离散且 pY(y)>0p_Y(y)>0

p(xy)=p(x,y)pY(y).p(x|y)=\frac{p(x,y)}{p_Y(y)}.

连续密度同形:

p(xy)=p(x,y)pY(y)p(x|y)=\frac{p(x,y)}{p_Y(y)}

在边缘密度正的点。联合分解:

p(x,y)=p(xy)p(y)=p(yx)p(x).p(x,y)=p(x|y)p(y)=p(y|x)p(x).

5. 联合 CDF

FX,Y(x,y)=P(Xx,Yy).F_{X,Y}(x,y)=P(X\le x,Y\le y).

若足够光滑:

p(x,y)=2xyF(x,y).p(x,y)=\frac{\partial^2}{\partial x\partial y}F(x,y).

联合 CDF 适用于没有普通密度的情形,但实际机器学习推导更常用 PMF/PDF。

6. 独立分解

X,YX,Y 独立当且仅当

p(x,y)=pX(x)pY(y)p(x,y)=p_X(x)p_Y(y)

(对相应所有点/几乎处处)。此时

p(xy)=pX(x).p(x|y)=p_X(x).

联合分布等于边缘乘积是比“散点图看起来没关系”严格得多的条件。

7. 混合分布与全概率

离散类别 ZZ、连续观测 XX

p(x)=zp(x,z)=zp(xz)p(z).p(x)=\sum_zp(x,z) =\sum_zp(x|z)p(z).

这就是混合模型。后验责任度:

p(zx)=p(xz)p(z)zp(xz)p(z).p(z|x)=\frac{p(x|z)p(z)} {\sum_{z'}p(x|z')p(z')}.

边缘是各成分密度的加权和,不是密度参数的简单平均。

8. 多变量链式法则

任意联合分布:

p(x1,ldots,xd)=j=1dp(xjx1,ldots,xj1).p(x_1,ldots,x_d) =\prod_{j=1}^{d}p(x_j|x_1,ldots,x_{j-1}).

顺序任意但条件集合随顺序改变。概率图模型通过条件独立删去不必要的条件变量,得到更简洁因子分解。

9. 条件期望预览

条件分布确定后,可以在其中求均值:

E[XY=y]=xx,p(xy)\mathbb E[X|Y=y] =\sum_xx,p(x|y)

或积分。作为 yy 的函数,m(Y)=E[XY]m(Y)=E[X|Y] 本身是随机变量。回归平方损失下最优预测就是 E[YX=x]E[Y|X=x]

10. 缺失变量与边缘似然

若完整模型为 p(x,zθ)p(x,z|\theta),只观察 xx

p(xθ)=zp(x,zθ)p(x|\theta)=\sum_zp(x,z|\theta)

或积分。这不是把 zz 设为零或最可能值,而是累积所有可能 zz。用最大值替代求和得到不同的近似目标(如 Viterbi/硬 EM)。

11. 边缘相同不表示联合相同

两个模型可有完全相同的 pX,pYp_X,p_Y,却依赖结构不同。例如二维正态可有同样单变量标准正态边缘,但相关系数不同。只检查每列分布无法验证联合生成质量。

Copula 把边缘分布与依赖结构分开,是更深入的统一工具。

12. 条件分布与部署

监督模型估计 p(yx)p(y|x)。若训练和部署的 p(x)p(x) 改变但 p(yx)p(y|x) 不变(covariate shift),预测条件规律仍可能可用,但评估权重改变;若 p(yx)p(y|x) 也变(concept shift),必须更新模型或假设。

易错点

  1. 边缘化是求和/积分,不是删除列。
  2. 联合分布不能由边缘分布唯一确定。
  3. 条件密度分母是边缘密度。
  4. 独立才可把联合拆为边缘乘积。
  5. 隐变量未观测时通常要边缘化,不是填最可能值。

常见问答

Q1:为什么生成模型要建 p(x,y)p(x,y)

它可生成输入与标签、处理缺失/半监督并通过 Bayes 得 p(yx)p(y|x),但建模任务更难、假设更多。

Q2:条件分布会改变支持集吗?

会。给定某值后部分组合可能不再可能,支持缩小或形状改变。

Q3:边缘概率似然为何叫 evidence?

它是在模型下观察到数据的总概率,已对参数/隐变量不确定性加权,可用于模型比较。

练习

  1. 给定联合表,如何求 pX(x)p_X(x)
  2. 写出 p(x,y,z)p(x,y,z) 的两种链式分解顺序。
  3. 混合模型怎样求 p(x)p(x)p(zx)p(z|x)
  4. 为什么相同边缘不能确定相关性?
  5. 隐变量是连续时怎样边缘化?

答案与提示

  1. 固定 xx 对所有 yy 的联合概率求和。
  2. p(x)p(yx)p(zx,y)p(x)p(y|x)p(z|x,y);或 p(z)p(xz)p(yx,z)p(z)p(x|z)p(y|x,z)
  3. 分别加权求和与 Bayes 归一化。
  4. 依赖结构是额外信息,不同联合表/密度可有相同边缘。
  5. 对其支持集积分联合密度。