联合分布、边缘分布与条件分布
层级:A|必学
1. 多个变量如何共同随机
单变量分布不能描述特征之间的依赖。联合分布给出所有变量一起取值的规律;边缘分布忽略其他变量;条件分布在观察部分变量后更新剩余变量。
2. 离散联合 PMF
pX,Y(x,y)=P(X=x,Y=y),
满足
p(x,y)≥0,x∑y∑p(x,y)=1.
可用列联表表示。行和、列和分别给边缘概率。
3. 边缘化
离散:
pX(x)=y∑pX,Y(x,y).
连续:
pX(x)=∫pX,Y(x,y)dy.
“边缘”名称来自列联表边缘的行列和。它把不关心变量的所有可能取值求和/积分掉。
4. 条件分布
离散且 pY(y)>0:
p(x∣y)=pY(y)p(x,y).
连续密度同形:
p(x∣y)=pY(y)p(x,y)
在边缘密度正的点。联合分解:
p(x,y)=p(x∣y)p(y)=p(y∣x)p(x).
5. 联合 CDF
FX,Y(x,y)=P(X≤x,Y≤y).
若足够光滑:
p(x,y)=∂x∂y∂2F(x,y).
联合 CDF 适用于没有普通密度的情形,但实际机器学习推导更常用 PMF/PDF。
6. 独立分解
X,Y 独立当且仅当
p(x,y)=pX(x)pY(y)
(对相应所有点/几乎处处)。此时
p(x∣y)=pX(x).
联合分布等于边缘乘积是比“散点图看起来没关系”严格得多的条件。
7. 混合分布与全概率
离散类别 Z、连续观测 X:
p(x)=z∑p(x,z)=z∑p(x∣z)p(z).
这就是混合模型。后验责任度:
p(z∣x)=∑z′p(x∣z′)p(z′)p(x∣z)p(z).
边缘是各成分密度的加权和,不是密度参数的简单平均。
8. 多变量链式法则
任意联合分布:
p(x1,ldots,xd)=j=1∏dp(xj∣x1,ldots,xj−1).
顺序任意但条件集合随顺序改变。概率图模型通过条件独立删去不必要的条件变量,得到更简洁因子分解。
9. 条件期望预览
条件分布确定后,可以在其中求均值:
E[X∣Y=y]=x∑x,p(x∣y)
或积分。作为 y 的函数,m(Y)=E[X∣Y] 本身是随机变量。回归平方损失下最优预测就是 E[Y∣X=x]。
10. 缺失变量与边缘似然
若完整模型为 p(x,z∣θ),只观察 x:
p(x∣θ)=z∑p(x,z∣θ)
或积分。这不是把 z 设为零或最可能值,而是累积所有可能 z。用最大值替代求和得到不同的近似目标(如 Viterbi/硬 EM)。
11. 边缘相同不表示联合相同
两个模型可有完全相同的 pX,pY,却依赖结构不同。例如二维正态可有同样单变量标准正态边缘,但相关系数不同。只检查每列分布无法验证联合生成质量。
Copula 把边缘分布与依赖结构分开,是更深入的统一工具。
12. 条件分布与部署
监督模型估计 p(y∣x)。若训练和部署的 p(x) 改变但 p(y∣x) 不变(covariate shift),预测条件规律仍可能可用,但评估权重改变;若 p(y∣x) 也变(concept shift),必须更新模型或假设。
易错点
- 边缘化是求和/积分,不是删除列。
- 联合分布不能由边缘分布唯一确定。
- 条件密度分母是边缘密度。
- 独立才可把联合拆为边缘乘积。
- 隐变量未观测时通常要边缘化,不是填最可能值。
常见问答
Q1:为什么生成模型要建 p(x,y)?
它可生成输入与标签、处理缺失/半监督并通过 Bayes 得 p(y∣x),但建模任务更难、假设更多。
Q2:条件分布会改变支持集吗?
会。给定某值后部分组合可能不再可能,支持缩小或形状改变。
Q3:边缘概率似然为何叫 evidence?
它是在模型下观察到数据的总概率,已对参数/隐变量不确定性加权,可用于模型比较。
练习
- 给定联合表,如何求 pX(x)?
- 写出 p(x,y,z) 的两种链式分解顺序。
- 混合模型怎样求 p(x) 与 p(z∣x)?
- 为什么相同边缘不能确定相关性?
- 隐变量是连续时怎样边缘化?
答案与提示
- 固定 x 对所有 y 的联合概率求和。
- 如 p(x)p(y∣x)p(z∣x,y);或 p(z)p(x∣z)p(y∣x,z)。
- 分别加权求和与 Bayes 归一化。
- 依赖结构是额外信息,不同联合表/密度可有相同边缘。
- 对其支持集积分联合密度。