隐变量、混合模型与 EM 的统计解释
层级:B|按需
1. 观测分布可能由未观测亚群体混合
用户行为可能来自不同意图,延迟来自缓存命中/未命中,图像像素来自不同对象。隐变量 表示未观测状态,联合模型容易描述,但边缘似然含求和/积分。
2. 隐变量模型
只观察 :
或连续 积分。后验
推断哪个隐状态解释观测。
隐变量是模型构造,不一定对应唯一真实实体。
3. 有限混合模型
生成过程:先 ,再 。边缘密度是成分密度加权和,可多峰。
4. GMM
参数量随 快速增长:全协方差每类约 。小样本高维常用对角、球形、共享或低秩结构。
5. Complete vs observed likelihood
若知道 one-hot:
参数更新易做。实际 未知,observed likelihood:
log-sum 难直接分离。EM 用 代替未知指示的软期望。
6. 责任度
是当前模型下后验,不是客观标签概率。各类密度、先验和模型错设都会影响。
数值上计算 log score
再用 LogSumExp 归一化。
7. EM 的统计意义
E 步计算完整数据充分统计量的条件期望;M 步仿佛拥有带分数计数的完整数据,最大化期望 complete log-likelihood。
对 GMM:
8. 标签交换与不可辨识
交换两个成分编号,边缘分布完全相同,因此似然有 个等价参数表示。Bayesian 后验会 label switching,不能直接平均未对齐的成分均值。
还有成分重叠、过多成分与参数退化造成更深不可辨识。
9. 似然奇异性
一个高斯中心对准单点、协方差行列式趋 0,密度和似然可趋无穷。因此 GMM 普通 MLE 可能不存在有限全局最大。实践:
- covariance floor/jitter;
- MAP/先验;
- 限制最小簇权重;
- tied/diagonal covariance;
- 删除退化成分。
这不是优化器 bug,而是模型似然结构。
10. 选择成分数
- 独立验证 log-likelihood;
- AIC/BIC;
- held-out predictive density;
- Bayesian nonparametric 模型;
- 聚类稳定性与业务可解释。
BIC 依正则渐近,而混合模型常非正则,仍常作启发式。轮廓系数等距离聚类指标与概率似然衡量不同。
11. 混合与卷积不同
混合:先随机选一个成分,密度加权相加;卷积:多个独立随机量相加。混合方差包含组内与组间;卷积方差(独立)是方差相加。
12. 硬聚类与软聚类
GMM responsibility 提供软成员;取 argmax 得硬标签但丢不确定性。k-means 可看作等球形、相同小方差 GMM 的极限;其目标不含混合权重/协方差概率解释。
13. 缺失数据
高斯模型下可把缺失分量纳入隐变量,E 步用条件高斯计算期望充分统计量。简单均值填补忽略后验不确定性;EM 仍依 MAR 等缺失机制假设。
14. 其他隐变量模型
- factor analysis/PPCA:连续低维隐因子;
- HMM:序列离散状态;
- topic model:文档主题比例;
- VAE:神经生成模型与变分后验;
- item response:能力隐变量。
共同结构是联合模型 + 边缘化 + 后验推断。
易错点
- 混合成分不必对应真实类别。
- EM 单调不保证全局最优。
- GMM 似然可因协方差塌缩无界。
- 成分标签不可辨识。
- 软责任度依模型,不是无模型真相。
常见问答
Q1:GMM 能自动发现任意形状簇吗?
单成分是椭圆,多成分可逼近复杂形状,但一个业务簇可能需多个成分;成分数与簇数不必相同。
Q2:为什么多初始化?
似然非凸,有多个局部极值与退化区域;不同初始责任/中心会到不同解。
Q3:EM 何时停止?
监控观测 log-likelihood 相对变化、参数变化和最大迭代;应确保稳定计算下似然不降,并检查退化。
练习
- 写出有限混合密度与责任度。
- 为什么 complete likelihood 易优化?
- GMM 标签交换说明什么?
- 协方差塌缩为何使似然无界?
- 混合与卷积区别?
答案与提示
- 加权和与 Bayes 归一化公式。
- 已知成分指示后 log-likelihood 对成分分离为加权和。
- 参数不可辨识,有多个等价表示。
- 高斯归一化因子 趋无穷,单点残差可为零。
- 混合随机选一个来源,卷积把多个随机量相加。