条件期望、全期望与全方差公式
层级:B|按需
1. 在已知信息下重新取平均
条件期望 E[X∣Y] 是给定 Y 信息后对 X 的最佳均方预测。它不仅是一个数,而通常是 Y 的函数。回归函数、缺失值估计、偏差—方差与层级模型都依赖它。
2. 给定具体值的条件期望
离散:
E[X∣Y=y]=x∑x,p(x∣y).
连续:
E[X∣Y=y]=∫x,p(x∣y)dx.
对每个 y 得到一个数,合成函数
m(y)=E[X∣Y=y].
代入随机变量 Y 得 m(Y)=E[X∣Y],本身仍是随机变量。
3. 条件期望的性质
E[aX+bZ∣Y]=aE[X∣Y]+bE[Z∣Y].
若 g(Y) 只依赖已知条件:
E[g(Y)X∣Y]=g(Y)E[X∣Y].
若 X 与 Y 独立:
E[X∣Y]=E[X].
条件期望保留已知变量函数不变:E[g(Y)∣Y]=g(Y)。
4. 全期望公式(塔式法则)
E[E[X∣Y]]=E[X].
离散证明:
y∑E[X∣Y=y]p(y)=y∑x∑x,p(x∣y)p(y)=x∑x,p(x).
更一般,若信息层级 G⊆H:
E[E[X∣H]∣G]=E[X∣G].
先用更多信息预测,再忘掉一部分,等于直接只用较少信息预测。
5. 回归函数
平方损失下,对固定 x 选择预测 a:
E[(Y−a)2∣X=x].
分解:
E[(Y−a)2∣X]=Var(Y∣X)+(E[Y∣X]−a)2.
第一项与 a 无关,所以最优
f∗(x)=E[Y∣X=x].
绝对损失下最优是条件中位数;0-1 分类下最优是后验概率最大的类别。
6. 条件方差
Var(X∣Y)=E[(X−E[X∣Y])2∣Y].
它也是 Y 的函数,描述给定信息后仍剩多少不确定性。异方差回归中,Var(Y∣X=x) 随 x 改变。
7. 全方差公式
Var(X)=E[Var(X∣Y)]+Var(E[X∣Y]).
解释:
- 组内平均方差:给定 Y 后仍有的随机性;
- 组间方差:不同 Y 条件均值的变化。
总不确定性 = 平均不可解释不确定性 + 被 Y 解释的均值变化。
8. 推导全方差
利用 Var(X)=E[X2]−E[X]2:
E[Var(X∣Y)]=E[E[X2∣Y]−E[X∣Y]2]=E[X2]−E[E[X∣Y]2],
Var(E[X∣Y])=E[E[X∣Y]2]−E[X]2.
相加中间项抵消。
9. 混合模型例子
类别 Z,X∣Z=k 均值 μk、方差 σk2,权重 πk:
E[X]=k∑πkμk,
Var(X)=k∑πkσk2+k∑πk(μk−E[X])2.
混合分布方差不仅是各分量方差加权平均,还包含分量均值之间的差异。
10. Rao–Blackwell 直觉
对某估计量 T,用充分信息 S 条件化:
T∗=E[T∣S].
在合适条件下,保持期望不变且方差不增。条件期望通过“平均掉无关随机性”得到更稳定估计,是 Rao–Blackwell 定理的核心。
11. 缺失值预测
平方误差下用 E[Xmiss∣Xobs] 是最优点预测,但直接填条件均值会低估不确定性、破坏变量关系。多重插补从条件分布采样多份数据,传播缺失不确定性。
12. 条件期望与信息
加入更多信息通常不能增加最小均方预测误差。若 G⊆H:
E[(X−E[X∣H])2]≤E[(X−E[X∣G])2].
但有限数据估计更复杂函数会增加估计误差,所以实际模型添加特征仍可能过拟合。
易错点
- E[X∣Y] 通常是随机变量,不是固定常数。
- 全期望是对条件期望再按 Y 分布平均。
- 总方差不能只平均条件方差,还要加条件均值方差。
- 平方损失最优是条件均值,其他损失可能不同。
- 条件均值填补会低估方差。
常见问答
Q1:给更多特征为什么理论误差不增,实际却可能变差?
Bayes 最优在真实分布已知时不增;有限样本估计会增加方差、优化与分布偏移风险。
Q2:E[X∣Y]=E[X] 是否说明独立?
不一定,只说明条件均值不变,分布高阶形态仍可能依赖 Y。独立要求整个条件分布不变。
Q3:全方差与 ANOVA 有何关系?
都是把总变异分解为组内与组间部分;样本 ANOVA 是相应有限样本平方和分解。
练习
- 写出离散条件期望公式。
- 证明全期望公式。
- 混合两类权重各 1/2,均值 -1、1,类内方差均 2,求总方差。
- 平方损失为何选择条件均值?
- 若 X,Y 独立,E[X∣Y] 是什么?
答案与提示
- ∑xxp(x∣y)。
- 展开联合概率并交换求和。
- 组内 2,组间 1,总 3。
- 分解为条件方差加 (E[Y∣X]−a)2。
- E[X]。