条件概率与乘法公式
层级:A|必学
1. 条件就是信息更新
P(A) 表示尚未知道 B 时对 A 的概率;P(A∣B) 表示已经知道 B 发生后,在缩小的可能世界中重新计算 A。分类模型输出的通常正是条件概率 P(Y∣X=x)。
2. 定义
若 P(B)>0:
P(A∣B)=P(B)P(A∩B).
分母把样本空间从 Ω 缩小到 B,分子保留其中同时属于 A 的部分。
例:一副 52 张牌,已知抽到红牌,抽到红桃的条件概率:
P(heart∣red)=26/5213/52=21.
3. 条件方向不能交换
P(A∣B)=P(B∣A)
一般成立。医学检测中:
- P(+∣D) 是患病者测阳性的灵敏度;
- P(D∣+) 是阳性者真正患病的后验概率。
后者还取决于患病基准率,不能只看检测准确性。
4. 乘法公式
由定义:
P(A∩B)=P(A∣B)P(B)=P(B∣A)P(A).
这把联合概率分解为“先发生一个,再在其条件下发生另一个”。
多事件链式法则:
P(A1,…,An)=P(A1)i=2∏nP(Ai∣A1,…,Ai−1).
它永远成立(条件概率有定义时),不需要独立假设。
5. 条件概率仍是概率
固定 B 后,P(⋅∣B) 对事件 A 满足概率公理:非负、P(Ω∣B)=1、对互斥事件可加。所以可在条件世界里继续使用补集和加法公式:
P(Ac∣B)=1−P(A∣B).
6. 条件概率树
按顺序画分支:每条边是条件概率,一条完整路径的联合概率是边概率乘积;多个互斥路径通向同一事件时相加。
例如用户是否来自移动端 M,是否点击 C:
P(M∩C)=P(M)P(C∣M).
总点击概率是移动端点击路径与非移动端点击路径之和,这将导出全概率公式。
7. 连续变量的条件密度
若联合密度 p(x,y),且边缘密度 pX(x)>0:
p(y∣x)=pX(x)p(x,y).
注意 P(X=x)=0 对连续变量通常成立,但条件密度仍可通过正规条件分布定义。初等公式用密度而非单点事件概率。
8. 条件化会改变关系
两个变量总体相关,给定第三变量后可能独立;总体独立,条件化某个共同结果后也可能相关(collider bias)。
例:两个独立硬币 X,Y,给定“至少一个正面”后,它们不再独立:知道第一枚是反面,第二枚必为正面。条件化不是简单过滤,它重塑样本空间。
9. 条件似然与监督学习
判别模型直接建模
pθ(y∣x).
训练条件对数似然:
i∑logpθ(yi∣xi).
它把输入 xi 视为已知条件,不要求建模 p(x)。生成分类器则建模 p(x∣y) 与 p(y),再通过 Bayes 公式得到后验。
10. 序列模型链式分解
任意序列联合分布:
p(x1,ldots,xT)=t=1∏Tp(xt∣x<t).
自回归语言模型正建模每个 token 在过去 token 条件下的概率。分解本身无独立假设;限制条件上下文才引入模型假设。
11. 数据筛选与选择偏差
只分析“被系统展示”“通过审核”“仍留存”的样本,相当于条件化选择事件。若选择同时受特征与结果影响,条件数据中的关系可能与总体完全不同。训练/部署条件不一致会导致 selection bias。
易错点
- P(A∣B) 与 P(B∣A) 不能交换。
- 链式法则不需要独立;独立只让条件项简化。
- 条件化可能制造或消除相关。
- 连续变量的条件分布不能机械除以单点概率 0,要用密度/正规条件概率。
- 过滤数据等于条件化,可能产生选择偏差。
常见问答
Q1:P(A∣B)>P(A) 表示什么?
观察到 B 提高了 A 的概率,称正关联;不代表 B 因果导致 A。
Q2:条件概率可以大于 1 吗?
事件条件概率不能,仍在 [0,1];条件密度值可以大于 1。
Q3:交叉熵为什么是条件似然?
监督分类对每个已知输入最大化真实标签的 pθ(yi∣xi);负对数后就是常见交叉熵。
练习
- P(A∩B)=0.2,P(B)=0.5,求 P(A∣B)。
- P(A)=0.4,P(B∣A)=0.3,求交集概率。
- 写出三个事件联合概率的链式分解。
- 解释为什么给定“至少一枚正面”后两枚独立硬币不独立。
- 写出自回归序列联合分布。
答案与提示
- 0.4。
- 0.12。
- P(A)P(B∣A)P(C∣A,B)。
- 条件下若第一枚反面,第二枚正面概率为 1,而其边缘条件概率不是 1。
- ∏tp(xt∣x<t)。