机器学习数学基础 120 章

随机试验、样本空间、事件与概率公理

层级:A|必学

1. 概率在机器学习中描述什么

数据包含噪声、抽样波动和不可观测因素;模型也可能直接输出分布。概率不是“主观猜一个百分比”那么简单,它是一套对不确定事件赋数并保持逻辑一致的数学规则。

2. 随机试验与结果

随机试验满足:

  • 可以在相同条件下概念性重复;
  • 所有可能结果可描述;
  • 实验前不能确定具体结果。

掷骰子一次、抽取一个训练样本、观察下一次请求延迟都可作为随机试验。一次实际发生的基本结果记为 ω\omega

3. 样本空间

所有可能基本结果的集合称样本空间:

Ω={ω:ω 是可能结果}.\Omega=\{\omega:\omega\text{ 是可能结果}\}.

掷骰子:

Ω={1,2,3,4,5,6}.\Omega=\{1,2,3,4,5,6\}.

连续延迟可取

Ω=[0,).\Omega=[0,\infty).

样本空间的粒度由问题决定。抛两枚硬币若关心顺序:

Ω={HH,HT,TH,TT};\Omega=\{HH,HT,TH,TT\};

只记录正面数则可写 {0,1,2}\{0,1,2\},但每个基本结果不再等可能。

4. 事件

事件是样本空间的子集。骰子事件:

A={2,4,6}“出现偶数”.A=\{2,4,6\}\quad\text{“出现偶数”}.

实验结果 ωA\omega\in A 时,称事件 AA 发生。

  • 必然事件:Ω\Omega
  • 不可能事件:\varnothing
  • AcA^cAA 不发生;
  • ABA\cap B:两者同时发生;
  • ABA\cup B:至少一个发生;
  • 互斥:AB=A\cap B=\varnothing

在连续空间中,为避免不可测集合,需要规定事件集合形成 σ\sigma-代数。第一次学习只需知道:并非任意怪异子集都必须能赋概率,常见区间和由它们构造的事件都没有问题。

5. Kolmogorov 三条公理

概率 PP 对事件赋值,满足:

非负性

P(A)0.P(A)\ge0.

归一化

P(Ω)=1.P(\Omega)=1.

可列可加性

A1,A2,A_1,A_2,\ldots 两两互斥:

P(i=1Ai)=i=1P(Ai).P\left(\bigcup_{i=1}^{\infty}A_i\right) =\sum_{i=1}^{\infty}P(A_i).

概率的其他规则都从这三条和集合运算推出。

6. 基本推论

P()=0,P(\varnothing)=0, P(Ac)=1P(A),P(A^c)=1-P(A),

ABA\subseteq B

P(A)P(B),P(A)\le P(B), 0P(A)1.0\le P(A)\le1.

两事件加法公式:

P(AB)=P(A)+P(B)P(AB).P(A\cup B)=P(A)+P(B)-P(A\cap B).

交集被前两项重复计算,所以减去一次。互斥时交集概率为 0,才可直接相加。

7. 概率为零与不可能

离散有限空间中,概率 0 的基本结果通常不可能;连续分布中单点概率可为 0,却仍是可能结果。例如 XU[0,1]X\sim U[0,1]

P(X=0.5)=0,P(X=0.5)=0,

但 0.5 属于样本空间。概率 0 表示在概率测度下“几乎不会”,不等于逻辑不可能。

类似地,概率 1 的事件称几乎必然,不一定包含样本空间每个结果。

8. 频率解释与主观解释

  • 频率学派:概率与无限重复中的长期频率相关;
  • Bayesian 解释:概率也可表示在给定信息下对未知命题的不确定程度。

两者都遵循概率公理,但对参数是否可赋概率、推断如何解释存在差异。机器学习同时使用两种语言,需看模型上下文。

9. 经验概率

重复 nn 次,事件 AA 出现次数为

NA=i=1n1{ωiA}.N_A=\sum_{i=1}^{n}\mathbf1\{\omega_i\in A\}.

经验频率

P^n(A)=NAn.\hat P_n(A)=\frac{N_A}{n}.

在独立同分布等条件下,大数定律说明它随 nn 增大会接近真实概率。有限样本下仍有波动,不能把 70/100 直接当作毫无不确定性的 0.7。

10. 模型概率与数据分布

常写

(X,Y)P.(X,Y)\sim P.

表示样本来自未知联合分布 PP。训练数据通常假设 iid:独立且同分布。但时间、用户群组、推荐曝光和反馈回路常违反该假设。数学结论能否迁移到部署环境取决于抽样机制。

11. 概率空间

严格三元组

(Ω,F,P)(\Omega,\mathcal F,P)

包含样本空间、事件的 σ\sigma-代数和概率测度。随机变量是从 Ω\Omega 到数值空间的可测函数。第一次阅读经典机器学习不需深入测度论证明,但这个结构解释了“随机变量不是随机挑的变量,而是结果的函数”。

易错点

  1. 互斥与独立不同;互斥的非零概率事件反而不独立。
  2. P(AB)P(A\cup B) 要减交集。
  3. 连续情形概率 0 不等于逻辑不可能。
  4. 样本空间粒度改变会改变基本结果是否等可能。
  5. 经验频率不是没有抽样误差的真实概率。

常见问答

Q1:模型输出 0.9 是否表示十次一定对九次?

只有在一组相似预测上校准良好时,长期频率才应约为 90%。单个事件不会“发生 0.9 次”。

Q2:概率是客观还是主观?

取决于统计哲学和模型。两种解释都要求内部遵守概率规则,实践更应明确概率对应的条件与信息。

Q3:iid 假设为什么重要?

它让似然分解、均值收敛和泛化分析简化。违反时仍可建模,但需要群组、时间、因果或依赖结构方法。

练习

  1. 掷骰子,写出“大于 3”与“偶数”事件及交并集。
  2. 求至少一个事件发生的加法公式。
  3. 两事件互斥且概率分别 0.2、0.3,求并集概率。
  4. 为什么连续均匀分布单点概率为 0?
  5. 用指示函数写经验错误率。

答案与提示

  1. A={4,5,6},B={2,4,6}A=\{4,5,6\},B=\{2,4,6\};交 {4,6}\{4,6\},并 {2,4,5,6}\{2,4,5,6\}
  2. P(A)+P(B)P(AB)P(A)+P(B)-P(A\cap B)
  3. 0.5。
  4. 单点区间宽度为零,密度积分为零。
  5. n1i1{f(xi)yi}n^{-1}\sum_i\mathbf1\{f(x_i)\ne y_i\}