机器学习数学基础 120 章

随机变量及离散/连续之别

层级:A|必学

1. 随机变量是函数,不是“自己随机变化的字母”

随机变量把随机试验结果映射成数:

X:ΩR.X:\Omega\to\mathbb R.

大写 XX 表示映射/随机量,小写 xx 常表示一次具体取值。概率作用于事件,如 P(Xx)P(X\le x),而不是把 XX 当普通未知数。

2. 例子

抛两枚硬币,

Ω={HH,HT,TH,TT}.\Omega=\{HH,HT,TH,TT\}.

定义 X=X= 正面个数:

X(HH)=2,X(HT)=X(TH)=1,X(TT)=0.X(HH)=2, \quad X(HT)=X(TH)=1, \quad X(TT)=0.

随机变量把复杂结果压缩成关注的数值。同一样本空间上可定义多个随机变量,如第一枚是否正面、两枚是否相同。

3. 离散随机变量

取值集合有限或可列,如:

  • Bernoulli 标签 Y{0,1}Y\in\{0,1\}
  • 类别 C{1,ldots,K}C\in\{1,ldots,K\}
  • 请求数 N{0,1,2,ldots}N\in\{0,1,2,ldots\}

用概率质量函数(PMF):

pX(x)=P(X=x),xpX(x)=1.p_X(x)=P(X=x), \qquad\sum_xp_X(x)=1.

离散变量单点可有正概率。

4. 连续随机变量

若存在密度 pX(x)p_X(x) 使

P(XA)=ApX(x)dx,P(X\in A)=\int_Ap_X(x)dx,

称绝对连续随机变量。常见:温度、噪声、时间等理想化连续量。

连续变量通常

P(X=x)=0P(X=x)=0

对每个单点成立。密度 pX(x)p_X(x) 不是单点概率,单位是“每单位 x 的概率”。

5. 还有混合与更一般分布

随机变量不一定纯离散或有普通密度。例如:

  • 以概率 0.2 精确为 0,其余为连续正值(零膨胀/截断测量);
  • Cantor 分布既无离散点质量,也无普通密度。

经典机器学习主要用离散、连续和二者混合。不要强迫所有分布都写成普通 PDF。

6. 随机向量

X=(X1,ldots,Xd)T\boldsymbol X=(X_1,ldots,X_d)^T

把每个结果映射到 Rd\mathbb R^d。一条样本的多个特征可视为随机向量;标签与特征组成联合随机对象 (X,Y)(X,Y)

均值向量、协方差矩阵和联合密度描述其分布,但一般均值与协方差不足以唯一决定分布;多元高斯是重要例外。

7. 随机变量的函数

Y=g(X)Y=g(X),则 YY 也随机。例:

  • 平方误差 (YY^)2(Y-\hat Y)^2
  • 指示变量 I=1{X>a}I=\mathbf1\{X>a\}
  • 标准化 Z=(Xμ)/σZ=(X-\mu)/\sigma
  • 最大值 M=maxiXiM=\max_iX_i

要找 YY 的分布,需要 PMF 求和或密度变量变换。期望 E[g(X)]E[g(X)] 常可直接对 XX 分布积分,不必先求 YY 分布。

8. 支持集

分布的支持集是概率质量/密度所在的取值区域。Bernoulli 支持为 {0,1}\{0,1\};指数分布为 [0,)[0,\infty);高斯为整条实线。

支持可能依参数。均匀分布 U(0,θ)U(0,\theta) 的支持依 θ\theta,使一些常规 MLE 微分条件失效。

9. 观测值与随机变量

建模前 XX 是随机变量;观测后得到数据 x1,ldots,xnx_1,ldots,x_n,这些小写数在条件分析中固定。频率统计常把参数固定、数据随机;Bayesian 分析给参数后验分布。阅读推导要判断对什么取期望、什么已条件固定。

10. 离散数据与连续模型

传感器记录有有限精度,严格说观测值离散;仍常用连续模型近似,因为量化间隔相对问题尺度很小。反之,把类别编号当连续高斯变量通常不合理,因为类别间没有自然间距。

11. 随机性来源

  • 数据生成噪声;
  • 从总体抽样;
  • 模型中的隐变量;
  • 训练算法随机初始化/mini-batch/dropout;
  • Bayesian 参数不确定性。

它们可同时存在。预测不确定性常区分 aleatoric(数据本身)与 epistemic(模型/知识不足),但实际分解依模型假设。

易错点

  1. 随机变量是样本空间到数值的函数。
  2. 大写随机变量与小写观测值角色不同。
  3. 连续变量密度不是概率,单点概率通常为 0。
  4. 并非所有分布都有普通 PDF。
  5. 类别编码为整数不等于连续数值变量。

常见问答

Q1:模型参数是随机变量吗?

频率学派通常视为固定未知常数;Bayesian 模型把它赋先验并在数据后得到后验。两种语境都可用,解释不同。

Q2:为什么训练数据观测后还称随机样本?

具体数值已固定,但推断性质考虑“如果从总体重新抽样会怎样”,数据集在重复抽样世界中是随机对象。

Q3:离散与连续能一起建模吗?

可以。混合型联合模型用求和处理离散变量、积分处理连续变量;概率图模型常同时包含两类节点。

练习

  1. 为两枚硬币定义“正面数”随机变量及 PMF。
  2. 连续随机变量为何单点概率可为 0?
  3. 给出一个离散随机变量、连续随机变量和混合变量例子。
  4. I=1{X>a}I=1\{X>a\}II 服从什么类型分布?参数是什么?
  5. 区分随机变量 XX 与观测 xix_i

答案与提示

  1. 取 0,1,2,公平时概率 1/4,1/2,1/41/4,1/2,1/4
  2. 概率是密度在零宽区间的积分。
  3. 自拟;混合例可为退款金额:无退款精确 0,有退款时连续正值。
  4. Bernoulli,参数 P(X>a)P(X>a)
  5. XX 是结果到数的映射/分布对象,xix_i 是一次已观测实现。