随机变量及离散/连续之别
层级:A|必学
1. 随机变量是函数,不是“自己随机变化的字母”
随机变量把随机试验结果映射成数:
大写 表示映射/随机量,小写 常表示一次具体取值。概率作用于事件,如 ,而不是把 当普通未知数。
2. 例子
抛两枚硬币,
定义 正面个数:
随机变量把复杂结果压缩成关注的数值。同一样本空间上可定义多个随机变量,如第一枚是否正面、两枚是否相同。
3. 离散随机变量
取值集合有限或可列,如:
- Bernoulli 标签 ;
- 类别 ;
- 请求数 。
用概率质量函数(PMF):
离散变量单点可有正概率。
4. 连续随机变量
若存在密度 使
称绝对连续随机变量。常见:温度、噪声、时间等理想化连续量。
连续变量通常
对每个单点成立。密度 不是单点概率,单位是“每单位 x 的概率”。
5. 还有混合与更一般分布
随机变量不一定纯离散或有普通密度。例如:
- 以概率 0.2 精确为 0,其余为连续正值(零膨胀/截断测量);
- Cantor 分布既无离散点质量,也无普通密度。
经典机器学习主要用离散、连续和二者混合。不要强迫所有分布都写成普通 PDF。
6. 随机向量
把每个结果映射到 。一条样本的多个特征可视为随机向量;标签与特征组成联合随机对象 。
均值向量、协方差矩阵和联合密度描述其分布,但一般均值与协方差不足以唯一决定分布;多元高斯是重要例外。
7. 随机变量的函数
若 ,则 也随机。例:
- 平方误差 ;
- 指示变量 ;
- 标准化 ;
- 最大值 。
要找 的分布,需要 PMF 求和或密度变量变换。期望 常可直接对 分布积分,不必先求 分布。
8. 支持集
分布的支持集是概率质量/密度所在的取值区域。Bernoulli 支持为 ;指数分布为 ;高斯为整条实线。
支持可能依参数。均匀分布 的支持依 ,使一些常规 MLE 微分条件失效。
9. 观测值与随机变量
建模前 是随机变量;观测后得到数据 ,这些小写数在条件分析中固定。频率统计常把参数固定、数据随机;Bayesian 分析给参数后验分布。阅读推导要判断对什么取期望、什么已条件固定。
10. 离散数据与连续模型
传感器记录有有限精度,严格说观测值离散;仍常用连续模型近似,因为量化间隔相对问题尺度很小。反之,把类别编号当连续高斯变量通常不合理,因为类别间没有自然间距。
11. 随机性来源
- 数据生成噪声;
- 从总体抽样;
- 模型中的隐变量;
- 训练算法随机初始化/mini-batch/dropout;
- Bayesian 参数不确定性。
它们可同时存在。预测不确定性常区分 aleatoric(数据本身)与 epistemic(模型/知识不足),但实际分解依模型假设。
易错点
- 随机变量是样本空间到数值的函数。
- 大写随机变量与小写观测值角色不同。
- 连续变量密度不是概率,单点概率通常为 0。
- 并非所有分布都有普通 PDF。
- 类别编码为整数不等于连续数值变量。
常见问答
Q1:模型参数是随机变量吗?
频率学派通常视为固定未知常数;Bayesian 模型把它赋先验并在数据后得到后验。两种语境都可用,解释不同。
Q2:为什么训练数据观测后还称随机样本?
具体数值已固定,但推断性质考虑“如果从总体重新抽样会怎样”,数据集在重复抽样世界中是随机对象。
Q3:离散与连续能一起建模吗?
可以。混合型联合模型用求和处理离散变量、积分处理连续变量;概率图模型常同时包含两类节点。
练习
- 为两枚硬币定义“正面数”随机变量及 PMF。
- 连续随机变量为何单点概率可为 0?
- 给出一个离散随机变量、连续随机变量和混合变量例子。
- 若 , 服从什么类型分布?参数是什么?
- 区分随机变量 与观测 。
答案与提示
- 取 0,1,2,公平时概率 。
- 概率是密度在零宽区间的积分。
- 自拟;混合例可为退款金额:无退款精确 0,有退款时连续正值。
- Bernoulli,参数 。
- 是结果到数的映射/分布对象, 是一次已观测实现。