总体、样本、统计量与经验分布
层级:A|必学
1. 从概率模型到数据推断
概率论常假设分布 已知,问随机结果如何;统计学观察有限样本,反推未知分布或参数。机器学习训练就是用样本选择预测函数,并量化它对未来数据的可靠程度。
2. 总体
总体可以指:
- 有限对象集合,如某日全部订单;
- 概念上的数据生成分布 ,如未来同类用户请求。
总体参数是固定但未知的量,例如
有限总体调查与超总体建模的抽样假设不同,不能随意混用独立性和有限总体修正。
3. 样本
随机样本
是随机变量;观测后得到
iid 是建模假设,不是数据文件天然性质。同一用户多条记录、时间序列、空间数据和网络节点常有依赖。
4. 参数与统计量
参数描述总体/模型,如 。统计量是样本的函数,不能含未知参数:
例:
观测前统计量是随机变量,有抽样分布;观测后得到具体数值。
5. 估计量与估计值
用于估计参数的统计量称估计量,如 。符号帽子表示由数据估得。
- 估计量:随机规则 ;
- 估计值:代入当前数据后的数。
讨论“无偏、方差、一致性”针对估计量在重复抽样下的性质,不是一个数值样本的属性。
6. 经验分布
把每个观测点放概率 :
是点质量。经验 CDF:
样本平均就是经验分布下期望:
经验风险最小化正是用经验分布替代未知总体分布。
7. 观测单位与分析单位
数据表一行不一定是独立分析单位。若用户是随机抽样单位、一位用户有多次点击:
- 按行切分可能同一用户泄漏到训练与测试;
- 标准误按行计算会过小;
- 高频用户在经验风险中权重更大。
应明确抽样单位、标签单位、评估单位与部署决策单位。
8. 抽样框与目标总体
目标总体是希望推广到的对象;抽样框是实际有机会进入数据的对象。二者不一致产生 coverage bias。例如只记录登录用户,无法无条件代表所有访问者。
更多样本只减少随机误差,不会自动修复覆盖缺失、选择偏差与错误标签。
9. 缺失与删失
- 缺失:变量未记录;
- 右删失:只知事件时间超过观察截止;
- 截断:不满足条件的对象根本不进入样本。
把删失时长当完整观测、把缺失行直接删除都可能偏。统计模型必须匹配观测机制。
10. 训练、验证、测试样本
- 训练集:拟合参数;
- 验证集:选择超参数、模型、阈值;
- 测试集:在所有选择完成后做近似无偏终评。
反复查看测试集并据此修改,相当于把测试集纳入训练/选择,结果产生选择偏差。线上部署分布若变化,静态测试仍不能代表未来。
11. 充分统计量预览
统计量 若在给定 后,样本关于参数不再提供额外信息,称充分统计量。Bernoulli iid 中成功总数 对 充分;不需保留成功出现的顺序来估计 。
充分性依模型,不表示统计量保留所有业务信息。
易错点
- 参数固定未知,估计量因样本随机。
- 一行不一定是独立样本。
- 经验分布只支持观测点,不代表真实分布无其他取值。
- 大样本不能修复系统性抽样偏差。
- 反复用测试集会把它变成验证集。
常见问答
Q1:全量数据库还需要统计推断吗?
若只描述当前有限数据库可少用抽样推断;若推广到未来、未观测人群或有测量随机性,仍存在超总体和过程不确定性。
Q2:训练集是不是总体?
通常不是,它是目标分布的一次样本;把它当总体会混淆训练拟合与未来泛化。
Q3:交叉验证后还需要独立测试集吗?
若交叉验证参与大量选择,独立测试更可信;数据极少时可嵌套交叉验证估计选择过程性能。
练习
- 区分参数、统计量、估计值。
- 写出经验 CDF。
- 为什么同一用户记录不能普通随机分行切分?
- 解释抽样框与目标总体差异。
- 反复看测试指标有什么后果?
答案与提示
- 参数描述总体,统计量是样本函数,估计值是该函数在当前数据上的实现。
- 。
- 用户特征与行为泄漏且观测相关,测试不再模拟新用户/未来情形。
- 有机会被记录者未必覆盖希望推广者,导致 coverage bias。
- 对测试集过拟合,报告误差乐观。