假设检验、p 值与第一/第二类错误
层级:B|按需
1. 检验是一套反证式决策程序
先规定原假设 与统计量,问:如果 真的成立,当前或更极端数据有多罕见?p 值小表示数据与 难相容,但不是 为真的概率。
2. 基本组成
- 原假设 :默认模型,如差异 ;
- 备择 :关心的偏离;
- 检验统计量 ;
- 下抽样分布;
- 显著性水平 ;
- 拒绝域或 p 值规则。
必须在看结果前尽量确定方向、指标、停止规则与分析方法。
3. p 值
p 值是在 成立及检验假设满足时,得到当前统计量或更不利于 的结果的概率。
双侧正态例:观察 :
它不是:
- ;
- 结果由随机产生的概率;
- 效果有业务意义的概率;
- 研究可复现的概率。
4. 第一类与第二类错误
| 真实情况 | 不拒绝 | 拒绝 |
|---|---|---|
| 真 | 正确 | 第一类错误(假阳性) |
| 真 | 第二类错误(假阴性) | 正确 |
power 。
功效依真实效果大小、样本量、噪声、检验与显著性水平。
5. 单侧与双侧
- 双侧:检测任一方向差异;
- 单侧:只把预先关心方向视为拒绝证据。
看到结果后把双侧改单侧会把 p 值人为减小,增加第一类错误。若反方向也有业务影响,通常用双侧。
6. 均值检验
单样本高斯未知方差:
两独立组常用 Welch t;配对数据对差值做 t 检验。非高斯大样本可依 CLT,但重尾、小样本和强依赖需 permutation/bootstrap/稳健方法。
7. 比例与列联表
- 单/双比例 z 检验;
- 小计数用 Fisher exact;
- 多类别关联用 检验;
- McNemar 用于配对二分类预测。
比较两个模型同一测试集准确率时,预测正确性是配对的,不能把两个比例当独立。
8. 检验与置信区间对偶
双侧 检验在常见正则设置下拒绝 ,当且仅当 置信区间不包含 。
区间比单 p 值信息更多:显示效果方向、大小和不确定性。
9. 统计显著与实际显著
大样本下极小无关差异也可 p 很小。应预先定义最小业务重要差异(MDE/SESOI),报告效果量与区间。
若目标是证明差异足够小,普通“未拒绝零差异”不够;应做等效性检验(TOST)或非劣效检验。
10. 功效与样本量
样本量计划需要:
- 显著性 ;
- 目标功效;
- 最小重要效果;
- 方差/基准率;
- 分配比例;
- 多重比较与流失;
- 群组设计效应。
用观察到的效果做“事后功效”通常只是 p 值的变换,信息有限;更有用是区间与未来设计灵敏度。
11. 可选停止
每天看一次普通 p 值,一显著就停,会累计第一类错误。应使用:
- 预定固定样本;
- group sequential/alpha spending;
- always-valid p/e-values;
- Bayesian 决策规则并校准运营代价。
实验平台必须把监控规则纳入推断。
12. 模型假设与稳健性
p 值条件于抽样、独立、分布/方差与分析计划。模型错设时即使计算精确也无正确意义。随机化实验可用 randomization inference 减少分布假设,但仍需处理干扰、失访和不依从。
易错点
- p 值不是原假设为真的概率。
- 不显著不等于无效果。
- 统计显著不等于业务重要。
- 结果后改单侧、指标或样本停止规则会膨胀假阳性。
- 同一测试样本上的模型比较是配对数据。
常见问答
Q1:p=0.03 表示重复实验 97% 会成功吗?
不是。它只描述 下当前统计量的尾概率,复现概率还取决于真实效果、功效、偏差和设计。
Q2:为什么 p=0.051 与 0.049 不应被当完全不同?
它们证据强度几乎相同,0.05 是人为决策阈值。应看效果量、区间和成本。
Q3:A/B 测试用户有多次事件如何处理?
随机化/分析单位通常是用户,应按用户聚合或用 cluster-robust/层级方法,不能把每次事件当独立用户。
练习
- 定义第一类、第二类错误与功效。
- p 值不是什么?列两项。
- 为什么同一数据上比较模型用配对检验?
- 未拒绝 能否证明等效?
- 反复查看 p 值提前停止有什么问题?
答案与提示
- 假阳性、假阴性、。
- 不是 ,也不是复现概率/业务意义概率。
- 每个样本上的两个预测结果相关,差值方差应利用配对。
- 不能,需等效性设计与区间落入等效界。
- 膨胀总体第一类错误率。