置信区间与标准误
层级:B|按需
1. 点估计必须配不确定性
“转化率提升 0.3%”若没有标准误、区间与抽样单位,无法判断是稳定信号还是随机波动。置信区间是一个由随机样本生成的区间过程,其长期覆盖率受模型与方法保证。
2. 频率学派解释
95% 置信区间程序满足:在相同机制重复抽样并每次构造区间,约 95% 区间包含固定真参数。
当前数据得到 后,严格频率解释不是“参数有 95% 概率在其中”,因为参数固定、区间已实现。日常语言常简化,但要知道与 Bayesian credible interval 的区别。
3. 已知方差的均值区间
高斯或大样本:
区间:
95% 时 。
4. 未知方差的 t 区间
高斯样本:
t 临界值比 1.96 大,反映估计 的额外不确定性; 大时接近高斯。
非高斯小样本下 t 区间可能不可靠,考虑变换、稳健方法或 bootstrap。
5. 比例区间
Wald:
简单但在小样本/边界表现差。Wilson score 区间通常更好且保持在 ;Clopper–Pearson exact 保守;Beta 后验区间有 Bayesian 解释。
报告方法,而非统一叫“95% 区间”。
6. 两组差异
独立均值差:
Welch 方法不假设两组方差相等,通常比默认 pooled t 更稳健。
配对数据对差值 做单样本区间。比例、风险比、odds ratio 的区间常在合适变换尺度构造。
7. Delta method
若
且 光滑:
例如对正参数取 log 后构造对称区间,再指数变回,得到原尺度非对称正区间。
8. Bootstrap 区间
重复有放回重采样,得到 :
- percentile:取 bootstrap 分位数;
- basic:围绕原估计反射分位数;
- studentized:标准化后构造;
- BCa:修正偏差与加速度。
不同方法覆盖不同。群组/时间依赖需按群或 block 重采样;预处理和模型选择应在每次 bootstrap 内完整重跑。
9. 置信区间不是预测区间
- 均值置信区间:总体平均估计的不确定性,随 缩窄;
- 新观测预测区间:还包含个体噪声,通常更宽,即使 也不收缩为零。
线性高斯回归预测区间包含噪声方差与均值估计方差。
10. 置信水平与宽度
更高覆盖要求更宽区间;更大样本缩窄区间;更大噪声加宽区间。若要把误差半宽减半,在独立同分布下常需约四倍样本。
统计显著但区间窄小可能业务无意义;区间宽跨越重要正负阈值则证据不足。
11. 多重区间
同时报告许多 95% 区间,至少一个漏真值的概率会增大。需要 simultaneous confidence bands、Bonferroni/Holm、FDR 或预先指定主指标。
“每个参数 95%”不等于“整个参数向量同时 95%”。
12. 模型错设与 robust SE
回归中异方差会使经典同方差标准误错误;可用 heteroskedasticity-consistent sandwich SE。群组相关用 cluster-robust;时间相关用 HAC/Newey–West 或时间模型。
robust SE 不修复系数因遗漏变量、选择偏差导致的偏差,只调整特定方差估计。
易错点
- 频率置信区间不是参数后验概率区间。
- 标准误不是样本标准差。
- Wald 比例区间在边界可越出 。
- 预测区间比均值置信区间宽。
- 多重报告需要同时覆盖调整。
常见问答
Q1:区间包含 0 是否说明“没有效果”?
只说明在该置信水平和模型下数据与零及区间内其他值相容;区间宽可能是精度不足,不是证明效果为零。
Q2:样本巨大区间很窄就可信吗?
只降低随机误差。偏差、依赖、泄漏与模型错设可让窄区间精确地围住错误值。
Q3:交叉验证均值可直接用折间标准差算区间吗?
折结果相关且训练集重叠,普通 往往不正确。用重复/嵌套 CV、配对比较或专门方差方法。
练习
- 均值 10、已知 ,近似 95% 区间。
- 置信水平从 95% 升 99%,区间怎样变化?
- 区分均值置信区间与预测区间。
- 为什么配对设计常缩窄差异区间?
- 多个指标同时看需注意什么?
答案与提示
- 。
- 更宽。
- 前者只含均值估计不确定性,后者还含新个体噪声。
- 利用同一对象正相关,差值消除个体基线波动。
- 多重比较/同时覆盖,避免挑选偶然显著者。