机器学习数学基础 120 章

随机样本与抽样分布

层级:B|按需

1. 同一个估计量换一批数据会变化

抽样分布是统计量在重复抽样中的分布。它回答“如果重新收集同样规模的数据,估计会波动多大”,是标准误、置信区间与假设检验的基础。

2. 样本均值抽样分布

iid XiX_i,均值 μ\mu、方差 σ2\sigma^2

E[Xˉ]=μ,Var(Xˉ)=σ2/n.E[\bar X]=\mu, \qquad Var(\bar X)=\sigma^2/n.

若总体高斯:

XˉN(μ,σ2/n)\bar X\sim N(\mu,\sigma^2/n)

对任意 nn 精确成立。一般有限方差总体,大样本由 CLT 近似成立。

3. 标准差与标准误

  • 标准差 σ\sigma:个体观测围绕总体均值的波动;
  • 标准误 SE(θ^)SE(\hat\theta):估计量跨重复样本的波动。

均值:

SE(Xˉ)=σ/n,SE(\bar X)=\sigma/\sqrt n,

实际用 s/ns/\sqrt n 估。把数据本身标准差当均值标准误,会大约高估 n\sqrt n 倍。

4. 样本方差分布

若总体高斯:

(n1)S2σ2χn12.\frac{(n-1)S^2}{\sigma^2} \sim\chi^2_{n-1}.

这给高斯方差置信区间,也解释自由度 n1n-1。非高斯时不精确成立,尤其重尾下样本方差波动更大。

5. t 分布

高斯样本、σ\sigma 未知:

T=XˉμS/ntn1.T=\frac{\bar X-\mu}{S/\sqrt n} \sim t_{n-1}.

t 分布对称但尾比标准高斯重,因为分母 SS 也随机。自由度增大时趋近标准高斯。

小样本 t 结论依近似高斯/相应模型;大样本常由渐近稳健性近似,但极重尾仍需谨慎。

6. 样本比例

KBinomial(n,p)K\sim Binomial(n,p)p^=K/n\hat p=K/n

E[p^]=p,Var(p^)=p(1p)/n.E[\hat p]=p, \qquad Var(\hat p)=p(1-p)/n.

大样本近似高斯。朴素 Wald 区间

p^±zα/2p^(1p^)/n\hat p\pm z_{\alpha/2} \sqrt{\hat p(1-\hat p)/n}

在小样本或比例接近 0/1 时覆盖差,优先 Wilson、exact 或合适 Bayesian 区间。

7. 两样本差

独立样本均值差:

Var(XˉYˉ)=σX2nX+σY2nY.Var(\bar X-\bar Y) =\frac{\sigma_X^2}{n_X} +\frac{\sigma_Y^2}{n_Y}.

配对数据应对每对差值求均值,其方差包含配对协方差,通常比当独立样本更精确。A/B 测试同用户前后、模型对同一测试样本的差异应利用配对结构。

8. 有限总体修正

从大小 NN 的有限总体无放回抽 nn

SE(Xˉ)=σnNnN1.SE(\bar X) =\frac{\sigma}{\sqrt n} \sqrt{\frac{N-n}{N-1}}.

抽样比例很小时修正接近 1;接近普查时标准误趋零。超总体未来预测问题通常不使用该修正。

9. Cluster 抽样与设计效应

群内观测相关时,简单 iid 标准误过小。若平均群大小 mm、组内相关 ρ\rho,设计效应粗略为

DEFF1+(m1)ρ.DEFF\approx1+(m-1)\rho.

有效样本量约 n/DEFFn/DEFF。应使用 cluster-robust 标准误、层级模型、按群 bootstrap 或合适随机化推断。

10. 渐近抽样分布

许多估计量满足

n(θ^θ)dN(0,V).\sqrt n(\hat\theta-\theta) \xrightarrow dN(0,V).

据此构造标准误和 Wald 区间。有限样本偏差、边界参数、不可辨识、模型错设和高维 p/np/n 不小会让经典渐近失效。

11. Bootstrap 近似抽样分布

从经验分布有放回抽大小 nn 的样本,重复计算 TT^*,用条件分布近似 TT 的抽样分布。它适用于解析标准误难算的统计量,但时间/群组数据需 block/cluster bootstrap,极值与非光滑统计量可能需要专门方法。

12. 模拟理解抽样分布

从已知分布反复:

  1. nn 个数据;
  2. 计算统计量;
  3. 保存数值;
  4. 画分布、算标准差。

这是恢复统计直觉的最佳小实验。注意模拟次数带 Monte Carlo 误差,不等于数学证明。

易错点

  1. 数据分布与统计量抽样分布不同。
  2. 标准差与标准误不同。
  3. 配对数据不能按独立两样本分析。
  4. 群组相关会使 iid 标准误过小。
  5. 大样本渐近不保证高维、重尾或边界问题有效。

常见问答

Q1:只有一个数据集,抽样分布如何理解?

它是设想相同数据生成过程反复抽样的频率分布;bootstrap 用当前经验分布近似这一过程。

Q2:样本量翻倍标准误减半吗?

不是,独立样本下乘 1/21/\sqrt2;减半需样本量约四倍。

Q3:深度模型指标的标准误怎样估?

测试样本 bootstrap/cluster bootstrap可估数据不确定性;跨训练种子还要估训练随机性,二者需分层设计。

练习

  1. 单样本标准差 10、n=100n=100,均值标准误。
  2. 高斯总体未知方差时用什么枢轴?
  3. 为什么 t 尾比高斯重?
  4. 配对测试为何常更有力?
  5. 用户级数据怎样 bootstrap?

答案与提示

  1. 1。
  2. (Xˉμ)/(S/n)tn1(\bar X-\mu)/(S/\sqrt n)\sim t_{n-1}
  3. 分母标准差是估计量、有额外不确定性。
  4. 利用同一对象相关性,差值方差可显著小于两个独立均值方差和。
  5. 以用户为单位有放回抽群,保留用户内记录。