机器学习数学基础 120 章

经验风险、期望风险与泛化

层级:B|建议先修:05-09、06-10、06-12

机器学习不是要记住训练样本,而是要在同一数据机制产生的新样本上表现良好。学习理论用期望风险、经验风险和泛化误差来表达这一区别。

1. 数据、假设与损失

设输入标签对 Z=(X,Y)Z=(X,Y) 服从未知分布 D\mathcal D。训练集

S=(Z1,ldots,Zn)DnS=(Z_1,ldots,Z_n)\sim\mathcal D^n

通常假设独立同分布。假设或模型记为 hHh\in\mathcal H,损失为 (h(X),Y)\ell(h(X),Y)

常见损失包括 0-1 损失、平方损失、绝对损失和交叉熵。

2. 期望风险

期望风险又称真实风险或总体风险:

R(h)=E(X,Y)D[(h(X),Y)].R(h)=\mathbb E_{(X,Y)\sim\mathcal D} [\ell(h(X),Y)].

它描述模型面对未来同分布样本时的平均损失,是我们真正关心的目标。但 D\mathcal D 未知,所以无法直接精确计算。

3. 经验风险

训练集上的平均损失为

R^S(h)=1ni=1n(h(Xi),Yi).\hat R_S(h)=\frac1n\sum_{i=1}^n \ell(h(X_i),Y_i).

对一个固定且不依赖训练集选择的 hh,经验风险是期望风险的样本均值;大数定律说明样本足够多时它趋近于真实风险。

4. 经验风险最小化

经验风险最小化(ERM)选择

h^argminhHR^S(h).\hat h\in\arg\min_{h\in\mathcal H}\hat R_S(h).

训练大多数模型都可视为 ERM 或其正则化版本。关键困难是:h^\hat h 正是用同一训练集挑出来的,因此不能简单把固定模型的大数定律直接套在 h^\hat h 上。

5. 泛化差距

模型 hh 的泛化差距可写为

R(h)R^S(h).R(h)-\hat R_S(h).

训练损失很低但真实损失很高是过拟合。为了保证训练后选出的模型也可靠,通常需要控制整个假设空间的统一偏差:

suphHR(h)R^S(h).\sup_{h\in\mathcal H}|R(h)-\hat R_S(h)|.

若这个上界小,则不论算法从 H\mathcal H 中选出哪个模型,训练表现都能代表真实表现。

6. 有限假设类的基本界

若损失在 [0,1][0,1] 内,对固定 hh,Hoeffding 不等式给出

P(R(h)R^S(h)>ε)2e2nε2.P(|R(h)-\hat R_S(h)|>\varepsilon) \le2e^{-2n\varepsilon^2}.

H<|\mathcal H|<\infty,对所有假设使用并集界:

P(suphHR(h)R^S(h)>ε)2He2nε2.P\left(\sup_{h\in\mathcal H}|R(h)-\hat R_S(h)|>\varepsilon\right) \le2|\mathcal H|e^{-2n\varepsilon^2}.

令右侧不超过 δ\delta,可得以至少 1δ1-\delta 的概率,

suphR(h)R^S(h)log(2H/δ)2n.\sup_h|R(h)-\hat R_S(h)| \le\sqrt{\frac{\log(2|\mathcal H|/\delta)}{2n}}.

这展示了三件事:样本量增大使界缩小;假设空间越大越难泛化;更高置信度需要付出 log(1/δ)\log(1/\delta) 代价。

7. ERM 的超额风险分解

令类内最优假设

h=argminhHR(h).h^*=\arg\min_{h\in\mathcal H}R(h).

则 ERM 解 h^\hat h 满足

R(h^)R(h)2suphHR(h)R^S(h).R(\hat h)-R(h^*) \le2\sup_{h\in\mathcal H}|R(h)-\hat R_S(h)|.

证明思路是加入并减去两个经验风险,并用 R^(h^)R^(h)\hat R(\hat h)\le\hat R(h^*)。因此统一收敛直接控制 ERM 的估计误差。

8. 逼近误差与估计误差

相对所有可能预测函数的 Bayes 最优风险,模型误差可粗分为:

  • 逼近误差:假设空间太受限,连类内最优模型也无法表达真实规律;
  • 估计误差:样本有限,选出的模型没有达到类内真实最优;
  • 优化误差:算法未把训练目标优化到足够好。

扩大模型类通常降低逼近误差,却可能提高估计和优化难度,这就是复杂度折中。

9. 正则化经验风险

结构风险最小化常写为

minhR^S(h)+λΩ(h),\min_h\hat R_S(h)+\lambda\Omega(h),

其中 Ω(h)\Omega(h) 衡量复杂度。正则化不只是防止参数数值过大,也是在偏好更小的有效假设集合,从而改善泛化。

模型选择、早停、数据增强和先验约束也可形成隐式或显式正则化。

10. 训练、验证与测试

  • 训练集用于拟合参数;
  • 验证集用于选超参数和模型;
  • 测试集只用于最终一次无偏近似评估。

反复查看测试结果并据此调参,会让测试集也参与模型选择,使报告出现乐观偏差。

11. 分布偏移

经典泛化分析通常假设训练和测试来自同一分布。若出现协变量偏移、标签偏移、概念漂移或选择偏差,即使训练集很大,经验风险也未必估计目标环境风险。此时需要重新定义目标分布并采用重加权、领域适配或在线监测等方法。

12. 易错点

  1. 泛化好不等于训练误差一定高;过参数化模型也可能借助隐式偏置泛化。
  2. 参数数量不是复杂度的唯一衡量,还与范数、间隔、算法稳定性和数据结构有关。
  3. 理论上界常较松,但能揭示依赖关系和设计原则。
  4. i.i.d. 假设在时间序列、用户重复样本和图数据中常被破坏。

常见问答

Q1:为什么固定模型的测试表现可信,训练后挑出的模型却要更谨慎?
选择过程会偏好在训练样本上偶然表现好的模型,产生选择偏差;需要统一控制或独立验证数据。

Q2:训练误差和测试误差接近就一定好吗?
不一定。二者都很高说明欠拟合;泛化差距小只说明二者接近。

Q3:数据越多是否一定不会过拟合?
更多独立同分布数据通常有帮助,但数据泄漏、分布偏移、错误标签和持续调参仍可导致错误结论。

Q4:正则化参数越大越好吗?
不是。过强正则化会增大逼近偏差,应通过独立验证或理论依据选择。

练习

  1. 写出期望风险和经验风险的区别。
  2. 用有限假设类界说明 H|\mathcal H| 增大时所需样本量如何变化。
  3. 推导 ERM 超额风险不超过两倍统一偏差的结论。
  4. 举例说明反复使用测试集为何会造成泄漏。

答案与提示

  1. 前者是未知总体分布下的期望,后者是有限训练样本上的平均。
  2. 为保持 ε,δ\varepsilon,\delta 不变,样本量至少按 logH\log|\mathcal H| 增长。
  3. 插入 R^(h^)\hat R(\hat h)R^(h)\hat R(h^*),中间项因 ERM 不大于 0,其余两项各由统一偏差控制。
  4. 每轮根据测试结果选模型,相当于把测试信息反馈进训练流程,最终模型对该测试集也发生适配。