机器学习数学基础 120 章

统计决策、损失、风险与 Bayes 最优

层级:A|必学

1. 概率不是最终行动

同一后验概率在不同业务成本下应做不同决策。统计决策论把未知状态、可选行动与错误代价连接起来:选择使期望损失最小的行动,而不是默认阈值 0.5。

2. 基本元素

  • 状态/标签 YYY\in\mathcal Y
  • 观测 XX
  • 行动 aAa\in\mathcal A
  • 决策规则 δ(X)\delta(X)
  • 损失 L(Y,a)L(Y,a)
  • 风险
R(δ)=E[L(Y,δ(X))].R(\delta)=E[L(Y,\delta(X))].

训练代理损失、评估指标和真实业务损失可能不同,需明确三者关系。

3. 条件风险

给定 X=xX=x

R(ax)=E[L(Y,a)X=x]=yL(y,a)P(yx).R(a|x)=E[L(Y,a)|X=x] =\sum_yL(y,a)P(y|x).

Bayes 决策逐点选择

δ(x)=argminaR(ax).\delta^*(x)=\arg\min_aR(a|x).

xx 最小化条件风险即可最小化总体风险,因为全期望公式。

4. 0-1 损失分类

L(y,a)=1{ya}.L(y,a)=\mathbf1\{y\ne a\}.

条件风险:

R(ax)=1P(Y=ax).R(a|x)=1-P(Y=a|x).

所以 Bayes 分类器:

δ(x)=argmaxkP(Y=kx).\delta^*(x)=\arg\max_kP(Y=k|x).

最小可能错误率称 Bayes error,由类别分布重叠与不可约噪声决定。

5. 非对称二分类成本

行动 y^{0,1}\hat y\in\{0,1\}。假阳性成本 CFPC_{FP},假阴性 CFNC_{FN},正确成本 0。

预测 1 的条件风险:

R(1x)=CFPP(Y=0x).R(1|x)=C_{FP}P(Y=0|x).

预测 0:

R(0x)=CFNP(Y=1x).R(0|x)=C_{FN}P(Y=1|x).

选 1 当

p=P(Y=1x)>CFPCFP+CFN.p=P(Y=1|x)> \frac{C_{FP}}{C_{FP}+C_{FN}}.

假阴性越贵,阈值越低。若正确行动也有成本/收益,公式相应调整。

6. 回归损失的 Bayes 动作

给定 xx

  • 平方损失 (Ya)2(Y-a)^2a=E[Yx]a^*=E[Y|x]
  • 绝对损失 Ya|Y-a|:条件中位数;
  • quantile/check 损失:条件 τ\tau 分位数;
  • 不对称线性成本:相应分位数。

损失决定模型应估计条件分布的哪个函数。

7. 对数损失与 proper scoring rule

预测完整概率分布 qq,log loss:

L(y,q)=logq(y).L(y,q)=-\log q(y).

条件期望由真实后验 p(yx)p(y|x)q=pq=p 时唯一最小(严格 proper)。Brier score 也是 proper。Proper scoring rule 鼓励诚实概率,而 accuracy 只关心最大类、不能评估校准。

8. 代理损失

0-1 损失不可微且组合困难,使用:

  • logistic/cross-entropy;
  • hinge;
  • exponential loss。

分类校准的代理损失在总体最优时能恢复 Bayes 分类决策,但有限模型、正则化与优化误差会影响。

9. 拒绝选项

允许“不确定、转人工”行动,成本 CRC_R。二分类 0-1 错误成本 1 时,若最大后验概率不足 1CR1-C_R,拒绝可能更优。

这比强迫每个样本输出类别更适合高风险系统,但转人工容量和延迟也应计入损失。

10. 阈值与类别先验

最佳阈值依:

  • 概率校准;
  • 类别先验;
  • 成本/收益;
  • 容量约束;
  • 决策群体与时间。

训练重采样或部署 prior shift 后,0.5 阈值可能不再对应原成本。应在验证/运营数据上按实际效用选择并监控。

11. Minimax 与 Bayesian 风险

Bayesian 风险对先验平均:

r(π,δ)=EθπR(θ,δ).r(\pi,\delta)=E_{\theta\sim\pi}R(\theta,\delta).

Minimax 选择最小化最坏参数风险:

minδsupθR(θ,δ).\min_\delta\sup_\theta R(\theta,\delta).

前者利用先验,后者强调最坏情形稳健。分布鲁棒优化在一组可能分布中最小化最坏风险。

12. 指标不是损失的完整替代

F1、AUC、precision@k 等是数据集级非可加指标,最佳决策不能简单逐样本最小化。它们还依 prevalence 与排名。训练时用代理目标,评估和阈值选择必须与部署决策对齐。

易错点

  1. 概率 0.5 阈值只适合特定对称成本。
  2. accuracy 不衡量概率校准。
  3. 平方损失估条件均值,不一定中位数。
  4. 训练代理损失与业务损失不完全相同。
  5. 类别重采样会改变概率与阈值解释。

常见问答

Q1:AUC 高是否决策价值一定高?

不。AUC 是全阈值排名指标,不考虑校准、实际阈值区域、类别比例和成本。

Q2:为什么分位数回归适合容量规划?

高估/低估成本不对称时,最优动作是条件分位数;例如缺货成本高会选择较高分位需求预测。

Q3:Bayes error 能通过更复杂模型降为零吗?

若同一 xx 下标签本质随机/类别分布重叠,不能;但估计误差、表示不足与数据质量改善仍可缩小到 Bayes error 的差距。

练习

  1. 0-1 损失的 Bayes 分类规则。
  2. CFP=1,CFN=4C_{FP}=1,C_{FN}=4,阈值是多少?
  3. 平方、绝对、quantile 损失分别估什么?
  4. proper scoring rule 有什么作用?
  5. 拒绝选项适合什么场景?

答案与提示

  1. 选后验概率最大类。
  2. 1/(1+4)=0.21/(1+4)=0.2
  3. 条件均值、中位数、相应分位数。
  4. 使真实条件概率最小化期望评分,鼓励校准概率。
  5. 高风险且允许人工/延迟处理的不确定样本。