统计决策、损失、风险与 Bayes 最优
层级:A|必学
1. 概率不是最终行动
同一后验概率在不同业务成本下应做不同决策。统计决策论把未知状态、可选行动与错误代价连接起来:选择使期望损失最小的行动,而不是默认阈值 0.5。
2. 基本元素
- 状态/标签 ;
- 观测 ;
- 行动 ;
- 决策规则 ;
- 损失 ;
- 风险
训练代理损失、评估指标和真实业务损失可能不同,需明确三者关系。
3. 条件风险
给定 :
Bayes 决策逐点选择
逐 最小化条件风险即可最小化总体风险,因为全期望公式。
4. 0-1 损失分类
条件风险:
所以 Bayes 分类器:
最小可能错误率称 Bayes error,由类别分布重叠与不可约噪声决定。
5. 非对称二分类成本
行动 。假阳性成本 ,假阴性 ,正确成本 0。
预测 1 的条件风险:
预测 0:
选 1 当
假阴性越贵,阈值越低。若正确行动也有成本/收益,公式相应调整。
6. 回归损失的 Bayes 动作
给定 :
- 平方损失 :;
- 绝对损失 :条件中位数;
- quantile/check 损失:条件 分位数;
- 不对称线性成本:相应分位数。
损失决定模型应估计条件分布的哪个函数。
7. 对数损失与 proper scoring rule
预测完整概率分布 ,log loss:
条件期望由真实后验 在 时唯一最小(严格 proper)。Brier score 也是 proper。Proper scoring rule 鼓励诚实概率,而 accuracy 只关心最大类、不能评估校准。
8. 代理损失
0-1 损失不可微且组合困难,使用:
- logistic/cross-entropy;
- hinge;
- exponential loss。
分类校准的代理损失在总体最优时能恢复 Bayes 分类决策,但有限模型、正则化与优化误差会影响。
9. 拒绝选项
允许“不确定、转人工”行动,成本 。二分类 0-1 错误成本 1 时,若最大后验概率不足 ,拒绝可能更优。
这比强迫每个样本输出类别更适合高风险系统,但转人工容量和延迟也应计入损失。
10. 阈值与类别先验
最佳阈值依:
- 概率校准;
- 类别先验;
- 成本/收益;
- 容量约束;
- 决策群体与时间。
训练重采样或部署 prior shift 后,0.5 阈值可能不再对应原成本。应在验证/运营数据上按实际效用选择并监控。
11. Minimax 与 Bayesian 风险
Bayesian 风险对先验平均:
Minimax 选择最小化最坏参数风险:
前者利用先验,后者强调最坏情形稳健。分布鲁棒优化在一组可能分布中最小化最坏风险。
12. 指标不是损失的完整替代
F1、AUC、precision@k 等是数据集级非可加指标,最佳决策不能简单逐样本最小化。它们还依 prevalence 与排名。训练时用代理目标,评估和阈值选择必须与部署决策对齐。
易错点
- 概率 0.5 阈值只适合特定对称成本。
- accuracy 不衡量概率校准。
- 平方损失估条件均值,不一定中位数。
- 训练代理损失与业务损失不完全相同。
- 类别重采样会改变概率与阈值解释。
常见问答
Q1:AUC 高是否决策价值一定高?
不。AUC 是全阈值排名指标,不考虑校准、实际阈值区域、类别比例和成本。
Q2:为什么分位数回归适合容量规划?
高估/低估成本不对称时,最优动作是条件分位数;例如缺货成本高会选择较高分位需求预测。
Q3:Bayes error 能通过更复杂模型降为零吗?
若同一 下标签本质随机/类别分布重叠,不能;但估计误差、表示不足与数据质量改善仍可缩小到 Bayes error 的差距。
练习
- 0-1 损失的 Bayes 分类规则。
- ,阈值是多少?
- 平方、绝对、quantile 损失分别估什么?
- proper scoring rule 有什么作用?
- 拒绝选项适合什么场景?
答案与提示
- 选后验概率最大类。
- 。
- 条件均值、中位数、相应分位数。
- 使真实条件概率最小化期望评分,鼓励校准概率。
- 高风险且允许人工/延迟处理的不确定样本。