优化问题、目标函数与局部/全局最优
层级:A|必学
1. 训练就是选择一个优化问题
机器学习并不是“让模型自动变聪明”,而是指定候选模型、损失、正则化和约束,再用算法寻找参数。不同目标会学出不同模型;优化器只忠实地优化你写出的量。
2. 标准形式
无约束最小化:
带约束形式:
- :决策变量/参数;
- :目标函数;
- 约束:允许参数必须满足的条件;
- 可行域:所有满足约束的参数集合;
- 最优值 与最优解 要区分。
最大化 等价于最小化 。
3. 经验风险最小化
训练集 ,样本损失 :
经验风险最小化(ERM):
经验风险只衡量训练样本。真正关心的是未知数据分布上的期望风险:
训练集有限,二者可能不同,这就是泛化问题。
4. 正则化目标
表达对模型的偏好,如参数小、稀疏或平滑; 平衡拟合与约束。它不只是“防止数值太大”,也改变统计假设和最优解。
若样本损失用求和而非平均, 的等价尺度会随 改变,比较实现时必须确认。
5. 局部与全局最优
是局部最小,如果存在邻域使其中所有可行 都满足
若对整个可行域都成立,则是全局最小。
严格局部最小把非同一点改为严格小于。全局最优可以有多个,例如 对所有 。
凸优化中任何局部最小都是全局最小;非凸问题没有这种一般保证。
6. 驻点、边界与不可微点
可微无约束问题的内部局部最优满足
但最优点还可能位于:
- 约束边界,梯度不为零;
- 不可微折点,如 的最小点 0;
- 定义域端点。
驻点也可能是局部最大或鞍点。求解梯度为零只是候选生成步骤。
7. 最优值可能不被取得
但没有有限 达到 0。优化问题“有下界”不等于“存在最优解”。紧致可行域上的连续函数一定取得极值,是常用存在性保证。
可分数据上的无正则逻辑回归也可能出现:损失趋近 0,而权重范数趋向无穷,没有有限极小点。
8. 闭式解与迭代解
闭式解用有限标准运算表示,如满秩最小二乘
闭式公式不等于实现应显式求逆。大多数模型没有实用闭式解,用迭代算法生成
并用停止条件返回近似解。
9. 优化误差、估计误差与近似误差
模型表现差可能来自:
- 优化误差:算法没把训练目标优化好;
- 估计/泛化误差:有限训练样本与总体不同;
- 近似误差:模型类无法表示真实规律;
- 数据与目标错配:标签、损失或分布本身有问题。
继续训练只能主要减少优化误差,甚至会增大泛化差距。
10. 停止标准
常组合使用:
以及最大迭代数、时间预算、验证集早停。随机优化中指标有噪声,要用滑动平均或耐心窗口。
11. 建模约束与算法约束
概率参数要非负且和为 1,属于建模约束;GPU 显存、延迟和可用迭代次数属于资源约束。后者可能使你选择近似目标、在线算法或小批量实现,但不应悄悄改变数学含义。
易错点
argmin返回参数,min返回目标值。- 训练损失最低不保证测试最好。
- 梯度为零不保证全局最优。
- 有下界不保证存在最小值。
- 优化器不能弥补目标函数与业务目标不一致。
常见问答
Q1:训练准确率能直接作为可微目标吗?
0-1 准确率离散且几乎处处梯度为零,通常使用交叉熵、hinge 等代理损失优化,再用准确率评估。
Q2:为什么不总把训练损失降到最低?
可能过拟合、资源不值得、数据有噪声或目标近似。早停本身可产生正则化效果。
Q3:多个全局最优解如何选择?
正则化、初始化、优化算法的隐式偏好、稳定性和业务解释会决定返回哪个。
练习
- 区分 与 。
- 为概率向量写出可行域约束。
- 给出一个驻点不是极小值的例子。
- 解释可分逻辑回归为什么可能没有有限最优权重。
- 列出模型差的三种不同误差来源。
答案与提示
- 前者是最小值,后者是取得最小值的输入集合。
- 。
- 在 0,或 在原点。
- 放大正确分隔方向可让每个样本概率趋近 1、损失趋近 0,但参数范数趋向无穷。
- 优化、估计/泛化、近似、数据/目标错配任选三项。