机器学习数学基础 120 章

优化问题、目标函数与局部/全局最优

层级:A|必学

1. 训练就是选择一个优化问题

机器学习并不是“让模型自动变聪明”,而是指定候选模型、损失、正则化和约束,再用算法寻找参数。不同目标会学出不同模型;优化器只忠实地优化你写出的量。

2. 标准形式

无约束最小化:

minθRpf(θ).\min_{\theta\in\mathbb R^p} f(\theta).

带约束形式:

minθf(θ)s.t.gi(θ)0, i=1,,m,hj(θ)=0, j=1,,q.\begin{aligned} \min_\theta\quad &f(\theta)\\ \text{s.t.}\quad &g_i(\theta)\le0,\ i=1,\ldots,m,\\ &h_j(\theta)=0,\ j=1,\ldots,q. \end{aligned}
  • θ\theta:决策变量/参数;
  • ff:目标函数;
  • 约束:允许参数必须满足的条件;
  • 可行域:所有满足约束的参数集合;
  • 最优值 ff^* 与最优解 θ\theta^* 要区分。

最大化 r(θ)r(\theta) 等价于最小化 r(θ)-r(\theta)

3. 经验风险最小化

训练集 D={(xi,yi)}i=1nD=\{(x_i,y_i)\}_{i=1}^n,样本损失 \ell

R^(θ)=1ni=1n(fθ(xi),yi).\hat R(\theta)=\frac1n\sum_{i=1}^{n} \ell(f_\theta(x_i),y_i).

经验风险最小化(ERM):

θ^=argminθR^(θ).\hat\theta=\arg\min_\theta\hat R(\theta).

经验风险只衡量训练样本。真正关心的是未知数据分布上的期望风险:

R(θ)=E(X,Y)P[(fθ(X),Y)].R(\theta)=\mathbb E_{(X,Y)\sim P} [\ell(f_\theta(X),Y)].

训练集有限,二者可能不同,这就是泛化问题。

4. 正则化目标

minθR^(θ)+λΩ(θ).\min_\theta \hat R(\theta)+\lambda\Omega(\theta).

Ω\Omega 表达对模型的偏好,如参数小、稀疏或平滑;λ\lambda 平衡拟合与约束。它不只是“防止数值太大”,也改变统计假设和最优解。

若样本损失用求和而非平均,λ\lambda 的等价尺度会随 nn 改变,比较实现时必须确认。

5. 局部与全局最优

θ\theta^* 是局部最小,如果存在邻域使其中所有可行 θ\theta 都满足

f(θ)f(θ).f(\theta^*)\le f(\theta).

若对整个可行域都成立,则是全局最小。

严格局部最小把非同一点改为严格小于。全局最优可以有多个,例如 f(x)=0f(x)=0 对所有 xx

凸优化中任何局部最小都是全局最小;非凸问题没有这种一般保证。

6. 驻点、边界与不可微点

可微无约束问题的内部局部最优满足

f(θ)=0.\nabla f(\theta^*)=0.

但最优点还可能位于:

  • 约束边界,梯度不为零;
  • 不可微折点,如 x|x| 的最小点 0;
  • 定义域端点。

驻点也可能是局部最大或鞍点。求解梯度为零只是候选生成步骤。

7. 最优值可能不被取得

infxRex=0,\inf_{x\in\mathbb R}e^x=0,

但没有有限 xx 达到 0。优化问题“有下界”不等于“存在最优解”。紧致可行域上的连续函数一定取得极值,是常用存在性保证。

可分数据上的无正则逻辑回归也可能出现:损失趋近 0,而权重范数趋向无穷,没有有限极小点。

8. 闭式解与迭代解

闭式解用有限标准运算表示,如满秩最小二乘

w^=(XTX)1XTy.\hat w=(X^TX)^{-1}X^Ty.

闭式公式不等于实现应显式求逆。大多数模型没有实用闭式解,用迭代算法生成

θ0,θ1,\theta_0,\theta_1,\ldots

并用停止条件返回近似解。

9. 优化误差、估计误差与近似误差

模型表现差可能来自:

  • 优化误差:算法没把训练目标优化好;
  • 估计/泛化误差:有限训练样本与总体不同;
  • 近似误差:模型类无法表示真实规律;
  • 数据与目标错配:标签、损失或分布本身有问题。

继续训练只能主要减少优化误差,甚至会增大泛化差距。

10. 停止标准

常组合使用:

f(θt)<εg,\|\nabla f(\theta_t)\|<\varepsilon_g, ftft1<εf,|f_t-f_{t-1}|<\varepsilon_f, θtθt1<εθ,\|\theta_t-\theta_{t-1}\|<\varepsilon_\theta,

以及最大迭代数、时间预算、验证集早停。随机优化中指标有噪声,要用滑动平均或耐心窗口。

11. 建模约束与算法约束

概率参数要非负且和为 1,属于建模约束;GPU 显存、延迟和可用迭代次数属于资源约束。后者可能使你选择近似目标、在线算法或小批量实现,但不应悄悄改变数学含义。

易错点

  1. argmin 返回参数,min 返回目标值。
  2. 训练损失最低不保证测试最好。
  3. 梯度为零不保证全局最优。
  4. 有下界不保证存在最小值。
  5. 优化器不能弥补目标函数与业务目标不一致。

常见问答

Q1:训练准确率能直接作为可微目标吗?

0-1 准确率离散且几乎处处梯度为零,通常使用交叉熵、hinge 等代理损失优化,再用准确率评估。

Q2:为什么不总把训练损失降到最低?

可能过拟合、资源不值得、数据有噪声或目标近似。早停本身可产生正则化效果。

Q3:多个全局最优解如何选择?

正则化、初始化、优化算法的隐式偏好、稳定性和业务解释会决定返回哪个。

练习

  1. 区分 minxf(x)\min_xf(x)argminxf(x)\arg\min_xf(x)
  2. 为概率向量写出可行域约束。
  3. 给出一个驻点不是极小值的例子。
  4. 解释可分逻辑回归为什么可能没有有限最优权重。
  5. 列出模型差的三种不同误差来源。

答案与提示

  1. 前者是最小值,后者是取得最小值的输入集合。
  2. pk0,kpk=1p_k\ge0,\sum_kp_k=1
  3. x3x^3 在 0,或 x2y2x^2-y^2 在原点。
  4. 放大正确分隔方向可让每个样本概率趋近 1、损失趋近 0,但参数范数趋向无穷。
  5. 优化、估计/泛化、近似、数据/目标错配任选三项。