机器学习数学基础 120 章

泰勒展开与局部近似

层级:A|必学

1. 泰勒展开是什么

泰勒展开用函数在某一点的各阶导数构造局部多项式。机器学习里最重要的是一阶和二阶:一阶解释梯度下降,二阶解释 Newton 法、曲率、Hessian 和许多误差近似。

2. 一元 Taylor 公式

若函数足够光滑,在 x0x_0 附近:

f(x)=f(x0)+f(x0)(xx0)+f(x0)2!(xx0)2++f(k)(x0)k!(xx0)k+Rk.f(x)=f(x_0)+f'(x_0)(x-x_0) +\frac{f''(x_0)}{2!}(x-x_0)^2 +\cdots+ \frac{f^{(k)}(x_0)}{k!}(x-x_0)^k+R_k.

RkR_k 是截断余项,表示忽略高阶项的误差。围绕 x0=0x_0=0 的展开称 Maclaurin 展开。

3. 一阶近似

Δ=xx0\Delta=x-x_0

f(x0+Δ)f(x0)+f(x0)Δ.f(x_0+\Delta) \approx f(x_0)+f'(x_0)\Delta.

它就是切线近似。误差通常为 O(Δ2)O(\Delta^2)(在二阶导有界等条件下)。输入变化减半,一阶截断误差约缩小到四分之一。

4. 二阶近似

f(x0+Δ)f(x0)+f(x0)Δ+12f(x0)Δ2.f(x_0+\Delta) \approx f(x_0)+f'(x_0)\Delta +\frac12f''(x_0)\Delta^2.

二次项描述曲率。若 f(x0)=0f'(x_0)=0f(x0)>0f''(x_0)>0,小非零 Δ\Delta 让函数增加,故是局部极小。

5. 常见展开

xx 接近 0:

ex=1+x+x22+x36+,e^x=1+x+\frac{x^2}{2}+\frac{x^3}{6}+\cdots, log(1+x)=xx22+x33(x<1),\log(1+x)=x-\frac{x^2}{2}+\frac{x^3}{3}-\cdots \quad(|x|<1), 11x=1+x+x2+x3+(x<1),\frac1{1-x}=1+x+x^2+x^3+\cdots \quad(|x|<1), sinx=xx36+,cosx=1x22+.\sin x=x-\frac{x^3}{6}+\cdots, \qquad \cos x=1-\frac{x^2}{2}+\cdots.

展开有收敛范围;局部近似不能无条件用于远处。

6. 多元一阶展开

f:RdRf:\mathbb R^d\to\mathbb R

f(x+Δ)f(x)+f(x)TΔ.f(x+\Delta) \approx f(x)+\nabla f(x)^T\Delta.

若取 Δ=ηf\Delta=-\eta\nabla f

f(x+Δ)f(x)ηf(x)22.f(x+\Delta) \approx f(x)-\eta\|\nabla f(x)\|_2^2.

这说明足够小的负梯度步会下降。“足够小”取决于高阶项和梯度的 Lipschitz 常数。

7. 多元二阶展开

f(x+Δ)f(x)+gTΔ+12ΔTHΔ,f(x+\Delta) \approx f(x)+g^T\Delta +\frac12\Delta^TH\Delta,

其中 g=f(x)g=\nabla f(x)H=2f(x)H=\nabla^2f(x)HH 的特征值给不同方向曲率;细长谷地对应特征值差距大。

8. Newton 法的推导

最小化二次近似,对 Δ\Delta 求梯度:

g+HΔ=0.g+H\Delta=0.

HH 可逆:

ΔNewton=H1g.\Delta_{\text{Newton}}=-H^{-1}g.

一维写成

xt+1=xtf(xt)f(xt).x_{t+1}=x_t-\frac{f'(x_t)}{f''(x_t)}.

对严格二次函数,Newton 法一步到最优点;一般函数只在最优点附近通常有快速局部收敛。远处或 Hessian 不定时需要阻尼。

9. 光滑性上界

若梯度是 LL-Lipschitz:

f(x)f(y)Lxy,\|\nabla f(x)-\nabla f(y)\| \le L\|x-y\|,

则有下降引理:

f(y)f(x)+f(x)T(yx)+L2yx2.f(y)\le f(x)+\nabla f(x)^T(y-x) +\frac L2\|y-x\|^2.

y=xηf(x)y=x-\eta\nabla f(x),当 0<η<2/L0<\eta<2/L 时可得到下降保证(具体结论随假设与写法略有差异)。这把“步长足够小”定量化。

10. Delta method

若估计量 θ^\hat\thetaθ\theta 附近波动,函数 g(θ^)g(\hat\theta) 可一阶近似:

g(θ^)g(θ)+g(θ)(θ^θ).g(\hat\theta) \approx g(\theta)+g'(\theta)(\hat\theta-\theta).

于是

Var(g(θ^))[g(θ)]2Var(θ^).\operatorname{Var}(g(\hat\theta)) \approx[g'(\theta)]^2\operatorname{Var}(\hat\theta).

多元版本使用梯度与协方差。这是误差传播、置信区间变换和不确定性近似的基础。

11. 二阶近似与正则化直觉

对参数扰动 δ\delta

L(θ+δ)L(θ)+gTδ+12δTHδ.L(\theta+\delta) \approx L(\theta)+g^T\delta+\frac12\delta^TH\delta.

在驻点 g=0g=0 附近,损失增加由曲率决定。平坦方向对扰动不敏感,尖锐方向敏感;但“平坦极小泛化一定更好”受参数化与尺度影响,不能当无条件定理。

12. 余项与适用范围

Lagrange 余项一元形式:

Rk=f(k+1)(ξ)(k+1)!(xx0)k+1,R_k=\frac{f^{(k+1)}(\xi)}{(k+1)!}(x-x_0)^{k+1},

ξ\xixxx0x_0 之间。它提醒我们近似质量取决于:距离、下一阶导数大小、函数是否光滑。

ReLU 折点处不可用普通二阶 Taylor;远离展开点时低阶多项式也可能非常差。

易错点

  1. Taylor 是局部近似,不是截断后全局恒等式。
  2. 二阶项有 1/21/2
  3. 多元二阶项是 ΔTHΔ\Delta^TH\Delta,不是逐元素简单平方。
  4. Newton 方向在 Hessian 不定时未必下降。
  5. O(Δk)O(\Delta^k) 时要明确极限与范数。

常见问答

Q1:为什么深度学习多数不用完整 Newton 法?

Hessian 存储和求解成本巨大且常不定;一阶法便宜、可用小批量。实践会用动量、自适应预条件或近似二阶方法。

Q2:泰勒展开与线性回归有什么关系?

Taylor 是把任意光滑函数在局部近似成线性/二次;线性回归是全局假设预测函数对所选特征线性,二者角色不同。

Q3:一阶近似误差怎么判断?

看扰动大小和局部二阶导/Hessian 范数。可用余项上界,或通过数值实验比较实际变化与预测变化。

练习

  1. 写出 exe^x 在 0 的二阶近似。
  2. 用它近似 e0.1e^{0.1}
  3. 写出 f(x)=x3f(x)=x^3x0=1x_0=1 的二阶展开。
  4. f(x,y)=x2+2y2f(x,y)=x^2+2y^2 写出任意点的二阶 Taylor;它是否精确?
  5. 从二次模型推导 Newton 步。

答案与提示

  1. 1+x+x2/21+x+x^2/2
  2. 1.1051.105,真实值约 1.105171.10517
  3. 1+3(x1)+3(x1)21+3(x-1)+3(x-1)^2,余下 (x1)3(x-1)^3
  4. 因函数本身二次,二阶展开对所有扰动精确。
  5. gTΔ+12ΔTHΔg^T\Delta+\frac12\Delta^TH\Delta 求导置零,解 HΔ=gH\Delta=-g