机器学习数学基础 120 章

函数、极限与连续性

层级:A|必学

1. 微积分研究“变化”与“逼近”

导数描述局部变化率,积分描述累积,优化研究如何移动到更小的函数值。它们都以极限为基础。你不需要先掌握严密的 ε\varepsilonδ\delta 证明,但必须理解“无限接近不等于直接代入”“函数值存在不等于极限存在”和“连续性为什么允许局部近似”。

2. 函数回顾

函数 f:ABf:A\to B 给定义域中每个输入唯一输出。机器学习常见:

fθ:RdR,f_\theta:\mathbb R^d\to\mathbb R,

参数 θ\theta 固定时把特征映射为预测;损失

L:RpRL:\mathbb R^p\to\mathbb R

把参数向量映射为标量代价。

讨论极限前必须知道定义域。1/x1/xx=0x=0 未定义,logx\log x 只在 x>0x>0 定义。

3. 数列极限

数列 ana_nnn\to\infty 趋近 LL,记为

limnan=L.\lim_{n\to\infty}a_n=L.

直觉是:给定任意小容许误差 ε>0\varepsilon>0,只要 nn 足够大,anL<ε|a_n-L|<\varepsilon

例如 an=1/n0a_n=1/n\to0。每一项都不等于 0,但能任意接近 0。优化中的参数序列、损失序列与样本均值都用类似语言描述收敛。

4. 函数极限

limxaf(x)=L\lim_{x\to a}f(x)=L

表示当 xx 接近 aa(但不要求等于 aa)时,f(x)f(x) 接近 LL。极限关心附近行为,不直接关心 f(a)f(a)

例如

f(x)=x21x1f(x)=\frac{x^2-1}{x-1}

x=1x=1 未定义,但 x1x\ne1f(x)=x+1f(x)=x+1,所以

limx1f(x)=2.\lim_{x\to1}f(x)=2.

5. 左极限与右极限

limxaf(x),limxa+f(x)\lim_{x\to a^-}f(x),\qquad \lim_{x\to a^+}f(x)

分别从左、右接近。双侧极限存在当且仅当左右极限都存在且相等。

阶跃函数

H(x)={0,x<0,1,x0H(x)=\begin{cases}0,&x<0,\\1,&x\ge0\end{cases}

在 0 左极限为 0、右极限为 1,因此双侧极限不存在。硬阈值分类输出会产生这种不连续性。

6. 无穷极限与无穷远行为

limx0+1x=+\lim_{x\to0^+}\frac1x=+\infty

表示函数可超过任意给定上界,不是说极限是某个普通实数。

limx+1x=0\lim_{x\to+\infty}\frac1x=0

描述输入越来越大时的行为。Sigmoid 满足

limz+σ(z)=1,limzσ(z)=0,\lim_{z\to+\infty}\sigma(z)=1, \qquad \lim_{z\to-\infty}\sigma(z)=0,

但对有限 zz 不精确等于端点。

7. 极限运算法则

f(x)Af(x)\to Ag(x)Bg(x)\to B

f+gA+B,fgAB,f+g\to A+B, \quad fg\to AB,

B0B\ne0

fgAB.\frac f g\to\frac AB.

直接代入出现 0/00/0/\infty/\infty 等是不定式,不能把符号当数计算,需化简、等价无穷小、Taylor 展开或 L’Hôpital 法则。

经典极限:

limx0ex1x=1,limx0log(1+x)x=1.\lim_{x\to0}\frac{e^x-1}{x}=1, \qquad \lim_{x\to0}\frac{\log(1+x)}x=1.

它们给出 ex1+xe^x\approx1+xlog(1+x)x\log(1+x)\approx x 的局部近似。

8. 连续性

ffaa 连续,当:

  1. f(a)f(a) 有定义;
  2. limxaf(x)\lim_{x\to a}f(x) 存在;
  3. 两者相等。

直觉是输入做小变化,输出不会突然跳变。多项式处处连续;有理函数在分母非零处连续;指数和对数在各自定义域连续。

连续函数可直接把极限带入:若 g(x)ag(x)\to affaa 连续,

limf(g(x))=f(a).\lim f(g(x))=f(a).

9. 可微与连续

一元函数在某点可微必然连续,但连续不必可微。x|x| 在 0 连续,却有尖角、左右导数不同。

ReLU

ReLU(x)=max(0,x)\operatorname{ReLU}(x)=\max(0,x)

在 0 连续但不可微。深度学习框架会人为选择一个次梯度值,通常为 0;这不意味着普通导数存在。

10. 连续性与最值

闭区间上的连续函数一定能取得最大值和最小值。这提醒我们:优化目标有下界不自动保证最小值被取得;定义域是否闭、参数是否会逃向无穷也重要。

例如 f(x)=exf(x)=e^xR\mathbb R 上下确界为 0,却没有任何有限 xx 使 ex=0e^x=0

11. 机器学习中的收敛概念

  • 损失值收敛:L(θt)LL(\theta_t)\to L^*
  • 参数收敛:θtθ\theta_t\to\theta^*
  • 梯度范数趋零:L(θt)0\|\nabla L(\theta_t)\|\to0
  • 随机变量依概率、均方或分布收敛。

这些不是同一件事。损失收敛不必参数收敛;梯度趋零不必到全局最优。看到“收敛”必须问收敛的对象和方式。

易错点

  1. 极限值与函数在该点的值可以不同。
  2. 左右极限不同,则双侧极限不存在。
  3. \infty 不是普通实数,不能机械代数运算。
  4. 连续不保证可微,可微则保证连续。
  5. 算法损失不再明显变化不等于理论已经收敛。

常见问答

Q1:机器学习是否需要会严谨的极限证明?

第一次学习不必熟练所有证明,但应能理解极限定义、连续性和近似条件。学习理论或优化收敛证明时再加强严谨性。

Q2:离散参数还能求导吗?

普通导数要求连续变化。离散选择需组合优化、连续松弛、概率梯度估计或其他方法。

Q3:浮点数上“趋近”有什么不同?

浮点数集合有限,足够小的变化可能被舍入掉,极限是实数数学概念。实现需结合容差、机器精度和数值稳定性。

练习

  1. limx2(x2+3x)\lim_{x\to2}(x^2+3x)
  2. limx1(x21)/(x1)\lim_{x\to1}(x^2-1)/(x-1)
  3. 函数在点 aa 连续需要哪三个条件?
  4. 给出一个连续但不可微的函数。
  5. 解释为什么 exe^x 在实数域没有最小值,却有下确界 0。

答案与提示

  1. 10。
  2. 2,先约去 x1x-1
  3. 点值存在、极限存在、两者相等。
  4. x|x| 在 0,或 ReLU 在 0。
  5. 所有值都正,但令 xx 足够负可任意接近 0,永远不等于 0。