机器学习数学基础 120 章

方程、不等式与绝对值不等式

层级:A|必学

1. 方程是约束,不只是“求 x”

方程表示两个表达式相等,例如 2x+1=72x+1=7。求解就是找出使等式成立的所有变量取值。在机器学习中,等式与不等式不只用于手算:决策边界由方程描述,参数约束由不等式描述,最优解由一组梯度方程或 KKT 条件刻画。

方程的解集可能:

  • 只有一个解,如 2x=42x=4
  • 有多个解,如 x2=1x^2=1
  • 无解,如实数范围内 x2=1x^2=-1
  • 有无穷多个解,如 x+y=1x+y=1

解方程时的核心原则是做保持解集不变的等价变形。

2. 等式的基本变形

a=ba=b,则:

a+c=b+c,a+c=b+c, ac=bc,ac=bc,

c0c\ne0,还可除以 cc

ac=bc.\frac ac=\frac bc.

不能随意除以可能为零的表达式。比如由 x(x1)=0x(x-1)=0 两边除以 xx 会丢掉解 x=0x=0。平方也可能引入额外解:由 x=1x=-1 可得 x2=1x^2=1,但反过来还有 x=1x=1。做非等价变形后必须代回原式检查。

3. 一次方程与线性方程组

一元一次方程 ax+b=0ax+b=0a0a\ne0 时解为 x=b/ax=-b/a。多变量的线性方程如

{2x+y=5,xy=1.\begin{cases} 2x+y=5,\\ x-y=1. \end{cases}

其解是两条直线的交点。更高维时,每个线性方程描述一个超平面,方程组的解是这些超平面的公共部分。矩阵形式为

Ax=b.\boldsymbol A\boldsymbol x=\boldsymbol b.

是否有解、解是否唯一取决于矩阵的秩与空间结构,在线性代数卷详细讨论。

4. 不等式及其变形

不等式比较大小。加减同一个数不会改变方向:

a<ba+c<b+c.a<b\Rightarrow a+c<b+c.

乘以正数方向不变,乘以负数方向反转:

c>0: a<bac<bc,c>0:\ a<b\Rightarrow ac<bc, c<0: a<bac>bc.c<0:\ a<b\Rightarrow ac>bc.

这是最常见的错误来源。例如 2x<6-2x<6 两边除以 2-2x>3x>-3

取倒数也要先确认符号。若 0<a<b0<a<b,则 1/a>1/b1/a>1/b。不能在跨越零的区间上机械使用。

5. 二次式与配方法

二次函数

f(x)=ax2+bx+c(a0)f(x)=ax^2+bx+c\quad(a\ne0)

可配方为

f(x)=a(x+b2a)2+cb24a.f(x)=a\left(x+\frac b{2a}\right)^2+c-\frac{b^2}{4a}.

a>0a>0,平方项非负,所以最小值在 x=b/(2a)x=-b/(2a) 处取得。这正是一维最小二乘问题的基本结构。判别式 Δ=b24ac\Delta=b^2-4ac 决定方程 ax2+bx+c=0ax^2+bx+c=0 的实根个数。

平方恒非负还给出许多不等式。例如

(ab)20a2+b22ab.(a-b)^2\ge0\Rightarrow a^2+b^2\ge2ab.

6. 绝对值方程与不等式

绝对值描述距离。对 r0r\ge0

xa=r    x=ar 或 x=a+r.|x-a|=r\iff x=a-r\ \text{或}\ x=a+r.

r>0r>0

xar    arxa+r,|x-a|\le r\iff a-r\le x\le a+r, xar    xar 或 xa+r.|x-a|\ge r\iff x\le a-r\ \text{或}\ x\ge a+r.

一条实用方法是将绝对值按内部表达式的正负分段。例如

2x1={2x1,x1/2,12x,x<1/2.|2x-1|=\begin{cases} 2x-1,&x\ge1/2,\\ 1-2x,&x<1/2. \end{cases}

L1 损失的折点与 Lasso 的稀疏性都和这种分段结构有关。

7. 常见重要不等式

三角不等式

a+ba+b.|a+b|\le|a|+|b|.

推广到向量范数后是距离理论的基础。

算术—几何平均不等式

对非负数 a,ba,b

a+b2ab,\frac{a+b}{2}\ge\sqrt{ab},

等号当且仅当 a=ba=b。它体现“固定总量时,越均衡乘积越大”。

Cauchy–Schwarz 不等式

对向量:

xTyx2y2.|\boldsymbol x^{\mathsf T}\boldsymbol y| \le\|\boldsymbol x\|_2\|\boldsymbol y\|_2.

它保证余弦相似度落在 [1,1][-1,1],也用于推导误差界。

Jensen 不等式

ff 是凸函数,

f(E[X])E[f(X)].f(\mathbb E[X])\le\mathbb E[f(X)].

它会在凸函数和 EM 章节详细讲解。

8. 等式约束与不等式约束

优化问题常写为

minθf(θ)s.t.hj(θ)=0,gi(θ)0.\min_{\boldsymbol\theta} f(\boldsymbol\theta) \quad\text{s.t.}\quad h_j(\boldsymbol\theta)=0, \quad g_i(\boldsymbol\theta)\le0.

s.t. 是 subject to,意为“满足以下约束”。满足所有约束的参数构成可行域。例如概率向量必须满足

pk0,k=1Kpk=1.p_k\ge0,\qquad\sum_{k=1}^{K}p_k=1.

这既有不等式约束,也有等式约束。

9. 机器学习中的典型例子

线性分类边界

wTx+b=0\boldsymbol w^{\mathsf T}\boldsymbol x+b=0

描述决策超平面。两侧分别满足 >0>0<0<0

支持向量机约束

对标签 yi{1,+1}y_i\in\{-1,+1\},硬间隔约束是

yi(wTxi+b)1.y_i(\boldsymbol w^{\mathsf T}\boldsymbol x_i+b)\ge1.

这个写法把正负两类的两个方向合并成一个不等式。

早停条件

Lt+1Lt<ε|L_{t+1}-L_t|<\varepsilon

表示相邻两次损失变化足够小,但它不自动保证已经到达全局最优。

易错点

  1. 不等式乘除负数必须反向。
  2. 除以含变量的式子前要处理其为零的可能。
  3. 平方、开方可能改变解集,需检查定义域和符号。
  4. a2<b2a^2<b^2 不能在未知符号时直接推出 a<ba<b
  5. 约束写成 g(x)0g(x)\le0 只是标准形式;同一约束可以等价改写。

常见问答

Q1:梯度等于零是否就是最优解?

不是。它可能是局部最小、局部最大或鞍点;边界最优点甚至可能梯度不为零。还要看二阶性质、凸性和约束。

Q2:严格不等号和非严格不等号重要吗?

重要。它决定边界是否属于可行域,也影响最优值是否能被取得。

Q3:机器学习需要背很多不等式吗?

先掌握三角不等式、Cauchy–Schwarz 和 Jensen 的含义与使用条件。概率界章节再补 Markov、Chebyshev 与 Hoeffding。

练习

  1. 32x73-2x\ge7
  2. x25x+6=0x^2-5x+6=0
  3. 用配方法求 2x28x+112x^2-8x+11 的最小值和取值点。
  4. 3x2<4|3x-2|<4
  5. p[0,1]p\in[0,1] 改写为两个形如 g(p)0g(p)\le0 的约束。
  6. y=1y=-1,把 y(wx+b)1y(wx+b)\ge1 化为关于 wx+bwx+b 的不等式。

答案与提示

  1. x2x\le-2
  2. x=2x=2x=3x=3
  3. 2(x2)2+32(x-2)^2+3,最小值 33,在 x=2x=2 取得。
  4. 2/3<x<2-2/3<x<2
  5. p0-p\le0p10p-1\le0
  6. wx+b1wx+b\le-1