机器学习数学基础 120 章

实数、数轴、区间与绝对值

层级:A|必学

1. 为什么机器学习要从“数”重新讲起

数据表里看似都是数字,但数字扮演的角色不同:年龄是实数,类别编号只是标签,概率被限制在 [0,1][0,1],损失通常要求非负,模型参数却可能取任意实数。理解数集、区间和绝对值,才能准确阅读“变量能取什么值”“误差有多大”“约束是否满足”。

2. 常用数集

  • 自然数:N\mathbb N,常用来表示样本数、特征数和迭代次数。不同书对是否包含 00 约定不同,使用时要看上下文。
  • 整数:Z={,2,1,0,1,2,}\mathbb Z=\{\ldots,-2,-1,0,1,2,\ldots\}
  • 有理数:Q\mathbb Q,能写成两个整数之比 p/qp/qq0q\neq0)的数。
  • 实数:R\mathbb R,包括有理数和 2,π,e\sqrt2,\pi,e 等无理数。机器学习中的连续参数通常属于 R\mathbb R
  • 正实数:R>0\mathbb R_{>0};非负实数:R0\mathbb R_{\ge 0}

符号 xRx\in\mathbb R 读作“xx 属于实数集”。xAx\notin A 表示 xx 不属于集合 AARd\mathbb R^d 不是“实数的 dd 次方”,而是所有 dd 维实向量的集合;它会在线性代数卷详细解释。

3. 数轴、大小关系与区间

实数可以放在一条数轴上。越靠右越大。区间是数轴上一段连续区域:

写法 条件 是否含端点
[a,b][a,b] axba\le x\le b 两端都含
(a,b)(a,b) a<x<ba<x<b 两端都不含
[a,b)[a,b) ax<ba\le x<b 含左不含右
(a,b](a,b] a<xba<x\le b 不含左、含右
(,a](-\infty,a] xax\le a 无穷不是一个端点,永远用圆括号

例如分类概率 p[0,1]p\in[0,1];Sigmoid 的有限输入对应 p(0,1)p\in(0,1),永远不会精确到达 0011。这两个写法传达的信息不同。

4. 绝对值:方向被拿走后的大小

实数 xx 的绝对值定义为

x={x,x0,x,x<0.|x|=\begin{cases} x,&x\ge0,\\ -x,&x<0. \end{cases}

所以 3=3|3|=33=3|-3|=3。绝对值不是“去掉负号”的机械操作,而是 xx 到原点 00 的距离。进一步,两个实数 x,yx,y 的距离为 xy|x-y|

若预测值为 8.58.5、真实值为 1010,绝对误差是 8.510=1.5|8.5-10|=1.5。交换次序不会改变结果,因为 xy=yx|x-y|=|y-x|

绝对值满足:

  1. 非负性:x0|x|\ge0,且仅当 x=0x=0 时等号成立;
  2. 齐次性:cx=cx|cx|=|c||x|
  3. 三角不等式:x+yx+y|x+y|\le|x|+|y|

三角不等式表达“直接走不会比绕路更长”。范数和距离的很多性质都是它的高维版本。

5. 绝对值不等式怎样翻译

r>0r>0 时:

xa<r    ar<x<a+r.|x-a|<r \iff a-r<x<a+r.

它表示 xx 落在以 aa 为中心、半径为 rr 的邻域内。例如 x3<0.1|x-3|<0.1 等价于 2.9<x<3.12.9<x<3.1

相反,xa>r|x-a|>r 表示 x<arx<a-rx>a+rx>a+r。这里是“或”,因为数轴上有左右两个远离中心的区域。

6. 上界、下界、最大值与最小值

若集合中所有 xx 都满足 xMx\le M,则 MM 是一个上界。上界不一定属于集合,也不一定是最小的上界。

例如开区间 (0,1)(0,1)

  • 11 是上界,22 也是上界;
  • 集合没有最大值,因为任取 x<1x<1,总能找到更大的区间内元素;
  • 最小上界(上确界)是 11,记作 sup(0,1)=1\sup(0,1)=1

优化里经常区分 min\mininf\infmin\min 要求最小值确实被某个可行点取得;inf\inf 只要求它是最大的下界。

7. 在机器学习中的位置

  • 损失函数:绝对误差 yy^|y-\hat y| 对应 L1 损失,平方误差 (yy^)2(y-\hat y)^2 对应 L2 型损失。
  • 概率P(A)[0,1]P(A)\in[0,1]
  • 分类阈值p0.5p\ge0.5p<0.5p<0.5 把区间切成两部分。
  • 约束优化:参数可能满足 wi0w_i\ge0wC\|\boldsymbol w\|\le C
  • 收敛xtx<ε|x_t-x^*|<\varepsilon 表示第 tt 次迭代已经足够接近目标。

8. 易错点

  1. x-x 不一定是负数;若 x=2x=-2,则 x=2-x=2
  2. x2=x\sqrt{x^2}=|x|,不是总等于 xx
  3. x+y|x+y| 通常不等于 x+y|x|+|y|,只有某些同号情形才相等。
  4. 区间 [0,1][0,1] 包含端点,而 (0,1)(0,1) 不包含。
  5. \infty 不是实数,不能说“包含无穷”。

常见问答

Q1:类别编号 1、2、3 属于实数,能直接比较大小吗?

存储上可以用整数,但语义上它们可能只是名称。例如猫=1、狗=2 不意味着狗比猫“大一倍”。模型是否能把它当数值取决于编码方式。

Q2:为什么绝对值在零点不可导?

x|x| 在零点左侧斜率为 1-1,右侧斜率为 11,没有唯一切线斜率。优化中会使用次梯度或近端方法处理它。

Q3:误差为什么不能直接用 yy^y-\hat y

带符号误差会发生正负抵消。绝对值或平方让不同方向的偏差都产生非负代价。

练习

  1. 用区间表示 2x<5-2\le x<5
  2. 解不等式 x42|x-4|\le2
  3. 解不等式 2x+1>3|2x+1|>3
  4. 判断:(5)2=5\sqrt{(-5)^2}=-5
  5. 对真实值 (2,5,9)(2,5,9) 和预测值 (3,3,10)(3,3,10),计算平均绝对误差。
  6. 开区间 (2,7)(2,7) 是否有最大值?它的上确界是什么?

答案与提示

  1. [2,5)[-2,5)
  2. 2x62\le x\le6
  3. 2x+1>32x+1>32x+1<32x+1<-3,即 x>1x>1x<2x<-2
  4. 错,结果是 55
  5. (1+2+1)/3=4/3(1+2+1)/3=4/3
  6. 没有最大值,上确界为 77