机器学习数学基础 120 章

向量的加减、数乘与线性组合

层级:A|必学

1. 向量运算的核心:对应分量与几何移动

向量加减和数乘看似简单,却构成参数更新、特征中心化、线性模型和向量空间的基础。代数上它们逐分量进行;几何上它们描述移动、缩放和方向组合。

2. 向量加法

同维向量才能直接相加:

x+y=[x1+y1xd+yd].\boldsymbol x+\boldsymbol y =\begin{bmatrix}x_1+y_1\\\vdots\\x_d+y_d\end{bmatrix}.

例如

[12]+[31]=[41].\begin{bmatrix}1\\2\end{bmatrix} +\begin{bmatrix}3\\-1\end{bmatrix} =\begin{bmatrix}4\\1\end{bmatrix}.

几何上可用首尾相接或平行四边形法则理解。向量加法满足交换律与结合律:

x+y=y+x,\boldsymbol x+\boldsymbol y=\boldsymbol y+\boldsymbol x, (x+y)+z=x+(y+z).(\boldsymbol x+\boldsymbol y)+\boldsymbol z =\boldsymbol x+(\boldsymbol y+\boldsymbol z).

3. 向量减法

xy=x+(y).\boldsymbol x-\boldsymbol y =\boldsymbol x+(-\boldsymbol y).

若把 x,y\boldsymbol x,\boldsymbol y 看作点,xy\boldsymbol x-\boldsymbol y 是从 y\boldsymbol y 指向 x\boldsymbol x 的位移。距离通常对差向量取范数:

d(x,y)=xy.d(\boldsymbol x,\boldsymbol y)=\|\boldsymbol x-\boldsymbol y\|.

数据中心化也是减法:

x~i=xiμ,\tilde{\boldsymbol x}_i=\boldsymbol x_i-\boldsymbol\mu,

把所有样本整体平移,使均值位于原点。

4. 标量乘法

标量 cc 与向量相乘:

cx=(cx1,,cxd)T.c\boldsymbol x=(cx_1,\ldots,cx_d)^{\mathsf T}.
  • c>1c>1:长度放大,方向不变;
  • 0<c<10<c<1:长度缩小;
  • c<0c<0:方向翻转并按 c|c| 缩放;
  • c=0c=0:得到零向量。

除以非零标量等价于乘其倒数。单位化

x^=xx\hat{\boldsymbol x}=\frac{\boldsymbol x}{\|\boldsymbol x\|}

保留方向并把长度变为 1,但零向量不能单位化。

5. 线性组合

给定向量 v1,,vk\boldsymbol v_1,\ldots,\boldsymbol v_k

c1v1++ckvkc_1\boldsymbol v_1+\cdots+c_k\boldsymbol v_k

称为它们的线性组合,cic_i 是标量系数。

例如

2[10]3[01]=[23].2\begin{bmatrix}1\\0\end{bmatrix} -3\begin{bmatrix}0\\1\end{bmatrix} =\begin{bmatrix}2\\-3\end{bmatrix}.

二维标准基的线性组合能得到平面中任意向量。一个向量能否由某组向量线性表示,是生成空间、基、秩和最小二乘的核心问题。

6. 仿射组合与凸组合

若系数满足 ici=1\sum_i c_i=1,称为仿射组合。它不一定要求系数非负。

若还满足 ci0c_i\ge0,称为凸组合:

x=icivi,ci0,ici=1.\boldsymbol x=\sum_i c_i\boldsymbol v_i, \qquad c_i\ge0,\quad\sum_i c_i=1.

两个点的凸组合

tx+(1t)y,0t1t\boldsymbol x+(1-t)\boldsymbol y, \qquad0\le t\le1

位于两点之间的线段上。多个点的凸组合位于它们的凸包中。凸优化与 Jensen 不等式大量使用这种结构。

7. 向量均值

样本均值向量为

μ=1ni=1nxi.\boldsymbol\mu=\frac1n\sum_{i=1}^{n}\boldsymbol x_i.

这是所有样本的等权凸组合。每个分量等于对应特征的样本均值。若

x1=(1,4)T,x2=(3,2)T,\boldsymbol x_1=(1,4)^{\mathsf T},\quad \boldsymbol x_2=(3,2)^{\mathsf T},

则均值是 (2,3)T(2,3)^{\mathsf T},即两点连线的中点。

8. 梯度下降就是向量加法

参数更新

θt+1=θtηL(θt)\boldsymbol\theta_{t+1} =\boldsymbol\theta_t-\eta\nabla L(\boldsymbol\theta_t)

包含:用学习率 η\eta 缩放梯度,再从当前参数向量中减去它。参数与梯度必须同形状。几何上,负梯度是局部下降最快方向。

9. 线性模型是特征的加权组合

wTx=j=1dwjxj.\boldsymbol w^{\mathsf T}\boldsymbol x =\sum_{j=1}^{d}w_jx_j.

它既可以理解为两个向量的内积,也可以理解为各特征值按权重加权求和。若权重与特征量纲不同,权重数值大小不能直接比较重要性。

10. 广播不是线性代数基本规则

数学上不能直接把 dd 维向量加到 n×dn\times d 矩阵,除非明确把向量复制到每一行:

X+1nbT.\boldsymbol X+\boldsymbol1_n\boldsymbol b^{\mathsf T}.

NumPy 等库的广播会自动完成复制。广播很方便,但应知道隐藏的逻辑形状,否则容易沿错轴。

易错点

  1. 不同维向量不能直接相加。
  2. 向量乘向量不是这里的标量乘法;可能指内积、外积或逐元素乘,必须看符号。
  3. 线性组合的系数可以为负;凸组合才要求非负且和为 1。
  4. 中心化只减均值,标准化还除以尺度。
  5. 梯度更新中的减号来源于最小化;最大化通常沿正梯度。

常见问答

Q1:加权平均就是线性组合吗?

是线性组合的特殊情形,并且是凸组合:权重非负且和为 1。

Q2:embedding 向量能相加吗?

代数上可以;语义上是否合理取决于训练方式。只有当模型空间确实编码了可组合关系时,向量算术才有明确含义。

Q3:为什么特征标准化会影响权重?

缩放某一特征相当于改变对应坐标轴单位。为了保持预测,参数要作相反缩放;有正则化时,缩放还会改变不同方向受到的惩罚。

练习

  1. 计算 (1,2,3)T+2(0,4,1)T(1,-2,3)^{\mathsf T}+2(0,4,-1)^{\mathsf T}
  2. 求点 (2,5)(2,5) 到点 (1,1)(-1,1) 的位移向量(从后者指向前者)。
  3. 判断 2v1v22\boldsymbol v_1-\boldsymbol v_2 是否是线性组合、仿射组合或凸组合。
  4. 求三个点 (0,0)(0,0)(3,0)(3,0)(0,6)(0,6) 的均值。
  5. 当前参数 (1,2)(1,2),梯度 (4,2)(4,-2),学习率 0.10.1,求更新后的参数。

答案与提示

  1. (1,6,1)T(1,6,1)^{\mathsf T}
  2. (3,4)T(3,4)^{\mathsf T}
  3. 是线性组合;系数和为 1,所以也是仿射组合;因有负系数,不是凸组合。
  4. (1,2)(1,2)
  5. (0.6,2.2)(0.6,2.2)