机器学习数学基础 120 章

奇异值分解与低秩近似

层级:B|按需

1. SVD 是最通用的矩阵显微镜

特征分解主要适用于方阵,奇异值分解(SVD)适用于任意矩形矩阵。它揭示矩阵在哪些输入方向上放大多少、输出到哪些方向、有效秩是多少,并给出最佳低秩近似、伪逆和 PCA 的统一表达。

2. 分解形式

ARm×nA\in\mathbb R^{m\times n},完整 SVD 为

A=UΣVT,A=U\Sigma V^T,

其中:

  • URm×mU\in\mathbb R^{m\times m} 正交,列称左奇异向量;
  • VRn×nV\in\mathbb R^{n\times n} 正交,列称右奇异向量;
  • ΣRm×n\Sigma\in\mathbb R^{m\times n} 的主对角为非负奇异值 σ1σ20\sigma_1\ge\sigma_2\ge\cdots\ge0

若秩为 rr,精简 SVD 可写成

A=UrΣrVrT,A=U_r\Sigma_rV_r^T,

形状分别为 m×rm\times rr×rr\times rn×rn\times r

3. 三步几何解释

xVTzΣsUy.x\xrightarrow{V^T}z \xrightarrow{\Sigma}s \xrightarrow{U}y.
  1. VTV^T 把输入旋转/反射到右奇异向量坐标;
  2. Σ\Sigma 沿每个方向缩放 σi\sigma_i,并处理维度变化;
  3. UU 把结果旋转/反射到输出空间。

因此任意线性变换都可分解为“正交变换—轴向缩放—正交变换”。

4. 与特征值的关系

ATA=VΣTΣVT,A^TA=V\Sigma^T\Sigma V^T, AAT=UΣΣTUT.AA^T=U\Sigma\Sigma^TU^T.

所以:

  • 右奇异向量是 ATAA^TA 的特征向量;
  • 左奇异向量是 AATAA^T 的特征向量;
  • 非零特征值为 σi2\sigma_i^2

奇异值始终非负,而一般矩阵特征值可负或复数。

5. 秩、空间与条件数

非零奇异值个数等于秩。对应的:

  • UrU_r 张成列空间;
  • VrV_r 张成行空间;
  • 剩余右奇异向量张成零空间;
  • 剩余左奇异向量张成左零空间。

满秩方阵的 2-范数条件数为

κ2(A)=σmaxσmin.\kappa_2(A)=\frac{\sigma_{\max}}{\sigma_{\min}}.

最小奇异值接近零表示某个方向几乎被压扁,逆问题会放大噪声。

6. 秩一展开

SVD 可写为

A=i=1rσiuiviT.A=\sum_{i=1}^{r}\sigma_i u_iv_i^T.

每一项是秩一矩阵,表示一个输入方向 viv_i 到输出方向 uiu_i 的通道,强度为 σi\sigma_i。大奇异值对应主要结构,小奇异值常对应细节或噪声。

7. 最佳低秩近似

截断前 kk 项:

Ak=i=1kσiuiviT.A_k=\sum_{i=1}^{k}\sigma_i u_iv_i^T.

Eckart–Young 定理说明,在所有秩不超过 kk 的矩阵中,AkA_k 同时最小化谱范数与 Frobenius 范数误差:

AAk2=σk+1,\|A-A_k\|_2=\sigma_{k+1}, AAkF2=i>kσi2.\|A-A_k\|_F^2=\sum_{i>k}\sigma_i^2.

这是图像压缩、潜在语义分析、推荐系统和去噪的数学基础。

8. SVD 与 PCA

中心化数据矩阵 XRn×dX\in\mathbb R^{n\times d}

X=UΣVT.X=U\Sigma V^T.

样本协方差(采用 1/(n1)1/(n-1))为

S=1n1XTX=VΣ2n1VT.S=\frac1{n-1}X^TX =V\frac{\Sigma^2}{n-1}V^T.

所以 VV 的列是 PCA 主方向,方差特征值为 σi2/(n1)\sigma_i^2/(n-1)。降维坐标为

Z=XVk=UkΣk.Z=XV_k=U_k\Sigma_k.

重构为 X^=ZVkT\hat X=ZV_k^T。直接 SVD 避免显式形成 XTXX^TX,通常更稳健。

9. 伪逆与截断 SVD

A+=VΣ+UT,A^+=V\Sigma^+U^T,

把非零奇异值取倒数。小奇异值会产生巨大倒数、放大噪声。截断 SVD 把小于阈值的奇异值视为零,是一种低秩正则化;岭回归则平滑收缩而非硬截断。

10. 如何选择秩 k

常用依据:

  • 累计解释方差比例 ikσi2/iσi2\sum_{i\le k}\sigma_i^2/\sum_i\sigma_i^2
  • 奇异值碎石图的拐点;
  • 验证集性能;
  • 存储/延迟预算;
  • 噪声水平与业务可解释性。

“保留 95% 方差”只是经验规则,不保证保留 95% 预测信息。

易错点

  1. SVD 可用于矩形矩阵,特征分解不等价替代。
  2. 奇异值非负,矩阵特征值不一定。
  3. PCA 前通常要中心化;是否标准化取决于尺度语义。
  4. 最大方差方向不一定是最有监督预测力的方向。
  5. 小奇异值既可能是噪声,也可能包含任务关键信号。

常见问答

Q1:SVD 唯一吗?

奇异值唯一;奇异向量的符号可同时翻转,重复奇异值对应子空间内还可旋转。因此不要比较单个向量符号是否一致。

Q2:随机 SVD 是否不准确?

它用随机投影快速近似前几个奇异方向,对大矩阵和谱衰减明显的问题很有效,并可控制误差与迭代次数。

Q3:低秩分解和矩阵分解推荐有什么关系?

推荐模型常假设用户—物品评分矩阵由少量潜在因子生成,近似 RUVTR\approx UV^T。缺失数据使问题不同于直接对完整矩阵做 SVD,需要只在观测项上优化。

练习

  1. 对角矩阵 diag(3,2)\operatorname{diag}(3,-2) 的奇异值是什么?
  2. 矩阵奇异值为 (5,2,0,0)(5,2,0,0),秩是多少?
  3. 最佳秩 1 近似的谱范数误差是什么?
  4. 若中心化 XX 的奇异值为 6、3,样本数 n=10n=10,协方差特征值是什么?
  5. 为什么小奇异值会使伪逆不稳定?

答案与提示

  1. 3,23,2
  2. 2。
  3. σ2=2\sigma_2=2
  4. 36/9=436/9=49/9=19/9=1
  5. 取倒数后变成巨大系数,输入或舍入的微小噪声被放大。