矩阵数学系列第二篇。上一篇把矩阵看成"对空间的变换",这一篇回答两个更尖锐的问题:这个变换的"骨架"是什么?(特征值/特征向量)以及能否用远少于全部的信息近似它?(SVD 与低秩)。这两个问题是 PCA、LoRA、推荐系统、模型压缩共同的数学地基。

1. 特征向量:变换的不变方向

大多数变换会把向量连转带拉弄到新方向,但几乎每个矩阵都留着几条"特权方向"——落在这些方向上的向量,被变换后只被拉伸、不转向:

A·v = λ·v        v ≠ 0

v 叫特征向量,λ(拉伸倍数)叫特征值。几何图景:整个平面在变形,但这些轴像焊死了一样不动,只有刻度被缩放。

亲手找一次:下面的组件里你控制 v 的方向 θ,右侧实时画出 M·v——当两个箭头共线(判据亮绿)的那一刻,你就找到了一条特征向量,λ 直接读出来:

两个必看的实验:

  1. 旋转 45° 的预设:任何 θ 都无法共线——纯旋转没有实特征向量(λ 是复数)。"所有方向都在转"的矩阵,没有不变轴;
  2. 对称预设(a=d, b=c):两条特征方向互相垂直。这不是巧合,是谱定理。

2. 谱定理:对称矩阵 = 沿正交轴的纯缩放

若 A 是实对称矩阵(A = Aᵀ),它一定有 n 个互相垂直的单位特征向量 q₁…qₙ 和实特征值 λ₁…λₙ。把它们拼成矩阵:

A = Q · Λ · Qᵀ

Q 的列是特征方向(正交基),Λ 是对角阵(各轴的缩放倍数)。任何对称变换都等价于:转到特征坐标系 → 沿各轴独立缩放 → 转回来。矩阵再复杂,骨架不过是一组带缩放的垂直轴。

这条定理直接通向 PCA(主成分分析):数据协方差矩阵是对称的,它的最大特征值方向就是数据散布最开的"主方向"。降维 = 只保留前 k 个特征方向——保留散布最大的视角,扔掉接近噪声的视角。

数值健康的度量:λ_max/λ_min 是条件数的量级——两个方向的缩放差得越悬殊,求逆/解方程时误差放大得越狠(训练里梯度病的矩阵根源)。这就是为什么初始化要让权重接近"各向同性"(缩放均匀,条件数≈1)。

3. SVD:任意矩阵的"旋转—拉伸—旋转"

特征分解有两个限制:要求方阵、要求特征值实数存在。SVD(奇异值分解)对任何形状、任何矩阵都存在:

A = U · Σ · Vᵀ        (m×n 矩阵也行!)

几何读法: 任何线性变换 = 旋转(Vᵀ) → 沿正交轴拉伸(Σ) → 再旋转(U)

σ₁ ≥ σ₂ ≥ … ≥ 0 叫奇异值,是 Σ 的对角元。它们与特征值的血缘:σᵢ² 恰是 AᵀA 的特征值。写成向量形式,SVD 把矩阵拆成了秩一成分之和——上一篇外积视角的主角回来了:

A = σ₁·u₁v₁ᵀ + σ₂·u₂v₂ᵀ + σ₃·u₃v₃ᵀ + …

每个成分是一个"方向对 (uᵢ, vᵢ) × 强度 σᵢ"。σ 的大小排序,就是这个成分的重要性排序——这引出了本篇的落点:

4. 低秩近似:用 5% 的信息保留 95% 的"图像"

Eckart–Young 定理:截断 SVD 的前 k 项(秩 k 近似 A_k = Σᵢ≤k σᵢuᵢvᵢᵀ)是所有秩 k 矩阵中对 A 的最佳逼近(Frobenius 范数意义下)。而误差恰好等于被扔掉的奇异分量:

‖A − A_k‖² = Σᵢ>k σᵢ²

亲手感受这个"重要性排序":下面的实验台用 6 个秩一成分(σ=30,15,8,4,2,1)加噪声构造一张矩阵"图像",拖动秩 k 看重建质量、能量占比曲线、相对误差:

三个观察点:k=1 时一个方向对就抓走大头(σ₁² 占能量绝对优势);k=6 后误差停滞——再高的秩只是在"拟合噪声"(这就是低秩方法天然抗噪的原因);能量曲线快速饱和的形状,就是"有效秩低"的标志。

5. 低秩思想在 AI 中的三个化身

PCA / 降维:协方差矩阵取前 k 特征方向——最早的"embedding"思想:高维数据其实躺在一个低维流形附近。

LoRA(训练篇):微调引起的权重变化 ΔW 被假设为低秩——SVD 视角下即"少数几个 (方向对 × 强度) 主导了行为的改变"。于是只需学 A∈[r×d]、B∈[d×r] 两个小因子(参数量 2dr 而非 d²),W+BA 就是秩 r 修正。实验反复验证:训练良好的 ΔW 的奇异值谱快速衰减——Eckart-Young 保证了这个低秩截断接近最优。

推荐系统:用户×物品的巨大评分矩阵近似为 用户因子·物品因子 的低秩乘积——"品味空间的维度远小于用户数×物品数"这一经验事实,与语言模型权重的低秩性同源。

6. 数值视角的补充:不要真的算特征分解

工程上两个提醒:

  • 大矩阵的特征分解/SVD 是 O(n³),深度学习里几乎从不显式做——低秩是假设并参数化出来的(LoRA 直接把秩写进结构),而不是先有 ΔW 再分解;
  • 对称矩阵的特征值对扰动敏感度 ∝ 条件数:谱越病态,越需要正交化/归一化技巧兜底——Transformer 里的 RMSNorm、QK-Norm(架构篇)本质都在给"矩阵的谱"上保险。

7. 小结

  • 特征向量 = 变换的不变方向,λ = 拉伸倍数;纯旋转没有实特征方向;
  • 谱定理:对称阵 = 正交旋转 + 各轴独立缩放——PCA 的地基,条件数量化矩阵的"病态程度";
  • SVD 对任意矩阵成立:A = Σσᵢ·uᵢvᵢᵀ,奇异值排序 = 成分重要性排序;
  • Eckart-Young:截断 SVD 是最佳低秩近似,误差 = 被丢弃的 σ² 之和——LoRA、PCA、推荐系统共享这条定理;
  • 实践中低秩是"设计出来的自由度",不是"算出来的分解"。

下一篇把镜头切回神经网络:前向传播的每一层、反向传播的每一个梯度,如何全部落在本篇和上一篇建立的矩阵语言里。