Skip to content

一句话总结:AI 的全部计算都是向量与矩阵运算——从嵌入(词向量)到注意力(矩阵乘法),线性代数是地基;特征值分解与 SVD 是"拆开矩阵看结构"的两把钥匙,低秩思想一路通向 PCA 降维和 LoRA 微调。

基本对象:从标量到张量

对象阶数AI 里的例子
标量 scalar0 阶学习率、损失值
向量 vector1 阶词嵌入(如 768 维向量)、梯度
矩阵 matrix2 阶权重 W、相似度矩阵、注意力矩阵
张量 tensorN 阶批量数据 (batch, seq, dim)、卷积特征图
  • 逐元素运算:函数 f 应用到矩阵所有元素 f(A)ᵢ,ⱼ
  • 矩阵运算:转置、加法、乘法、逆;GPU 对矩阵乘法天然并行,是大规模 AI 的硬件基础
  • 范数:L1(稀疏偏好)、L2(欧氏距离、权重衰减)、谱范数(矩阵最大奇异值)

为什么矩阵重要:AI 全是矩阵

  • 线性层 y = Wx + b:把输入向量映射到输出空间
  • 注意力机制:Attention(Q,K,V) = softmax(QKᵀ/√d)V——全是矩阵乘法
  • 嵌入检索:词向量之间的余弦相似度(见 AI基础概念-嵌入与向量检索
  • 一句话:理解了矩阵变换,就理解了神经网络的一层

特征值分解(EVD):方阵的"主骨架"

  • 定义:方阵 A = QΛQ⁻¹(Q 为特征向量矩阵,Λ 为特征值对角阵)
  • 直觉:特征向量方向不变(矩阵变换只伸缩不转动),特征值 λ 就是伸缩倍数(λ>1 拉长、0<λ<1 压缩)
  • 求法:解特征方程 det(A - λI) = 0
  • 应用:Markov 链稳态分析(第 5 章教材案例)、对称矩阵可正交对角化
  • 局限:只适用于方阵——因此需要 SVD

奇异值分解(SVD):任意矩阵都能拆

  • 定义:任意 m×n 矩阵 A = UΣVᵀ(U 是 m×m 正交阵,Σ 是 m×n 对角阵含非负奇异值,V 是 n×n 正交阵)
  • 直觉:任何线性变换都可以看成"旋转(Vᵀ)→ 沿轴伸缩(Σ)→ 旋转(U)"
  • 线性代数中最强大的工具之一:不要求方阵,任何矩阵可分解

低秩分解与 AI 应用

核心思想:保留前 k 个大特征值/奇异值(k 远小于维度),压缩数据同时保留核心信息。

应用原理
PCA 降维取协方差矩阵前 k 大特征值对应特征向量投影;主成分正交、无信息冗余,保留最大方差
数据压缩SVD 截断:只用前 k 个奇异值重建,图片/矩阵体积骤减
推荐系统用户-物品评分矩阵低秩分解(MF),补全缺失评分
大模型微调 LoRA权重增量 ΔW 用低秩近似 A·B(r 很小),只训练少量参数——低秩思想直通 [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调)

面试要点

  • 能说清 EVD 与 SVD 的区别:EVD 只对方阵,SVD 任意矩阵;对称矩阵 EVD 与 SVD 等价
  • 能讲出低秩的两个收益:压缩体积 + 保留核心信息(去噪)
  • 能报出 LoRA 的低秩本质(ΔW ≈ A·B,r 通常 8-64)——AI Agent 岗微调题高频
  • 知道为什么 GPU 快:矩阵乘法并行化

相关概念