Appearance
一句话总结:AI 的全部计算都是向量与矩阵运算——从嵌入(词向量)到注意力(矩阵乘法),线性代数是地基;特征值分解与 SVD 是"拆开矩阵看结构"的两把钥匙,低秩思想一路通向 PCA 降维和 LoRA 微调。
基本对象:从标量到张量
| 对象 | 阶数 | AI 里的例子 |
|---|---|---|
| 标量 scalar | 0 阶 | 学习率、损失值 |
| 向量 vector | 1 阶 | 词嵌入(如 768 维向量)、梯度 |
| 矩阵 matrix | 2 阶 | 权重 W、相似度矩阵、注意力矩阵 |
| 张量 tensor | N 阶 | 批量数据 (batch, seq, dim)、卷积特征图 |
- 逐元素运算:函数 f 应用到矩阵所有元素 f(A)ᵢ,ⱼ
- 矩阵运算:转置、加法、乘法、逆;GPU 对矩阵乘法天然并行,是大规模 AI 的硬件基础
- 范数:L1(稀疏偏好)、L2(欧氏距离、权重衰减)、谱范数(矩阵最大奇异值)
为什么矩阵重要:AI 全是矩阵
- 线性层
y = Wx + b:把输入向量映射到输出空间 - 注意力机制:
Attention(Q,K,V) = softmax(QKᵀ/√d)V——全是矩阵乘法 - 嵌入检索:词向量之间的余弦相似度(见 AI基础概念-嵌入与向量检索)
- 一句话:理解了矩阵变换,就理解了神经网络的一层
特征值分解(EVD):方阵的"主骨架"
- 定义:方阵 A = QΛQ⁻¹(Q 为特征向量矩阵,Λ 为特征值对角阵)
- 直觉:特征向量方向不变(矩阵变换只伸缩不转动),特征值 λ 就是伸缩倍数(λ>1 拉长、0<λ<1 压缩)
- 求法:解特征方程 det(A - λI) = 0
- 应用:Markov 链稳态分析(第 5 章教材案例)、对称矩阵可正交对角化
- 局限:只适用于方阵——因此需要 SVD
奇异值分解(SVD):任意矩阵都能拆
- 定义:任意 m×n 矩阵 A = UΣVᵀ(U 是 m×m 正交阵,Σ 是 m×n 对角阵含非负奇异值,V 是 n×n 正交阵)
- 直觉:任何线性变换都可以看成"旋转(Vᵀ)→ 沿轴伸缩(Σ)→ 旋转(U)"
- 线性代数中最强大的工具之一:不要求方阵,任何矩阵可分解
低秩分解与 AI 应用
核心思想:保留前 k 个大特征值/奇异值(k 远小于维度),压缩数据同时保留核心信息。
| 应用 | 原理 |
|---|---|
| PCA 降维 | 取协方差矩阵前 k 大特征值对应特征向量投影;主成分正交、无信息冗余,保留最大方差 |
| 数据压缩 | SVD 截断:只用前 k 个奇异值重建,图片/矩阵体积骤减 |
| 推荐系统 | 用户-物品评分矩阵低秩分解(MF),补全缺失评分 |
| 大模型微调 LoRA | 权重增量 ΔW 用低秩近似 A·B(r 很小),只训练少量参数——低秩思想直通 [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调) |
面试要点
- 能说清 EVD 与 SVD 的区别:EVD 只对方阵,SVD 任意矩阵;对称矩阵 EVD 与 SVD 等价
- 能讲出低秩的两个收益:压缩体积 + 保留核心信息(去噪)
- 能报出 LoRA 的低秩本质(ΔW ≈ A·B,r 通常 8-64)——AI Agent 岗微调题高频
- 知道为什么 GPU 快:矩阵乘法并行化
相关概念
- 数学基础-人工智能中的数学导读 — 教材第 2/5 章对应本篇
- AI基础概念-嵌入与向量检索 — 向量空间的落地
- [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调) — LoRA 的低秩数学
- 离散数学-代数系统 — 抽象代数视角