Appearance
一句话总结:Transformer 用"自注意力"让序列中每个词直接看到所有词(并行 + 长程依赖),靠 Q/K/V 三矩阵做"查询-匹配-加权",是 ChatGPT 到 DeepSeek 一切大模型的共同骨架——也是 Agent 面试必考第一题。
为什么需要 Transformer
| 对比 | RNN/LSTM | Transformer |
|---|---|---|
| 处理方式 | 串行,一步依赖上一步 | 并行,整序列同时算 |
| 长程依赖 | 信息随距离衰减 | 任意两词直接互相关注 |
| 训练速度 | 慢(无法并行) | 快(GPU 矩阵并行) |
Q、K、V:注意力的"图书馆检索"
输入序列 X,经三个可学习权重矩阵投影:
- Q(Query)查询:我想找什么(你要搜的关键词)
- K(Key)键:我能匹配什么(每本书的标签)
- V(Value)值:我实际携带的信息(书的内容)
三步流程:查询 → 匹配 → 加权:
- 用 Q 与所有 K 点积算相似度(Q·Kᵀ)
- 缩放除以 √d_k(d_k 为维度)——防内积过大把 softmax 推入饱和区导致梯度消失
- softmax 归一化成权重 → 对 V 加权求和
公式:Attention(Q,K,V) = softmax(QKᵀ/√d_k)·V
直觉例子:苹果这个词的 Q 去碰句子里所有词的 K("吃的"是动作标签、"公司的"是组织标签),匹配度高的贡献大。
多头注意力:多个角度看句子
- 把 Q/K/V 切分成多组(如 8 头),每组独立学一个子空间关系:有的头学位置、有的学语法、有的学语义
- 各组结果拼接后线性变换合并
- 为什么有效:单个注意力只能学一种关系,多头并行覆盖多种模式(类似 CNN 多滤波器)
位置编码:没有顺序怎么办
Transformer 无循环无卷积,天然不知道词序——必须显式注入位置信息:
- 正弦位置编码(原版)、可学习位置编码、旋转位置编码 RoPE(主流:相对位置感知 + 外推性好)
Masked 解码:自回归的关键
- 训练时用掩码(mask)遮住未来 token,保证"只看过去"——模型只能根据已生成内容预测下一个词
- 这正是"下一个词预测器"的机制来源(见 AI基础概念-大语言模型与Token)
面试要点
- 能默写缩放点积注意力公式,并讲清为什么除以 √d_k(防梯度消失/softmax 饱和)
- 能讲清 Q/K/V 各是什么(检索类比)与三步流程
- 能答"为什么比 RNN 适合长序列"(并行 + 直接关注任意距离)
- 能说多头注意力的动机(多子空间关系并行)
相关概念
- AI基础概念-大语言模型与Token — Token 与自回归的地基
- 数学基础-线性代数与矩阵分解 — 注意力的矩阵本质
- 人工智能导论-神经网络与深度学习 — 网络整体框架
- AI基础概念-大模型预训练与能力涌现 — Transformer 怎么被训练出来