Skip to content

一句话总结:Transformer 用"自注意力"让序列中每个词直接看到所有词(并行 + 长程依赖),靠 Q/K/V 三矩阵做"查询-匹配-加权",是 ChatGPT 到 DeepSeek 一切大模型的共同骨架——也是 Agent 面试必考第一题。

为什么需要 Transformer

对比RNN/LSTMTransformer
处理方式串行,一步依赖上一步并行,整序列同时算
长程依赖信息随距离衰减任意两词直接互相关注
训练速度慢(无法并行)快(GPU 矩阵并行)

Q、K、V:注意力的"图书馆检索"

输入序列 X,经三个可学习权重矩阵投影:

  • Q(Query)查询:我想找什么(你要搜的关键词)
  • K(Key)键:我能匹配什么(每本书的标签)
  • V(Value)值:我实际携带的信息(书的内容)

三步流程:查询 → 匹配 → 加权

  1. 用 Q 与所有 K 点积算相似度(Q·Kᵀ)
  2. 缩放除以 √d_k(d_k 为维度)——防内积过大把 softmax 推入饱和区导致梯度消失
  3. softmax 归一化成权重 → 对 V 加权求和

公式:Attention(Q,K,V) = softmax(QKᵀ/√d_k)·V

直觉例子:苹果这个词的 Q 去碰句子里所有词的 K("吃的"是动作标签、"公司的"是组织标签),匹配度高的贡献大。

多头注意力:多个角度看句子

  • 把 Q/K/V 切分成多组(如 8 头),每组独立学一个子空间关系:有的头学位置、有的学语法、有的学语义
  • 各组结果拼接后线性变换合并
  • 为什么有效:单个注意力只能学一种关系,多头并行覆盖多种模式(类似 CNN 多滤波器)

位置编码:没有顺序怎么办

Transformer 无循环无卷积,天然不知道词序——必须显式注入位置信息:

  • 正弦位置编码(原版)、可学习位置编码、旋转位置编码 RoPE(主流:相对位置感知 + 外推性好)

Masked 解码:自回归的关键

  • 训练时用掩码(mask)遮住未来 token,保证"只看过去"——模型只能根据已生成内容预测下一个词
  • 这正是"下一个词预测器"的机制来源(见 AI基础概念-大语言模型与Token

面试要点

  • 能默写缩放点积注意力公式,并讲清为什么除以 √d_k(防梯度消失/softmax 饱和)
  • 能讲清 Q/K/V 各是什么(检索类比)与三步流程
  • 能答"为什么比 RNN 适合长序列"(并行 + 直接关注任意距离)
  • 能说多头注意力的动机(多子空间关系并行)

相关概念