Skip to content

一句话总结:视觉语言模型 = 视觉编码器(理解图像)+ 模态对齐层(投影到文本空间)+ LLM 骨干(推理生成)——把图像切成 patch 编码成"视觉 token"拼进 LLM,从此同一个模型既能看又能说;演进路线是 双塔对齐 → VLM 生成 → 原生多模态。

统一公式(面试默写)

VLM = 视觉编码器(感知) + 模态对齐层/投影(Connector) + LLM 骨干(推理生成)

推理流程

  1. 图像缩放 → 切成 patch(如 14×14)
  2. 视觉编码器(CLIP-ViT)把 patch 编码成视觉特征向量
  3. 投影层(线性层或 2 层 MLP)映射到 LLM 的 embedding 维度
  4. 视觉向量当作一段前缀 token 与文本 token 拼接,喂给 LLM 自回归生成

一句话:ViT 负责看,Connector 负责翻译,LLM 负责想和说。

代表模型与演进

代际代表特点
双塔对齐CLIP(2021)只对齐不生成(AI基础概念-多模态表示与CLIP对齐
VLM 生成LLaVA、LLaVA-1.5CLIP ViT-L/14 + Vicuna/LLaMA;两阶段训练(见下)
工业级 VLMQwen-VL / Qwen2.5-VL / Qwen3-VL原生 ViT + 动态分辨率;Qwen3-VL:绝对坐标定位、DeepStack 多层视觉融合、MRoPE-Interleave 时空建模
原生多模态GPT-4o、GLM-4.6V统一 token 空间,图像可直接作为工具参数输入/输出

LLaVA 两阶段训练(面试常问)

  • Stage 1 对齐预训练:LLM 冻结,只训练投影层——让视觉特征"学会"嵌入语言空间
  • Stage 2 指令微调:联合训练投影层 + LLM——用 GPT-4 生成的图文指令数据,让模型学会"看图回答"
  • LLaVA-1.5 改进:线性投影 → 2 层 MLP(可学习),微调效率更高

核心挑战

  • 两个异构模态(像素 vs 词元)在特征空间对齐是核心难点
  • 视觉 token 数量大 → 推理成本高(一张图可能几百上千 token,对接 [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署))
  • 视觉幻觉:模型"看到"不存在的东西(见 AI基础概念-多模态Agent与应用

面试要点

  • 能默写 VLM 三段式公式并画出推理流程(切 patch → 编码 → 投影 → 拼接 → 生成)
  • 能讲 LLaVA 两阶段训练各训什么(对齐只训投影 / 指令微调联合训)
  • 能说出代际演进(双塔→VLM→原生多模态)和代表模型
  • 能指出核心难点(模态对齐)与成本问题(视觉 token 多)

相关概念