Appearance
一句话总结:视觉语言模型 = 视觉编码器(理解图像)+ 模态对齐层(投影到文本空间)+ LLM 骨干(推理生成)——把图像切成 patch 编码成"视觉 token"拼进 LLM,从此同一个模型既能看又能说;演进路线是 双塔对齐 → VLM 生成 → 原生多模态。
统一公式(面试默写)
VLM = 视觉编码器(感知) + 模态对齐层/投影(Connector) + LLM 骨干(推理生成)推理流程:
- 图像缩放 → 切成 patch(如 14×14)
- 视觉编码器(CLIP-ViT)把 patch 编码成视觉特征向量
- 投影层(线性层或 2 层 MLP)映射到 LLM 的 embedding 维度
- 视觉向量当作一段前缀 token 与文本 token 拼接,喂给 LLM 自回归生成
一句话:ViT 负责看,Connector 负责翻译,LLM 负责想和说。
代表模型与演进
| 代际 | 代表 | 特点 |
|---|---|---|
| 双塔对齐 | CLIP(2021) | 只对齐不生成(AI基础概念-多模态表示与CLIP对齐) |
| VLM 生成 | LLaVA、LLaVA-1.5 | CLIP ViT-L/14 + Vicuna/LLaMA;两阶段训练(见下) |
| 工业级 VLM | Qwen-VL / Qwen2.5-VL / Qwen3-VL | 原生 ViT + 动态分辨率;Qwen3-VL:绝对坐标定位、DeepStack 多层视觉融合、MRoPE-Interleave 时空建模 |
| 原生多模态 | GPT-4o、GLM-4.6V | 统一 token 空间,图像可直接作为工具参数输入/输出 |
LLaVA 两阶段训练(面试常问)
- Stage 1 对齐预训练:LLM 冻结,只训练投影层——让视觉特征"学会"嵌入语言空间
- Stage 2 指令微调:联合训练投影层 + LLM——用 GPT-4 生成的图文指令数据,让模型学会"看图回答"
- LLaVA-1.5 改进:线性投影 → 2 层 MLP(可学习),微调效率更高
核心挑战
- 两个异构模态(像素 vs 词元)在特征空间对齐是核心难点
- 视觉 token 数量大 → 推理成本高(一张图可能几百上千 token,对接 [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署))
- 视觉幻觉:模型"看到"不存在的东西(见 AI基础概念-多模态Agent与应用)
面试要点
- 能默写 VLM 三段式公式并画出推理流程(切 patch → 编码 → 投影 → 拼接 → 生成)
- 能讲 LLaVA 两阶段训练各训什么(对齐只训投影 / 指令微调联合训)
- 能说出代际演进(双塔→VLM→原生多模态)和代表模型
- 能指出核心难点(模态对齐)与成本问题(视觉 token 多)
相关概念
- AI基础概念-多模态表示与CLIP对齐 — 视觉编码器从哪来
- AI基础概念-大语言模型与Token — LLM 骨干的地基
- AI基础概念-多模态Agent与应用 — 视觉能力怎么被 Agent 用起来
- [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调) — 指令微调工程化