Appearance
一句话总结:VLM 六能力——VQA / OCR 文档理解 / 图表分析 / 视觉推理 / Grounding 定位 / 视频理解;视觉编码器把图像切 patch 成 token 喂给 LLM;传统 OCR 只出文本,OCR+VLM Pipeline 才出布局感知的结构化字段。
VLM 能力谱(面试默写)
- 视觉问答 VQA、OCR 与文档理解、图表理解(折线/柱状/饼图数据分析)、视觉推理(逻辑/数学/因果)、空间定位 Grounding(坐标或分割掩码)、视频理解(时序动作)
视觉编码(拉分点)
- 视觉编码器(ViT/Swin)把图像切 patch → 每个 patch 映射成 token → 图像向量序列
- CLIP 的 ViT 是最早代表;MLP projector 桥接视觉特征到 LLM
- 长上下文:128k 可处理约 150 页 PDF 或 1 小时视频
OCR 与文档理解(拉分点)
- OCR 局限:手写草书、低 DPI(<150)、重度压缩 JPEG、重叠文本效果差
- 文档理解:传统 OCR 只输出文本序列缺语义结构 → OCR + VLM Pipeline:视觉编码器建模文档图像 + LLM 解码布局感知的结构化字段
选型(2026 场景表)
| 场景 | 推荐模型 |
|---|---|
| 通用图像理解 | Qwen2.5-VL-7B(易部署、中文强) |
| 高精度 OCR | InternVL3-26B |
| 视频理解 | Qwen2.5-VL-72B(动态分辨率) |
| 边缘部署 | Qwen2.5-VL-3B |
| 闭源 API | Gemini 2.5 Pro |
- 本地 vs API 权衡:上手速度 / 数据隐私 / 成本 / 能力
面试要点
- 能默写 VLM 六能力
- 能讲视觉编码(patch→token)
- 能说 OCR 局限与 OCR+VLM Pipeline
- 能报选型场景表
相关概念
- [AI-Agent-GUI-Agent与屏幕理解](/学习笔记/AI技术/AI Agent/AI-Agent-GUI-Agent与屏幕理解) — 屏幕层
- [AI-Agent-视觉定位与操作](/学习笔记/AI技术/AI Agent/AI-Agent-视觉定位与操作) — 操作层
- AI基础概念-多模态Agent与应用 — 基础层
- AI基础概念-VLM架构 — 架构层