Skip to content

一句话总结:VLM 六能力——VQA / OCR 文档理解 / 图表分析 / 视觉推理 / Grounding 定位 / 视频理解;视觉编码器把图像切 patch 成 token 喂给 LLM;传统 OCR 只出文本,OCR+VLM Pipeline 才出布局感知的结构化字段

VLM 能力谱(面试默写)

  • 视觉问答 VQA、OCR 与文档理解、图表理解(折线/柱状/饼图数据分析)、视觉推理(逻辑/数学/因果)、空间定位 Grounding(坐标或分割掩码)、视频理解(时序动作)

视觉编码(拉分点)

  • 视觉编码器(ViT/Swin)把图像切 patch → 每个 patch 映射成 token → 图像向量序列
  • CLIP 的 ViT 是最早代表;MLP projector 桥接视觉特征到 LLM
  • 长上下文:128k 可处理约 150 页 PDF 或 1 小时视频

OCR 与文档理解(拉分点)

  • OCR 局限:手写草书、低 DPI(<150)、重度压缩 JPEG、重叠文本效果差
  • 文档理解:传统 OCR 只输出文本序列缺语义结构 → OCR + VLM Pipeline:视觉编码器建模文档图像 + LLM 解码布局感知的结构化字段

选型(2026 场景表)

场景推荐模型
通用图像理解Qwen2.5-VL-7B(易部署、中文强)
高精度 OCRInternVL3-26B
视频理解Qwen2.5-VL-72B(动态分辨率)
边缘部署Qwen2.5-VL-3B
闭源 APIGemini 2.5 Pro
  • 本地 vs API 权衡:上手速度 / 数据隐私 / 成本 / 能力

面试要点

  • 能默写 VLM 六能力
  • 能讲视觉编码(patch→token)
  • 能说 OCR 局限与 OCR+VLM Pipeline
  • 能报选型场景表

相关概念

  • [AI-Agent-GUI-Agent与屏幕理解](/学习笔记/AI技术/AI Agent/AI-Agent-GUI-Agent与屏幕理解) — 屏幕层
  • [AI-Agent-视觉定位与操作](/学习笔记/AI技术/AI Agent/AI-Agent-视觉定位与操作) — 操作层
  • AI基础概念-多模态Agent与应用 — 基础层
  • AI基础概念-VLM架构 — 架构层