Appearance
一句话总结:多模态 = "AI 的眼睛"——把图像、截图、文档、视频接进 Agent 循环:VLM 看图 → 推理 → 调用 OCR/检索/计算器等工具,或直接操控 GUI;它让 Agent 从"只能读文字"进化到"能看世界、能操作软件",也是 GUI 自动化(UI-TARS 类)与具身智能的技术底座。
为什么 Agent 需要视觉
| 输入类型 | 能做什么 |
|---|---|
| 图片 | 识别内容、场景描述、视觉问答 |
| 截图/界面 | UI 自动化:理解界面 → 点击/输入操作 |
| 文档/PDF/表格 | 文档理解、表格抽取、摘要问答 |
| 图表 | 数据趋势解读、结论提取 |
| 视频 | 帧序列理解、动态内容分析 |
技术路径(选型速查)
| 路径 | 原理 | 适用 |
|---|---|---|
| 原生多模态模型 | 模型直接支持图像输入(GPT-4o、Qwen-VL、GLM-4.6V) | 通用图像理解 |
| 模型 + 视觉编码器 | CLIP 等提特征再喂 LLM | 开源/本地部署 |
| OCR + 文本模型 | 只提取图片文字再处理 | 仅需文字识别 |
| 组合式 | 多模型各司其职、组合输出 | 复杂理解任务 |
视觉工具调用(当前最热方向)
- 模式:输入图片 → Agent 推理 → 调用检索 / 截图放大 / OCR / 搜索 / 计算器等工具 → 再看结果继续
- 趋势:原生视觉——不再外挂 OCR 预处理,而是把视觉能力直接嵌入 Agent 循环(如 DeepSeek V4-Flash-Vision-Exp)
- 输入多模态:图像/截图/文档页可直接作为工具参数(GLM-4.6V"图像即参数,结果即上下文")
- 输出多模态:工具返回的图表、网页截图,模型再视觉理解纳入后续推理
典型应用
| 应用 | 代表 | 说明 |
|---|---|---|
| GUI/桌面自动化 | 字节 UI-TARS(Agent TARS) | 截屏 + 视觉识别 + 自然语言指令,跨平台操作电脑(打开应用/浏览网页/发送消息) |
| 文档/表格理解 | 通用 VLM | 扫描件、PDF 截图、Excel 截图问答 |
| 图表分析 | 通用 VLM | 自动解读数据趋势与结论 |
| 视频理解 | 视频 LLM | 帧序列、时空推理 |
| 具身智能 | PaLM-E、RT-2 | 机器人操控,物理世界行动(最难:不可逆不可重置) |
挑战与评估
- 视觉幻觉:VLM 可能"看到"不存在的内容,且分不清什么时候该看图、什么时候不该看——幻觉治理是工程核心(对接 [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测))
- 成本:视觉 token 多,长上下文 + 多图推理开销大(对接 [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署))
- 评估基准:视觉问答(VQA)、图表/文档基准、GUI 基准(WebArena)、具身基准(Open X-Embodiment)
面试要点
- 能说出 4 条技术路径并给出选型判断(什么场景用 OCR、什么用原生多模态)
- 能讲清"视觉工具调用"闭环(看图 → 推理 → 调工具 → 再看结果)
- 能举出 UI-TARS 类 GUI 自动化例子(截屏 + 视觉识别)
- 能主动提视觉幻觉与 token 成本两个工程痛点(拉分点)
相关概念
- [AI-Agent-工具调用](/学习笔记/AI技术/AI Agent/AI-Agent-工具调用) — 工具调用的通用机制
- AI基础概念-视觉语言模型与多模态架构 — 视觉能力从哪来
- [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 视觉 token 成本治理
- [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 幻觉与视觉能力评估