Skip to content

一句话总结:多模态 = "AI 的眼睛"——把图像、截图、文档、视频接进 Agent 循环:VLM 看图 → 推理 → 调用 OCR/检索/计算器等工具,或直接操控 GUI;它让 Agent 从"只能读文字"进化到"能看世界、能操作软件",也是 GUI 自动化(UI-TARS 类)与具身智能的技术底座。

为什么 Agent 需要视觉

输入类型能做什么
图片识别内容、场景描述、视觉问答
截图/界面UI 自动化:理解界面 → 点击/输入操作
文档/PDF/表格文档理解、表格抽取、摘要问答
图表数据趋势解读、结论提取
视频帧序列理解、动态内容分析

技术路径(选型速查)

路径原理适用
原生多模态模型模型直接支持图像输入(GPT-4o、Qwen-VL、GLM-4.6V)通用图像理解
模型 + 视觉编码器CLIP 等提特征再喂 LLM开源/本地部署
OCR + 文本模型只提取图片文字再处理仅需文字识别
组合式多模型各司其职、组合输出复杂理解任务

视觉工具调用(当前最热方向)

  • 模式:输入图片 → Agent 推理 → 调用检索 / 截图放大 / OCR / 搜索 / 计算器等工具 → 再看结果继续
  • 趋势:原生视觉——不再外挂 OCR 预处理,而是把视觉能力直接嵌入 Agent 循环(如 DeepSeek V4-Flash-Vision-Exp)
  • 输入多模态:图像/截图/文档页可直接作为工具参数(GLM-4.6V"图像即参数,结果即上下文")
  • 输出多模态:工具返回的图表、网页截图,模型再视觉理解纳入后续推理

典型应用

应用代表说明
GUI/桌面自动化字节 UI-TARS(Agent TARS)截屏 + 视觉识别 + 自然语言指令,跨平台操作电脑(打开应用/浏览网页/发送消息)
文档/表格理解通用 VLM扫描件、PDF 截图、Excel 截图问答
图表分析通用 VLM自动解读数据趋势与结论
视频理解视频 LLM帧序列、时空推理
具身智能PaLM-E、RT-2机器人操控,物理世界行动(最难:不可逆不可重置)

挑战与评估

  • 视觉幻觉:VLM 可能"看到"不存在的内容,且分不清什么时候该看图、什么时候不该看——幻觉治理是工程核心(对接 [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测))
  • 成本:视觉 token 多,长上下文 + 多图推理开销大(对接 [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署))
  • 评估基准:视觉问答(VQA)、图表/文档基准、GUI 基准(WebArena)、具身基准(Open X-Embodiment)

面试要点

  • 能说出 4 条技术路径并给出选型判断(什么场景用 OCR、什么用原生多模态)
  • 能讲清"视觉工具调用"闭环(看图 → 推理 → 调工具 → 再看结果)
  • 能举出 UI-TARS 类 GUI 自动化例子(截屏 + 视觉识别)
  • 能主动提视觉幻觉与 token 成本两个工程痛点(拉分点)

相关概念

  • [AI-Agent-工具调用](/学习笔记/AI技术/AI Agent/AI-Agent-工具调用) — 工具调用的通用机制
  • AI基础概念-视觉语言模型与多模态架构 — 视觉能力从哪来
  • [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 视觉 token 成本治理
  • [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 幻觉与视觉能力评估