Skip to content

一句话总结:多模态 Agent 四层架构——输入层(文本/图像/音频)→ 智能体层 → 流程层 → 输出层(图表/TTS);典型场景:文档分析、图表理解、设计稿→代码、视频时间轴;工程四关——可靠性 / 成本 / 延迟 / 评测

四层架构(面试默写)

多模态输入层(文本/图像/音频)→ 多智能体层 → 流程层 → 多模态输出层(DALL-E/TTS/图表生成)
  • 模块化可插拔:输入处理层(ASR/OCR/抽帧/编码)→ LLM 推理层 → 输出层;工具注册机制动态调度

典型应用(拉分点)

场景能力
文档理解PDF/截图/表格,跨文档抽指标(四家财报营收/利润率)
图表理解折线图拐点对应业务事件、隐性趋势
设计稿→代码识别布局/组件/配色 → HTML/CSS/JS 像素级还原 → 视觉交互修改
视频理解长视频定位关键事件、生成时间轴摘要
报销票据OCR 提取 → 规划层校验(金额之和==报销额、日期在出差期)→ 缺失字段查工具 → 冲突回问

设计稿→代码(深度分)

  • ScreenCoder 模块化三 Agent:grounding(标注结构)→ planning(CSS Grid 层级布局)→ generation(生成代码)
  • 多轮修改:"往左移一点改深蓝" → 自动定位代码修改

工程挑战(深度分)

  • 可靠性 / 成本 / 延迟 / 可控性 / 评测——多模态输入管道(OCR 错误传播)放大不确定性

面试要点

  • 能画四层架构
  • 能报典型场景表
  • 能讲 ScreenCoder 三 Agent
  • 能说工程四关

相关概念

  • [AI-Agent-多模态输入与理解](/学习笔记/AI技术/AI Agent/AI-Agent-多模态输入与理解) — 理解层
  • [AI-Agent-视觉定位与操作](/学习笔记/AI技术/AI Agent/AI-Agent-视觉定位与操作) — 操作层
  • [AI-Agent-多智能体编排模式](/学习笔记/AI技术/AI Agent/AI-Agent-多智能体编排模式) — 多 Agent 层
  • [AI-Agent-多模态Agent评估基准](/学习笔记/AI技术/AI Agent/AI-Agent-多模态Agent评估基准) — 评测层