Appearance
一句话总结:多模态 Agent 四层架构——输入层(文本/图像/音频)→ 智能体层 → 流程层 → 输出层(图表/TTS);典型场景:文档分析、图表理解、设计稿→代码、视频时间轴;工程四关——可靠性 / 成本 / 延迟 / 评测。
四层架构(面试默写)
多模态输入层(文本/图像/音频)→ 多智能体层 → 流程层 → 多模态输出层(DALL-E/TTS/图表生成)- 模块化可插拔:输入处理层(ASR/OCR/抽帧/编码)→ LLM 推理层 → 输出层;工具注册机制动态调度
典型应用(拉分点)
| 场景 | 能力 |
|---|---|
| 文档理解 | PDF/截图/表格,跨文档抽指标(四家财报营收/利润率) |
| 图表理解 | 折线图拐点对应业务事件、隐性趋势 |
| 设计稿→代码 | 识别布局/组件/配色 → HTML/CSS/JS 像素级还原 → 视觉交互修改 |
| 视频理解 | 长视频定位关键事件、生成时间轴摘要 |
| 报销票据 | OCR 提取 → 规划层校验(金额之和==报销额、日期在出差期)→ 缺失字段查工具 → 冲突回问 |
设计稿→代码(深度分)
- ScreenCoder 模块化三 Agent:grounding(标注结构)→ planning(CSS Grid 层级布局)→ generation(生成代码)
- 多轮修改:"往左移一点改深蓝" → 自动定位代码修改
工程挑战(深度分)
- 可靠性 / 成本 / 延迟 / 可控性 / 评测——多模态输入管道(OCR 错误传播)放大不确定性
面试要点
- 能画四层架构
- 能报典型场景表
- 能讲 ScreenCoder 三 Agent
- 能说工程四关
相关概念
- [AI-Agent-多模态输入与理解](/学习笔记/AI技术/AI Agent/AI-Agent-多模态输入与理解) — 理解层
- [AI-Agent-视觉定位与操作](/学习笔记/AI技术/AI Agent/AI-Agent-视觉定位与操作) — 操作层
- [AI-Agent-多智能体编排模式](/学习笔记/AI技术/AI Agent/AI-Agent-多智能体编排模式) — 多 Agent 层
- [AI-Agent-多模态Agent评估基准](/学习笔记/AI技术/AI Agent/AI-Agent-多模态Agent评估基准) — 评测层