Appearance
一句话总结:GUI Agent 让模型"看图操作"——屏幕截图进 VLM → 理解界面元素 → 输出结构化动作 → 执行后再截图,循环到任务结束;UI-TARS 用统一动作空间 + 坐标映射 + System-2 推理把它做成端到端原生模型(35k+ star)。
核心闭环(面试默写)
初始化(任务指令+动作空间)→ 观察(截图+操作历史)→ 思考 → 动作 → PyAutoGUI 执行 → 再截图,循环- 不依赖底层接口——"只要屏幕上有东西,模型就能尝试操作"
- vs 传统 RPA:RPA 需提前录制路径、依赖 DOM/XPath;GUI Agent 看截图识别按钮/输入框,像人看屏幕
UI-TARS 四模块(字节开源)
| 模块 | 职责 |
|---|---|
| 环境感知 | 元素描述、密集字幕、GUI 问答 |
| 统一动作空间 | 跨平台标准化(桌面 click / 移动 tap 本质相同) |
| System-2 推理 | 先写"我打算做什么、为什么"再决定动作(RL 训练) |
| 经验学习 | 在线轨迹自举 + 反思调优 |
- 统一动作空间:
action_type ∈ {click, type, scroll, drag, swipe, navigate, finished}+action_inputs {start_box, end_box, text} - 坐标映射:模型输出相对坐标 → 精确映射屏幕绝对位置,适配分辨率/缩放
- 训练:600 万 GUI 教程 + 五大感知任务
面试要点
- 能画 GUI Agent 闭环(截图→VLM→动作→执行→循环)
- 能说 vs RPA 的区别(不用录制/不用 XPath)
- 能默写 UI-TARS 四模块与统一动作空间
- 能讲坐标映射(相对→绝对)
相关概念
- AI基础概念-多模态Agent与应用 — 多模态原理
- [AI-Agent-浏览器Agent与网页交互](/学习笔记/AI技术/AI Agent/AI-Agent-浏览器Agent与网页交互) — Web 场景
- [AI-Agent-多模态Agent评估基准](/学习笔记/AI技术/AI Agent/AI-Agent-多模态Agent评估基准) — 怎么测
- [AI-Agent-工具调用](/学习笔记/AI技术/AI Agent/AI-Agent-工具调用) — 动作执行层