Appearance
一句话总结:多模态/GUI Agent 评估分两层——OSWorld 测全桌面端到端(369 真实任务,最难最逼真),ScreenSpot 只测"眼手协调"定位(给定截图输出坐标,单元测试);UI-TARS 在 ScreenSpot-V2 94.2 vs OpenAI CUA 87.9。
两大核心基准(面试默写)
| 基准 | 测什么 | 形式 | 定位 |
|---|---|---|---|
| OSWorld | 端到端电脑任务 | 真实 Ubuntu(扩展 Win/macOS)虚拟机,369 任务跨 9 应用(Chromium/GIMP/LibreOffice),初始状态+指令+程序化成功函数 | 最难最逼真 |
| ScreenSpot | Grounding 定位 | 给定截图+指令 → 输出 (x,y) 或 bbox;1272 实例(桌面/网页/移动) | 只测"眼手协调"不测规划 |
- OSWorld-Human:加测效率(人类对比)
- Visual WebArena:910 视觉接地任务(Classifieds/Shopping/Reddit),截图输入
- Mind2Web:预录页面序列 + 轨迹分类
- OmniGUI:全模态手机环境(图像+音频+视频交错),709 轨迹/2579 步/29 应用——测全模态理解
UI-TARS 实测(拉分点)
| 基准 | UI-TARS-1.5 | OpenAI CUA | Claude 3.7 |
|---|---|---|---|
| ScreenSpot-V2 | 94.2 | 87.9 | 87.6 |
| ScreenSpot-Pro | 61.6 | 23.4 | 27.7 |
- ScreenSpot-Pro(办公/游戏/移动)差距巨大——专业界面定位是分水岭
- Poki 14 款网页游戏 100% 通关(竞品平均低得多)
选型与使用(专业度分)
- 端到端能力 → OSWorld(整机任务)
- Agent 总点歪 → ScreenSpot(定位单元测试)
- Web 场景 → Visual WebArena / Mind2Web
- 全模态 → OmniGUI
面试要点
- 能区分 OSWorld(端到端)vs ScreenSpot(定位单元)
- 能报 UI-TARS 实测数据(94.2 vs 87.9)
- 能说 OSWorld 形式(真实 VM + 程序化成功函数)
- 能按问题选基准(点歪→ScreenSpot)
相关概念
- [AI-Agent-评测基准体系](/学习笔记/AI技术/AI Agent/AI-Agent-评测基准体系) — 文本 Agent 基准
- [AI-Agent-GUI-Agent与屏幕理解](/学习笔记/AI技术/AI Agent/AI-Agent-GUI-Agent与屏幕理解) — 被测对象
- [AI-Agent-浏览器Agent与网页交互](/学习笔记/AI技术/AI Agent/AI-Agent-浏览器Agent与网页交互) — Web 场景
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标与门禁