Skip to content

一句话总结:多模态/GUI Agent 评估分两层——OSWorld 测全桌面端到端(369 真实任务,最难最逼真),ScreenSpot 只测"眼手协调"定位(给定截图输出坐标,单元测试);UI-TARS 在 ScreenSpot-V2 94.2 vs OpenAI CUA 87.9。

两大核心基准(面试默写)

基准测什么形式定位
OSWorld端到端电脑任务真实 Ubuntu(扩展 Win/macOS)虚拟机,369 任务跨 9 应用(Chromium/GIMP/LibreOffice),初始状态+指令+程序化成功函数最难最逼真
ScreenSpotGrounding 定位给定截图+指令 → 输出 (x,y) 或 bbox;1272 实例(桌面/网页/移动)只测"眼手协调"不测规划
  • OSWorld-Human:加测效率(人类对比)
  • Visual WebArena:910 视觉接地任务(Classifieds/Shopping/Reddit),截图输入
  • Mind2Web:预录页面序列 + 轨迹分类
  • OmniGUI:全模态手机环境(图像+音频+视频交错),709 轨迹/2579 步/29 应用——测全模态理解

UI-TARS 实测(拉分点)

基准UI-TARS-1.5OpenAI CUAClaude 3.7
ScreenSpot-V294.287.987.6
ScreenSpot-Pro61.623.427.7
  • ScreenSpot-Pro(办公/游戏/移动)差距巨大——专业界面定位是分水岭
  • Poki 14 款网页游戏 100% 通关(竞品平均低得多)

选型与使用(专业度分)

  • 端到端能力 → OSWorld(整机任务)
  • Agent 总点歪 → ScreenSpot(定位单元测试)
  • Web 场景 → Visual WebArena / Mind2Web
  • 全模态 → OmniGUI

面试要点

  • 能区分 OSWorld(端到端)vs ScreenSpot(定位单元)
  • 能报 UI-TARS 实测数据(94.2 vs 87.9)
  • 能说 OSWorld 形式(真实 VM + 程序化成功函数)
  • 能按问题选基准(点歪→ScreenSpot)

相关概念

  • [AI-Agent-评测基准体系](/学习笔记/AI技术/AI Agent/AI-Agent-评测基准体系) — 文本 Agent 基准
  • [AI-Agent-GUI-Agent与屏幕理解](/学习笔记/AI技术/AI Agent/AI-Agent-GUI-Agent与屏幕理解) — 被测对象
  • [AI-Agent-浏览器Agent与网页交互](/学习笔记/AI技术/AI Agent/AI-Agent-浏览器Agent与网页交互) — Web 场景
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标与门禁