Appearance
一句话总结:Grounding 把"点击提交按钮"翻译成精确坐标——坐标归一化(0-1000 跨分辨率)+ DPI 校准 + 可视性检查;可靠执行靠闭环(执行-感知-校验-反思-修复);多轮 grounding(LookAgain/GUI-Actor)把定位精度拉到 UI-TARS 92.7% <5 像素。
Grounding 基础(面试默写)
- 决策层说"点击提交按钮",执行层翻译为精确坐标
- 坐标归一化:像素 → 相对比例/0-1000,跨分辨率兼容
- 参考点/视觉锚:括号、运算符、大写字母等邻近特征定位
- 执行前检查:坐标映射(DOM/SoM 标记→中心点)、DPI 缩放校准、可视性检查(是否被弹窗遮挡)
精度标杆(拉分点)
- UI-TARS:92.7% 定位误差 <5 像素(Claude 3.7 仅 51.2%);0 像素误差 38.4% vs 9.1%
闭环执行(拉分点)
- "执行-感知-校验-反思-修复":每步原子操作后重新采集屏幕 → 对比实际与预期(弹窗/跳转失败/权限不足)→ CoT 定位异常根因
多轮 Grounding 技术(深度分)
| 技术 | 机制 |
|---|---|
| LookAgain | locate 假设 → 渲染标记 → 局部 patch 作空间先验 → confirm 接受/拒绝 |
| GUI-Actor | 无坐标:attention action head 一次前向提多个候选区 + verifier 选优 |
| Aria-UI | MoE 3.9B 激活,输出归一化相对坐标 |
| LUMOS | 坐标→语义元素(ElementFromPoint:角色/名称/状态/边界框) |
面试要点
- 能讲 grounding 流程(坐标归一化/DPI/可视性)
- 能报 UI-TARS 精度数据
- 能默写闭环五步(执行-感知-校验-反思-修复)
- 能对比多轮 grounding 技术
相关概念
- [AI-Agent-GUI-Agent与屏幕理解](/学习笔记/AI技术/AI Agent/AI-Agent-GUI-Agent与屏幕理解) — 屏幕层
- [AI-Agent-多模态输入与理解](/学习笔记/AI技术/AI Agent/AI-Agent-多模态输入与理解) — 理解层
- [AI-Agent-浏览器Agent与网页交互](/学习笔记/AI技术/AI Agent/AI-Agent-浏览器Agent与网页交互) — 元素树替代方案
- [AI-Agent-多模态Agent评估基准](/学习笔记/AI技术/AI Agent/AI-Agent-多模态Agent评估基准) — 评测层