Appearance
一句话总结:Agent 评测基准按任务域分工——SWE-bench 测代码修复、WebArena/OSWorld 测网页/桌面操作、AgentBench 测综合能力、GAIA 测通用智能、τ-bench 测业务客服;结果是"Outcome 导向 + scaffold-sensitive",同模型换脚手架差异可以很大。
主流基准速查(面试默写)
| 基准 | 任务域 | 怎么测 | 适合 |
|---|---|---|---|
| SWE-bench | 软件工程 | 真实 GitHub issue:read→定位 bug→edit patch→跑测试,success=测试通过 | Coding Agent |
| WebArena | 网页操作 | 仿真站点(Reddit/GitLab/商城)完成"发帖/报 bug/找最低价" | Web Agent |
| OSWorld | 桌面操作 | 真实 OS 环境操作 | 桌面/全栈 Agent |
| AgentBench | 综合能力 | 8 类环境:OS Bash/SQL/KG/游戏/WebShop/Mind2Web/表单 | 综合 Agent 能力 |
| GAIA | 通用智能 | 问题对人不难对模型很难:多步推理+工具+多模态 | 通用助手 |
| τ-bench | 业务客服 | 零售/航空客服,Outcome + 策略一致性 | 业务 Agent + 工具 |
| TerminalBench / MLE-bench | 终端/ML 工程 | 沙箱终端真实操作 / ML 实验 | 运维/ML Agent |
关键认知(面试拉分点)
- 结果导向(Outcome)为主:大部分基准只判"任务成没成",不看轨迹质量
- scaffold-sensitive:结果强烈依赖脚手架/配置——同一个模型,换套 prompt+工具配置差异巨大
- 五维评测框架:成功率、效率、成本、鲁棒性、安全性
- 进度类指标:AgentBoard 首创 Progress Rate(不只判成败,看执行到哪一步)
选型口诀
| 场景 | 首选基准 |
|---|---|
| 代码开发/修复 | SWE-bench |
| Web 操作 | WebArena |
| 桌面/全栈操作 | OSWorld / CUA |
| 综合 Agent 能力 | AgentBench / AgentBoard |
| 业务客服 + 工具 | τ-bench |
面试要点
- 能说出 4 个主流基准(SWE-bench/WebArena/AgentBench/GAIA)各测什么
- 能讲"scaffold-sensitive"(同模型换配置差异大)
- 能说出五维评测框架
- 能按场景选基准(代码→SWE-bench、网页→WebArena)
相关概念
- [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评测方法论
- [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 基准之上的自建数据
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 通过率与门禁
- [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 评测门禁与发布