Skip to content

一句话总结:Agent 评测基准按任务域分工——SWE-bench 测代码修复、WebArena/OSWorld 测网页/桌面操作、AgentBench 测综合能力、GAIA 测通用智能、τ-bench 测业务客服;结果是"Outcome 导向 + scaffold-sensitive",同模型换脚手架差异可以很大。

主流基准速查(面试默写)

基准任务域怎么测适合
SWE-bench软件工程真实 GitHub issue:read→定位 bug→edit patch→跑测试,success=测试通过Coding Agent
WebArena网页操作仿真站点(Reddit/GitLab/商城)完成"发帖/报 bug/找最低价"Web Agent
OSWorld桌面操作真实 OS 环境操作桌面/全栈 Agent
AgentBench综合能力8 类环境:OS Bash/SQL/KG/游戏/WebShop/Mind2Web/表单综合 Agent 能力
GAIA通用智能问题对人不难对模型很难:多步推理+工具+多模态通用助手
τ-bench业务客服零售/航空客服,Outcome + 策略一致性业务 Agent + 工具
TerminalBench / MLE-bench终端/ML 工程沙箱终端真实操作 / ML 实验运维/ML Agent

关键认知(面试拉分点)

  • 结果导向(Outcome)为主:大部分基准只判"任务成没成",不看轨迹质量
  • scaffold-sensitive:结果强烈依赖脚手架/配置——同一个模型,换套 prompt+工具配置差异巨大
  • 五维评测框架:成功率、效率、成本、鲁棒性、安全性
  • 进度类指标:AgentBoard 首创 Progress Rate(不只判成败,看执行到哪一步)

选型口诀

场景首选基准
代码开发/修复SWE-bench
Web 操作WebArena
桌面/全栈操作OSWorld / CUA
综合 Agent 能力AgentBench / AgentBoard
业务客服 + 工具τ-bench

面试要点

  • 能说出 4 个主流基准(SWE-bench/WebArena/AgentBench/GAIA)各测什么
  • 能讲"scaffold-sensitive"(同模型换配置差异大)
  • 能说出五维评测框架
  • 能按场景选基准(代码→SWE-bench、网页→WebArena)

相关概念

  • [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评测方法论
  • [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 基准之上的自建数据
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 通过率与门禁
  • [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 评测门禁与发布