Skip to content

一句话总结:Agent 评测指标的灵魂是 pass@k vs pass^k 之分——pass@k 测能力上限(k 次至少成 1 次),pass^k 测生产可靠性(k 次全成功);配合效率/工具/成本指标 + 分层门禁 + 离线在线双轨,才构成完整评估流程。

pass@k vs pass^k(最常考,必须讲清)

指标定义哲学适用
pass@kk 次尝试至少 1 次成功概率乐观,测能力上限可重试且可验证结果(工具/生成)
pass^kk 次尝试全部成功概率严格,测可靠性面向用户的生产 Agent(客服/交易/审批)
  • 数学:pass^k = p^k——单次 90% 成功率 → pass^5 ≈ 59%(0.9⁵)
  • 教训:单次成功率 90% 看起来很强,生产一致性却只有六成——"pass@1 会撒谎"

四类指标(面试默写)

类别指标含义门禁建议
一致pass^kk 次全成功概率pass^5 ≥ 0.7
效率Avg Steps/Turns平均步数(防死循环)≤ 专家轨迹 1.5x
工具Tool Selection Accuracy该调哪个工具选对概率≥ 95%
质量幻觉率 / 抗注入率 / 异常恢复不编造/守得住/能兜底各按业务定
  • 成本指标:CNA(准确率/每任务美元成本)、CPS(总成本/成功次数,含失败成本)
  • 鲁棒性:多次试验取稳定结论(大模型输出天然随机,单次通过不能当结论)

评估流程(分层门禁)

  1. 离线评估:发布前对固定数据集跑 Eval Run,抓回归、验证 prompt/模型改动
  2. 端到端 + 组件级:端到端测"是否工作",组件级测"为什么不工作"(定位到检索/工具/规划哪一步)
  3. 分层门禁:安全类/数据准确类一票否决(任何一条不过阻断发布);体验类/加分项只影响评分
  4. 在线评估:真实流量测分布漂移、离线集漏掉的边界、真实负载

Eval Run 记录什么(专业度拉分点)

  • 数据集版本/任务数/排除项、每任务每 trial 原始状态
  • 通过率 + 置信区间 + pass@k/pass^k
  • token/成本/延迟/工具调用分布
  • 失败类别、代表轨迹与差异

面试要点

  • 能讲清 pass@k vs pass^k 并算出 0.9⁵ ≈ 59%
  • 能说出四类指标与门禁值
  • 能讲离线 vs 在线、端到端 vs 组件级的分工
  • 能说分层门禁(安全一票否决)

相关概念

  • [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评测方法论
  • [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — Eval Run 的数据
  • [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 在线评估的 trace 支撑
  • [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 门禁与发布流程