Appearance
一句话总结:Agent 评测指标的灵魂是 pass@k vs pass^k 之分——pass@k 测能力上限(k 次至少成 1 次),pass^k 测生产可靠性(k 次全成功);配合效率/工具/成本指标 + 分层门禁 + 离线在线双轨,才构成完整评估流程。
pass@k vs pass^k(最常考,必须讲清)
| 指标 | 定义 | 哲学 | 适用 |
|---|---|---|---|
| pass@k | k 次尝试至少 1 次成功概率 | 乐观,测能力上限 | 可重试且可验证结果(工具/生成) |
| pass^k | k 次尝试全部成功概率 | 严格,测可靠性 | 面向用户的生产 Agent(客服/交易/审批) |
- 数学:pass^k = p^k——单次 90% 成功率 → pass^5 ≈ 59%(0.9⁵)
- 教训:单次成功率 90% 看起来很强,生产一致性却只有六成——"pass@1 会撒谎"
四类指标(面试默写)
| 类别 | 指标 | 含义 | 门禁建议 |
|---|---|---|---|
| 一致 | pass^k | k 次全成功概率 | pass^5 ≥ 0.7 |
| 效率 | Avg Steps/Turns | 平均步数(防死循环) | ≤ 专家轨迹 1.5x |
| 工具 | Tool Selection Accuracy | 该调哪个工具选对概率 | ≥ 95% |
| 质量 | 幻觉率 / 抗注入率 / 异常恢复 | 不编造/守得住/能兜底 | 各按业务定 |
- 成本指标:CNA(准确率/每任务美元成本)、CPS(总成本/成功次数,含失败成本)
- 鲁棒性:多次试验取稳定结论(大模型输出天然随机,单次通过不能当结论)
评估流程(分层门禁)
- 离线评估:发布前对固定数据集跑 Eval Run,抓回归、验证 prompt/模型改动
- 端到端 + 组件级:端到端测"是否工作",组件级测"为什么不工作"(定位到检索/工具/规划哪一步)
- 分层门禁:安全类/数据准确类一票否决(任何一条不过阻断发布);体验类/加分项只影响评分
- 在线评估:真实流量测分布漂移、离线集漏掉的边界、真实负载
Eval Run 记录什么(专业度拉分点)
- 数据集版本/任务数/排除项、每任务每 trial 原始状态
- 通过率 + 置信区间 + pass@k/pass^k
- token/成本/延迟/工具调用分布
- 失败类别、代表轨迹与差异
面试要点
- 能讲清 pass@k vs pass^k 并算出 0.9⁵ ≈ 59%
- 能说出四类指标与门禁值
- 能讲离线 vs 在线、端到端 vs 组件级的分工
- 能说分层门禁(安全一票否决)
相关概念
- [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评测方法论
- [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — Eval Run 的数据
- [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 在线评估的 trace 支撑
- [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 门禁与发布流程