Appearance
一句话总结:评测数据集 = Golden Set(金标集)——输入+期望输出+评分方式的策展集合,按"50-200 条核心 → 分类/长尾/对抗扩展 → 线上 Bad Case 回流"三阶段构建,四桶配比(happy/edge/adversarial/regression)保证评测真正反映生产。
Golden Set 是什么
- 定义:带期望输出的输入-输出对集合,附评分方式
- 用途:改 prompt、换模型、更新 RAG 后跑 eval 对比质量升降——可版本化、可审计、持续演进
- 工具:LangSmith Dataset(Dataset/Examples/experiments 对比)、DeepEval Synthesizer
构建三阶段(面试默写)
| 阶段 | 内容 | 目的 |
|---|---|---|
| ① 核心 Golden Set | 50-200 条高质量用例,覆盖核心业务路径 + 高风险边界 | 快速起评 |
| ② 分层扩展 | 分类采样集、长尾集、对抗集(按业务场景/风险类型) | 覆盖全貌 |
| ③ 线上回流 | Bad Case 自动回流成测试用例 | 持续进化 |
四桶配比(黄金参考)
| 桶 | 占比 | 内容 | 期望 |
|---|---|---|---|
| Happy path | 40% | 清晰输入、无歧义期望输出 | 应近 100% 通过(不通过=没准备好) |
| Edge cases | 30% | 数据不全、表述歧义、边界输入 | 多数 Agent 败在这 |
| Adversarial | 15% | Prompt 注入、诱导幻觉、应拒绝的请求 | 守住 |
| Regression | 15% | 历史失败回放 | 不倒退 |
数据来源三结合
- 生产日志(去 PII):挖 top 20 失败案例转测试用例——覆盖真实世界边界
- LLM 生成(数据演化):从文档/上下文/零开始合成,7 种演化类型保证多样性
- 领域专家编写:专家写歧义/多步推理等难例
防污染(专业度拉分点)
- 独立、未污染的评测集,理想在训练截止后收集
- continuation testing:看模型能否从部分 prompt 复现评测数据(检查记忆污染)
- 评测数据泄漏 → 虚高指标 → 错误选型
面试要点
- 能默写三阶段构建路径
- 能说出四桶配比(40/30/15/15)与各自期望
- 能讲三种数据来源(生产日志/LLM 生成/专家)
- 能主动提防污染(独立集 + continuation testing)——专业度体现
相关概念
- [AI-Agent-评测基准体系](/学习笔记/AI技术/AI Agent/AI-Agent-评测基准体系) — 现成基准 vs 自建数据
- [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评分方法论
- [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 线上回流的数据来源
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 数据集怎么用