Skip to content

一句话总结:评测数据集 = Golden Set(金标集)——输入+期望输出+评分方式的策展集合,按"50-200 条核心 → 分类/长尾/对抗扩展 → 线上 Bad Case 回流"三阶段构建,四桶配比(happy/edge/adversarial/regression)保证评测真正反映生产。

Golden Set 是什么

  • 定义:带期望输出的输入-输出对集合,附评分方式
  • 用途:改 prompt、换模型、更新 RAG 后跑 eval 对比质量升降——可版本化、可审计、持续演进
  • 工具:LangSmith Dataset(Dataset/Examples/experiments 对比)、DeepEval Synthesizer

构建三阶段(面试默写)

阶段内容目的
① 核心 Golden Set50-200 条高质量用例,覆盖核心业务路径 + 高风险边界快速起评
② 分层扩展分类采样集、长尾集、对抗集(按业务场景/风险类型)覆盖全貌
③ 线上回流Bad Case 自动回流成测试用例持续进化

四桶配比(黄金参考)

占比内容期望
Happy path40%清晰输入、无歧义期望输出应近 100% 通过(不通过=没准备好)
Edge cases30%数据不全、表述歧义、边界输入多数 Agent 败在这
Adversarial15%Prompt 注入、诱导幻觉、应拒绝的请求守住
Regression15%历史失败回放不倒退

数据来源三结合

  1. 生产日志(去 PII):挖 top 20 失败案例转测试用例——覆盖真实世界边界
  2. LLM 生成(数据演化):从文档/上下文/零开始合成,7 种演化类型保证多样性
  3. 领域专家编写:专家写歧义/多步推理等难例

防污染(专业度拉分点)

  • 独立、未污染的评测集,理想在训练截止后收集
  • continuation testing:看模型能否从部分 prompt 复现评测数据(检查记忆污染)
  • 评测数据泄漏 → 虚高指标 → 错误选型

面试要点

  • 能默写三阶段构建路径
  • 能说出四桶配比(40/30/15/15)与各自期望
  • 能讲三种数据来源(生产日志/LLM 生成/专家)
  • 能主动提防污染(独立集 + continuation testing)——专业度体现

相关概念

  • [AI-Agent-评测基准体系](/学习笔记/AI技术/AI Agent/AI-Agent-评测基准体系) — 现成基准 vs 自建数据
  • [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — 评分方法论
  • [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程) — 线上回流的数据来源
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 数据集怎么用