Skip to content

一句话总结:微调评估三层递进——自动评测(几百题批量跑)→ 人工盲评(匿名对比取共识)→ 线上 A/B(小流量看真实业务);四组测试集把关(holdout/能力漂移/安全/配对竞技场),每次改动跑回归,单题降 5% 即排查

三层评估(面试默写)

1. 自动化评测:几百道测试题批量跑 → 客观指标 + LLM 打分
2. 人工盲评:新旧模型匿名对比 → 多人评分取共识
3. 线上 A/B:小流量灰度 → 看真实业务指标 → 全量上线
  • 回炉路径:查数据/调参数 → 重训

四组测试集(拉分点,2026 playbook)

测什么守住什么
Holdout微调目标任务目标能力达线
能力漂移通用基准(不该动的)灾难性遗忘,漂移 <2 分
拒绝与安全越狱/毒性安全训练被悄悄撤销,refusal ≥ base
配对竞技场生产样本 head-to-headholdout 赢但线上输

回归测试(深度分)

  • 每次改动自动跑评测集,与上版对比
  • 单题分数下降 >5% → 排查原因(数据污染/参数过拟合/能力漂移)
  • 评测集纳入回归库,后续每次迭代必跑

Agent 专项指标

  • 工具调用准确率(bfcl_eval 或自建测试集)
  • 格式遵守率、忠实度(faithfulness)、相关度(relevancy)

模型选型(成本视角)

  • F1 差异 <0.02 时选显存最低(运维成本:电费/故障率/扩容)
  • 例:Phi-3-3.8B F1=0.81 显存 4.3GB 延迟降 63% vs Qwen2-7B F1=0.83 显存 10.8GB

面试要点

  • 能画三层评估流程
  • 能默写四组测试集
  • 能讲回归规则(单题降 5%)
  • 能说 Agent 专项指标与选型原则

相关概念

  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标层
  • [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 方法层
  • [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — A/B 灰度
  • [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 测试集