Appearance
一句话总结:微调评估三层递进——自动评测(几百题批量跑)→ 人工盲评(匿名对比取共识)→ 线上 A/B(小流量看真实业务);四组测试集把关(holdout/能力漂移/安全/配对竞技场),每次改动跑回归,单题降 5% 即排查。
三层评估(面试默写)
1. 自动化评测:几百道测试题批量跑 → 客观指标 + LLM 打分
2. 人工盲评:新旧模型匿名对比 → 多人评分取共识
3. 线上 A/B:小流量灰度 → 看真实业务指标 → 全量上线- 回炉路径:查数据/调参数 → 重训
四组测试集(拉分点,2026 playbook)
| 组 | 测什么 | 守住什么 |
|---|---|---|
| Holdout | 微调目标任务 | 目标能力达线 |
| 能力漂移 | 通用基准(不该动的) | 灾难性遗忘,漂移 <2 分 |
| 拒绝与安全 | 越狱/毒性 | 安全训练被悄悄撤销,refusal ≥ base |
| 配对竞技场 | 生产样本 head-to-head | holdout 赢但线上输 |
回归测试(深度分)
- 每次改动自动跑评测集,与上版对比
- 单题分数下降 >5% → 排查原因(数据污染/参数过拟合/能力漂移)
- 评测集纳入回归库,后续每次迭代必跑
Agent 专项指标
- 工具调用准确率(bfcl_eval 或自建测试集)
- 格式遵守率、忠实度(faithfulness)、相关度(relevancy)
模型选型(成本视角)
- F1 差异 <0.02 时选显存最低(运维成本:电费/故障率/扩容)
- 例:Phi-3-3.8B F1=0.81 显存 4.3GB 延迟降 63% vs Qwen2-7B F1=0.83 显存 10.8GB
面试要点
- 能画三层评估流程
- 能默写四组测试集
- 能讲回归规则(单题降 5%)
- 能说 Agent 专项指标与选型原则
相关概念
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 指标层
- [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 方法层
- [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — A/B 灰度
- [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 测试集