Appearance
一句话总结:微调实战五步——数据(工具调用轨迹,质量>>数量)→ 框架(LLaMA-Factory/TRL/Unsloth)→ LoRA 超参(r 8-128、lr 1e-4)→ 训练(3-5 epoch、小数据 LoRA 大数据全参)→ 评测去污;Unsloth 把显存门槛压到 3GB,普通笔记本可跑。
数据准备(面试默写)
- 基本格式:
question + answer两列 - Agent 场景:工具调用轨迹(system + user + assistant 带 tool_calls 参数)
- 质量 >> 数量:几千精标 > 几万脏数据
- 评测去污:训练集与评测集去重叠(7B 模型实战经验:格式规范 → 质量验证 → 配比选择 → 去污)
框架对比
| 框架 | 特点 |
|---|---|
| LLaMA-Factory | 数据注册(dataset_info.json)、WebUI、SFT/RLHF/DPO 全支持 |
| TRL | HuggingFace 训练栈 |
| Unsloth | 速度 2-5x、显存省 70%、4/8-bit 量化训练、3GB 显存起步 |
LoRA 超参(拉分点)
r:8/16/32/64/128(建议从小试)target_modules:q/k/v/o/gate/up/down proj 全量lora_alpha:16;lora_dropout:0.05 左右lr:1e-4;batch_size:1 起步
训练设置
- 小数据集 → LoRA;大数据集 → 全参数微调
- 3-5 epoch 通常够
- 验证集:训练集按 10% 切分或单独选定
面试要点
- 能讲数据准备(工具轨迹/质量>>数量/去污)
- 能对比三框架(Unsloth 显存 3GB)
- 能报 LoRA 超参(r/alpha/lr)
- 能说小数据 LoRA 大数据全参
相关概念
- [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 方法层
- [AI-Agent-强化学习与RLVR](/学习笔记/AI技术/AI Agent/AI-Agent-强化学习与RLVR) — RL 层
- [AI-Agent-微调评估与回归](/学习笔记/AI技术/AI Agent/AI-Agent-微调评估与回归) — 验证层
- [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 数据质量