Skip to content

一句话总结:微调实战五步——数据(工具调用轨迹,质量>>数量)→ 框架(LLaMA-Factory/TRL/Unsloth)→ LoRA 超参(r 8-128、lr 1e-4)→ 训练(3-5 epoch、小数据 LoRA 大数据全参)→ 评测去污;Unsloth 把显存门槛压到 3GB,普通笔记本可跑。

数据准备(面试默写)

  • 基本格式:question + answer 两列
  • Agent 场景:工具调用轨迹(system + user + assistant 带 tool_calls 参数)
  • 质量 >> 数量:几千精标 > 几万脏数据
  • 评测去污:训练集与评测集去重叠(7B 模型实战经验:格式规范 → 质量验证 → 配比选择 → 去污)

框架对比

框架特点
LLaMA-Factory数据注册(dataset_info.json)、WebUI、SFT/RLHF/DPO 全支持
TRLHuggingFace 训练栈
Unsloth速度 2-5x、显存省 70%、4/8-bit 量化训练、3GB 显存起步

LoRA 超参(拉分点)

  • r:8/16/32/64/128(建议从小试)
  • target_modules:q/k/v/o/gate/up/down proj 全量
  • lora_alpha:16;lora_dropout:0.05 左右
  • lr:1e-4;batch_size:1 起步

训练设置

  • 小数据集 → LoRA;大数据集 → 全参数微调
  • 3-5 epoch 通常够
  • 验证集:训练集按 10% 切分或单独选定

面试要点

  • 能讲数据准备(工具轨迹/质量>>数量/去污)
  • 能对比三框架(Unsloth 显存 3GB)
  • 能报 LoRA 超参(r/alpha/lr)
  • 能说小数据 LoRA 大数据全参

相关概念

  • [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 方法层
  • [AI-Agent-强化学习与RLVR](/学习笔记/AI技术/AI Agent/AI-Agent-强化学习与RLVR) — RL 层
  • [AI-Agent-微调评估与回归](/学习笔记/AI技术/AI Agent/AI-Agent-微调评估与回归) — 验证层
  • [AI-Agent-评测数据集构建](/学习笔记/AI技术/AI Agent/AI-Agent-评测数据集构建) — 数据质量