Appearance
一句话总结:微调不是默认选项——先 RAG/提示词,解决不了再微调;问题→技术映射(格式不稳→SFT、有偏好对→DPO、可算法验证→RLVR+GRPO),LoRA/QLoRA 是主流高效适配,Agent 微调核心是工具调用格式与轨迹。
问题→技术映射(NVIDIA 速查,面试默写)
| 问题 | 先试 |
|---|---|
| 缺领域事实 | RAG / 数据注入 |
| 不遵循格式 | Prompting → 再 SFT |
| 需要模仿示例 | SFT(LoRA/QLoRA 高效适配) |
| 有偏好 vs 拒绝样本 | DPO |
| 可算法验证成功 | RLVR + GRPO |
| 需要细腻人类偏好 | RLHF / 奖励建模 |
| 长程多工具失败 | 环境 RL + 轨迹级奖励 |
三大方法
- SFT:
(instruction, input, output)三元组监督训练,base→chat;数据质量 >> 数量(几千精标 > 几万脏数据) - DPO:标准交叉熵替代 PPO——训练稳定(无 clip/GAE/KL 退火),TRL 几行跑
- LoRA/QLoRA:冻结基座训小适配器,当下主流;DoRA/PiSSA 可替换提升
什么时候微调(拉分点)
| ✅ 推荐 | ❌ 不推荐 |
|---|---|
| 稳定输出格式/风格 | 任务快速变化 |
| 大量专业领域知识 | 无高质量标注 |
| prompt 很长仍不理想 | 小众偶尔用 |
| 降推理 token 消耗 | |
| 统一团队模型行为 |
- Agent 微调数据:工具调用格式(JSON schema 遵守)、领域工具选择、长程轨迹
面试要点
- 能默写问题→技术映射表
- 能讲 SFT/DPO/LoRA 区别与适用
- 能说"先 RAG/提示词再微调"顺序
- 能讲 Agent 微调数据长什么样
相关概念
- AI基础概念-大模型预训练与能力涌现 — 预训练
- AI基础概念-LLM-API与Function-Calling — 工具格式
- [AI-Agent-工作流编排与状态图](/学习笔记/AI技术/AI Agent/AI-Agent-工作流编排与状态图) — 长程轨迹
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 微调效果验证