Skip to content

一句话总结:微调不是默认选项——先 RAG/提示词,解决不了再微调;问题→技术映射(格式不稳→SFT、有偏好对→DPO、可算法验证→RLVR+GRPO),LoRA/QLoRA 是主流高效适配,Agent 微调核心是工具调用格式与轨迹。

问题→技术映射(NVIDIA 速查,面试默写)

问题先试
缺领域事实RAG / 数据注入
不遵循格式Prompting → 再 SFT
需要模仿示例SFT(LoRA/QLoRA 高效适配)
有偏好 vs 拒绝样本DPO
可算法验证成功RLVR + GRPO
需要细腻人类偏好RLHF / 奖励建模
长程多工具失败环境 RL + 轨迹级奖励

三大方法

  • SFT(instruction, input, output) 三元组监督训练,base→chat;数据质量 >> 数量(几千精标 > 几万脏数据)
  • DPO:标准交叉熵替代 PPO——训练稳定(无 clip/GAE/KL 退火),TRL 几行跑
  • LoRA/QLoRA:冻结基座训小适配器,当下主流;DoRA/PiSSA 可替换提升

什么时候微调(拉分点)

✅ 推荐❌ 不推荐
稳定输出格式/风格任务快速变化
大量专业领域知识无高质量标注
prompt 很长仍不理想小众偶尔用
降推理 token 消耗
统一团队模型行为
  • Agent 微调数据:工具调用格式(JSON schema 遵守)、领域工具选择、长程轨迹

面试要点

  • 能默写问题→技术映射表
  • 能讲 SFT/DPO/LoRA 区别与适用
  • 能说"先 RAG/提示词再微调"顺序
  • 能讲 Agent 微调数据长什么样

相关概念

  • AI基础概念-大模型预训练与能力涌现 — 预训练
  • AI基础概念-LLM-API与Function-Calling — 工具格式
  • [AI-Agent-工作流编排与状态图](/学习笔记/AI技术/AI Agent/AI-Agent-工作流编排与状态图) — 长程轨迹
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 微调效果验证