Skip to content

一句话总结:大模型先在海量文本上做"预测下一个词"(预训练)获得语言与知识,再用 Scaling Law 的"参数:数据 ≈ 1:20"配比放大规模,规模过阈值后涌现出推理、上下文学习等新能力——训练全流程是 预训练 → SFT → RLHF 三段式。

预训练:学什么

  • 目标:next-token prediction——在海量文本上学"下一个词是什么"
  • 效果:语言能力(语法/流畅)、世界知识、代码逻辑都从这步沉淀
  • 一句话:预训练决定"懂不懂",微调决定"听不听话"(对齐见 AI基础概念-RLHF与模型对齐

数据配比:喂什么

典型 LLM 配比(公开参考):

数据源占比作用
Common Crawl 网页~60%规模底座,质量参差
书籍~15%高质量长文本,语言流畅
代码(GitHub)~10%提升逻辑推理,Agent 工程能力关键
学术论文 arXiv~5%科学知识
Wikipedia~5%高质量百科
  • LLaMA 1 公开方案:CommonCrawl 67% / C4 15% / GitHub 4.5%——后续模型常见参考
  • 领域模型按域配比:代码模型给代码 80%+、数学模型给数学数据加权
  • 关键经验:代码数据占比虽小,但对推理能力贡献不成比例(结构化逻辑训练)

Scaling Law:规模怎么配

  • 核心结论(Chinchilla):给定训练算力,参数 N 与数据 D 按约 1:20 配最优——每个参数配约 20 个 token
  • 含义:参数加倍,数据也要加倍,否则浪费算力
  • 颠覆旧观念:早期只堆参数,Chinchilla 证明数据与参数要同比例增长

涌现能力:量变引起质变

  • 定义:模型规模超过阈值(经验约 50-100B 参数)后,某些能力突然出现,此前几乎没有、过线急剧提升
  • 典型例子:
    • CoT 推理:小模型说"不知道",大模型能一步步推导
    • 上下文学习(ICL):给几个例子就会新任务(不更新参数)
    • 多语言迁移:英文训练自动泛化到中文

训练全流程(面试常画)

预训练(海量文本,next-token)→ SFT 指令微调(学会"问答格式")→ RLHF/DPO 对齐(更听话更安全)
  • DeepSeek-R1 参考:Cold Start(少量 long-CoT SFT 热身让模型学会推理格式)→ GRPO 强化学习(规则验证 + 格式奖励)
  • 微调细节见 [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调)

面试要点

  • 能报出 Chinchilla 的 1:20 参数:数据比例并讲清含义
  • 能讲清涌现的定义与三个例子(CoT / ICL / 多语言迁移)
  • 能说代码数据为什么重要(不成比例提升推理)
  • 能画出 预训练→SFT→RLHF 全流程并各说一句作用

相关概念