Appearance
一句话总结:大模型先在海量文本上做"预测下一个词"(预训练)获得语言与知识,再用 Scaling Law 的"参数:数据 ≈ 1:20"配比放大规模,规模过阈值后涌现出推理、上下文学习等新能力——训练全流程是 预训练 → SFT → RLHF 三段式。
预训练:学什么
- 目标:next-token prediction——在海量文本上学"下一个词是什么"
- 效果:语言能力(语法/流畅)、世界知识、代码逻辑都从这步沉淀
- 一句话:预训练决定"懂不懂",微调决定"听不听话"(对齐见 AI基础概念-RLHF与模型对齐)
数据配比:喂什么
典型 LLM 配比(公开参考):
| 数据源 | 占比 | 作用 |
|---|---|---|
| Common Crawl 网页 | ~60% | 规模底座,质量参差 |
| 书籍 | ~15% | 高质量长文本,语言流畅 |
| 代码(GitHub) | ~10% | 提升逻辑推理,Agent 工程能力关键 |
| 学术论文 arXiv | ~5% | 科学知识 |
| Wikipedia | ~5% | 高质量百科 |
- LLaMA 1 公开方案:CommonCrawl 67% / C4 15% / GitHub 4.5%——后续模型常见参考
- 领域模型按域配比:代码模型给代码 80%+、数学模型给数学数据加权
- 关键经验:代码数据占比虽小,但对推理能力贡献不成比例(结构化逻辑训练)
Scaling Law:规模怎么配
- 核心结论(Chinchilla):给定训练算力,参数 N 与数据 D 按约 1:20 配最优——每个参数配约 20 个 token
- 含义:参数加倍,数据也要加倍,否则浪费算力
- 颠覆旧观念:早期只堆参数,Chinchilla 证明数据与参数要同比例增长
涌现能力:量变引起质变
- 定义:模型规模超过阈值(经验约 50-100B 参数)后,某些能力突然出现,此前几乎没有、过线急剧提升
- 典型例子:
- CoT 推理:小模型说"不知道",大模型能一步步推导
- 上下文学习(ICL):给几个例子就会新任务(不更新参数)
- 多语言迁移:英文训练自动泛化到中文
训练全流程(面试常画)
预训练(海量文本,next-token)→ SFT 指令微调(学会"问答格式")→ RLHF/DPO 对齐(更听话更安全)- DeepSeek-R1 参考:Cold Start(少量 long-CoT SFT 热身让模型学会推理格式)→ GRPO 强化学习(规则验证 + 格式奖励)
- 微调细节见 [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调)
面试要点
- 能报出 Chinchilla 的 1:20 参数:数据比例并讲清含义
- 能讲清涌现的定义与三个例子(CoT / ICL / 多语言迁移)
- 能说代码数据为什么重要(不成比例提升推理)
- 能画出 预训练→SFT→RLHF 全流程并各说一句作用
相关概念
- AI基础概念-大语言模型与Token — 预训练的对象
- AI基础概念-Transformer与注意力机制 — 预训练的模型骨架
- AI基础概念-RLHF与模型对齐 — 训练第三段
- [AI-Agent-模型微调](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调) — 训练后段的工程实践