Appearance
一句话总结:信息论是量化"不确定性"和"分布差异"的数学——熵度量一个分布多不确定,交叉熵与 KL 散度度量两个分布差多远;分类任务的本质就是最小化交叉熵(等价于最小化 KL 散度),让模型预测分布逼近真实分布。
从自信息到熵
- 自信息:I(x) = -log p(x)——事件越不可能发生,信息量越大("意料之外"才带信息)
- 熵:H(p) = -Σ p(x) log p(x)——随机变量的平均不确定性/平均信息量
- 均匀分布熵最大(最不确定,掷骰子);确定事件熵为 0
- 直觉:熵 ≈ "描述这个随机变量平均需要多少比特"
条件熵与互信息
- 条件熵 H(X|Y):已知 Y 后 X 还剩多少不确定性
- 互信息 I(X;Y) = H(X) - H(X|Y):知道 Y 让 X 的不确定性减少了多少
- 应用:特征选择(决策树 ID3/C4.5 用信息增益=互信息挑特征)、相关性分析
交叉熵与 KL 散度:度量分布差异
- 交叉熵:H(P,Q) = -Σ P(x) log Q(x)——用 Q 描述 P 的平均"意外成本"(用错了地图多走多少冤枉路)
- KL 散度:D_KL(P‖Q) = Σ P(x) log(P(x)/Q(x))——用近似分布 Q 描述真实分布 P 的信息损失
- 关键恒等式:H(P,Q) = H(P) + D_KL(P‖Q)
为什么分类损失 = 交叉熵(最常考)
推理链:
- 分类任务:真实分布 P(one-hot 标签),预测分布 Q(softmax 输出)
- 交叉熵 = 熵(P) + KL(P‖Q)
- 真实分布 P 固定 → H(P) 是常数,不依赖模型参数
- 所以:最小化交叉熵 ≡ 最小化 KL 散度 ≡ 让预测分布逼近真实分布
这就是深度学习分类任务用交叉熵(而非 MSE)的理论依据——KL 散度有明确的"分布逼近"语义。
AI 中的应用地图
| 概念 | 用在哪 |
|---|---|
| 交叉熵 | 分类损失函数、逻辑回归、语言模型(next-token 预测) |
| KL 散度 | VAE 正则项(让隐分布逼近先验)、模型蒸馏、RL 策略优化 |
| 互信息 | 特征选择、表征学习(InfoNCE 对比学习) |
| 熵 | 决策树分裂准则、RL 中的探索(策略熵) |
面试要点
- 能默写交叉熵公式并讲出与 KL 散度的关系(H = 熵 + KL)
- 能答"分类为什么用交叉熵不用 MSE":P 固定时最小化交叉熵 = 最小化 KL,有分布逼近语义;MSE 假设高斯噪声适合回归
- 能讲清 softmax + 交叉熵的组合为什么数值稳定(log 与 exp 抵消)
- Agent 岗相关:困惑度(perplexity)= 熵的指数形式,评估语言模型
相关概念
- 数学基础-人工智能中的数学导读 — 教材第 4 章度量(熵/交叉熵)对应本篇
- 数学基础-概率统计与参数估计 — 分布与估计的基础
- 人工智能导论-机器学习 — 损失函数与模型训练
- [AI-Agent-评估评测](/学习笔记/AI技术/AI Agent/AI-Agent-评估评测) — LLM-as-Judge 与困惑度