Skip to content

一句话总结:信息论是量化"不确定性"和"分布差异"的数学——熵度量一个分布多不确定,交叉熵与 KL 散度度量两个分布差多远;分类任务的本质就是最小化交叉熵(等价于最小化 KL 散度),让模型预测分布逼近真实分布。

从自信息到熵

  • 自信息:I(x) = -log p(x)——事件越不可能发生,信息量越大("意料之外"才带信息)
  • :H(p) = -Σ p(x) log p(x)——随机变量的平均不确定性/平均信息量
    • 均匀分布熵最大(最不确定,掷骰子);确定事件熵为 0
    • 直觉:熵 ≈ "描述这个随机变量平均需要多少比特"

条件熵与互信息

  • 条件熵 H(X|Y):已知 Y 后 X 还剩多少不确定性
  • 互信息 I(X;Y) = H(X) - H(X|Y):知道 Y 让 X 的不确定性减少了多少
  • 应用:特征选择(决策树 ID3/C4.5 用信息增益=互信息挑特征)、相关性分析

交叉熵与 KL 散度:度量分布差异

  • 交叉熵:H(P,Q) = -Σ P(x) log Q(x)——用 Q 描述 P 的平均"意外成本"(用错了地图多走多少冤枉路)
  • KL 散度:D_KL(P‖Q) = Σ P(x) log(P(x)/Q(x))——用近似分布 Q 描述真实分布 P 的信息损失
  • 关键恒等式:H(P,Q) = H(P) + D_KL(P‖Q)

为什么分类损失 = 交叉熵(最常考)

推理链

  1. 分类任务:真实分布 P(one-hot 标签),预测分布 Q(softmax 输出)
  2. 交叉熵 = 熵(P) + KL(P‖Q)
  3. 真实分布 P 固定 → H(P) 是常数,不依赖模型参数
  4. 所以:最小化交叉熵 ≡ 最小化 KL 散度 ≡ 让预测分布逼近真实分布

这就是深度学习分类任务用交叉熵(而非 MSE)的理论依据——KL 散度有明确的"分布逼近"语义。

AI 中的应用地图

概念用在哪
交叉熵分类损失函数、逻辑回归、语言模型(next-token 预测)
KL 散度VAE 正则项(让隐分布逼近先验)、模型蒸馏、RL 策略优化
互信息特征选择、表征学习(InfoNCE 对比学习)
决策树分裂准则、RL 中的探索(策略熵)

面试要点

  • 能默写交叉熵公式并讲出与 KL 散度的关系(H = 熵 + KL)
  • 能答"分类为什么用交叉熵不用 MSE":P 固定时最小化交叉熵 = 最小化 KL,有分布逼近语义;MSE 假设高斯噪声适合回归
  • 能讲清 softmax + 交叉熵的组合为什么数值稳定(log 与 exp 抵消)
  • Agent 岗相关:困惑度(perplexity)= 熵的指数形式,评估语言模型

相关概念