Skip to content

一句话总结:AI 是在不确定性下做推断——概率论是"世界的语言"(模型输出本质是概率分布),贝叶斯定理与最大似然估计(MLE/MAP)是"从数据学参数"的数学框架,回归分析则是参数估计最直接的落地。

概率基础(先修:离散数学-离散概率)

  • 随机变量、概率分布、条件概率、全概率公式
  • 贝叶斯定理:P(A|B) = P(B|A)P(A) / P(B)——由"结果"反推"原因",是推断的核心
  • 期望、方差、协方差、相关性(两个变量如何一起变化)

AI 里的常见分布

分布类型出现场景
伯努利 / 二项离散二分类、投币实验
泊松离散计数事件(请求到达率)
均匀连续无先验信息的默认分布
正态(高斯)连续噪声假设、初始化、中心极限
指数连续等待时间、衰减
  • 连续性很重要:离散数学的离散概率篇只覆盖离散部分,AI 大量使用连续分布与密度函数

贝叶斯视角:先验 → 似然 → 后验

  • 先验 P(A):看到数据前的信念
  • 似然 P(B|A):给定参数,数据出现的概率
  • 后验 P(A|B):看到数据后的更新信念
  • 贝叶斯公式就是这三者的关系:后验 ∝ 似然 × 先验

参数估计:MLE vs MAP

方法目标与先验的关系
MLE(最大似然)最大化 P(数据|参数)无先验,只看数据
MAP(最大后验)最大化 P(参数|数据)MLE + 先验,数据少时先验兜底
  • MLE 直觉:找一组参数,让已观测数据"最可能发生"
  • MAP 直觉:在数据似然与先验信念之间取平衡
  • 与正则化的联系:L2 正则 = 高斯先验下的 MAP、L1 正则 = 拉普拉斯先验——从贝叶斯视角理解正则项

回归分析:参数估计的落地

  • 线性回归:y = wx + b,最小二乘估计;最小二乘 = 高斯噪声假设下的 MLE
  • 多元线性回归:多个特征加权求和
  • 非线性回归:多项式 / 幂律 / 指数——先变换特征再线性拟合
  • 正则化回归:岭回归(L2)/ Lasso(L1),防止过拟合
  • 分类的对应物:逻辑回归 = 线性模型 + sigmoid,交叉熵损失(见 数学基础-信息论与损失函数

面试要点

  • 能默写贝叶斯公式并讲清"后验 ∝ 似然 × 先验"
  • 能说清 MLE 与 MAP 的差别,以及正则化的贝叶斯解释(L2=高斯先验)
  • 能讲出最小二乘为什么是 MLE 的特例
  • Agent 岗实际场景:不确定性校准、置信度阈值、贝叶斯优化调参

相关概念