Skip to content

机器学习是人工智能的核心,使计算机能模拟人的学习行为,自动获取知识和技能,不断改善性能。本笔记梳理机器学习的分类体系、常见算法(k-最近邻、SVM、朴素贝叶斯、k-means、决策树、随机森林、集成学习)及深度学习的基本概念。

机器学习的基本概念

定义与三要素

机器学习使计算机能模拟人的学习行为,自动地通过学习获取知识和技能,不断改善性能。主要研究三方面问题:

  1. 学习机理:人类获取知识、技能和抽象概念的天赋能力
  2. 学习方法:在简化生物学习机理的基础上,用计算方法进行再现
  3. 学习系统:能够在一定程度上实现机器学习的系统

学习系统四部分

环境、学习、知识库、执行与评价

机器学习的分类

按学习能力分类

类型特点代表方法
有监督学习需要"教师"提供正确响应,训练数据有标签SVM、BP学习、k-最近邻
无监督学习按数据统计规律调节参数,无标签聚类、自组织网络、自编码器
弱监督学习数据标签允许不完全半监督学习、迁移学习、强化学习

按学习任务分类

回归、分类、聚类、降维、密度估计、排序、优化

  • 回归、分类、排序 → 有监督
  • 聚类、降维、密度估计 → 无监督

按模型分类

几何模型、逻辑模型、网络模型、概率模型

常见机器学习算法

k-最近邻分类(KNN)

核心思想:通过搜索整个数据集中 k 个最相似的实例(邻居),汇总这 k 个实例的输出变量来预测新数据点。

主要过程

  1. 计算训练样本与新数据点的距离(欧氏距离、曼哈顿距离、明氏距离、切氏距离)
  2. 对所有距离排序
  3. 选取前 k 个距离最小的样本
  4. 选取出现频率最高的类别作为预测结果

k 尽量取奇数,避免偶数出现票数相等的情况。

支持向量机(SVM)

核心思想:找到一组分割系数(法向量 w),使超平面 g(x) = wᵀx + w₀ = 0 能最佳分割不同类别数据——正确分开(训练错误率0)且分类间隔最大。

优点

  • 解决高维问题(大型特征空间)
  • 解决小样本机器学习问题
  • 处理非线性特征相互作用,克服局部极小值
  • 无须依赖整个数据,泛化能力强

朴素贝叶斯分类器

基于贝叶斯定理,假设特征相互独立:

h(yk) = argmax P(yk) ∏ P(xi | yk)

k-均值聚类算法(k-means)

无监督学习算法,将 n 个对象根据特征分为 k 个部分(k < n):

  1. 用随机特征向量初始化一个聚类
  2. 将其他样本添加到最近邻的聚类中
  3. 随样本增多,重新计算聚类形心
  4. 重新检查所有样本,确保都在最近邻聚类中,直到无样本改变所属聚类

决策树(DT)

树形结构,每个节点表示一个特征分类测试,分支代表输出,叶节点存放类别作为决策结果。

随机森林

套袋集成技术,由许多决策树组成:

  1. 对原始训练数据 n 次有放回采样,构建 n 个决策树
  2. 每棵树在节点处随机选择 m 个输入变量子集进行分类
  3. 每棵树预测输出类别(投票),森林选择投票最多的类别

集成学习

方法核心思想
套袋算法(Bagging)放回抽样产生子训练集,训练 m 个分类器,投票决定最终类别
提升算法(Boosting)对样本集操作获得子集,用弱分类算法训练系列分类器,对当前分类器难分的数据点更好分类

进阶算法补充

回归家族

算法原理注意
线性回归输入项乘常量后相加得输出,样本点落在直线附近,求解线性方程组确定向量一元/多元
多项式回归在线性回归基础上加特征更高次方,增加模型自由度捕获非线性复杂度升高,过拟合风险增加
逻辑回归典型的非线性回归,更多用于分类;因变量服从伯努利分布,Sigmoid 函数引入非线性处理 0/1 分类问题

降维算法

作用:在不损失过多信息前提下减少数据维度,缓解数据复杂度和计算量随维度急剧增加的问题。

  • 主成分分析(PCA):找到数据的主成分,将数据投影到低维空间(无监督,不考虑类别)
  • 线性判别分析(LDA):考虑数据的类别信息,降维的同时进行分类(有监督)

应用:数据可视化(高维降到 2D/3D)、数据存储处理、模型训练。

决策树三剑客

构建决策树的关键是选择最优特征划分,常用算法在特征选择标准上不同:

  • ID3:基于信息增益选择特征
  • C4.5:基于信息增益率(ID3 的改进,处理连续属性与缺失值)
  • CART:基于基尼指数(分类树)/均方误差(回归树),生成二叉树

关联规则挖掘

问题定义:找出数据集中满足最小支持度阈值的频繁项集,再生成满足最小置信度阈值的强关联规则。

算法原理特点
Apriori先找频繁项集(支持度阈值),再生成关联规则(置信度阈值)经典、准确,但多次迭代生成大量候选项集,效率低
FP-Growth韩家炜提出;先建 FP-tree(频繁模式树)保留关联信息,再划分条件库,"分而治之"挖掘不产生候选项集,解决 Apriori 效率问题

梯度下降

核心思想:沿着目标函数梯度的反方向迭代更新参数,逐步逼近函数最低点(最小化损失函数)。

三种类型

类型更新依据特点
批量梯度下降所有训练样本梯度保证收敛全局最优,但训练集大时极慢
随机梯度下降(SGD)单个随机样本梯度计算快、能跳出局部最优,但收敛震荡不稳定
小批量梯度下降小批量样本平均梯度兼顾速度与稳定,实际最常用

动量(Momentum):引入对先前梯度更新的记忆,当前梯度方向与之前方向平均结合,加速收敛、避免在"狭长山谷"形损失函数处震荡。

应用:线性回归(最小化 MSE)、逻辑回归(对数损失)、推荐系统(矩阵分解)、强化学习(策略梯度)。

遗传算法

思想:基于达尔文进化论(物竞天择、适者生存)的启发式寻优算法,模拟生物遗传与进化,通过不断选择、交叉、变异找到最优解。

核心术语:基因(二进制表示个体特征)、染色体(基因集合=可能解)、适应度函数(衡量个体优劣)、交叉(基因交换重组,增加多样性)、变异(基因变动,避免局部最优)。

基本过程:初代群体 → 选择适应度高的个体 → 交叉/变异生成下一代 → 重复直至末代种群得到近似最优解。

应用:生产调度(单件/流水线车间)、函数优化、组合优化、机器学习模型参数调优。

机器学习与深度学习

  • 传统机器学习:需要设计特征提取器,把原始数据转换成特征向量
  • 深度学习:2006年提出,通过构建多隐层模型和海量训练数据学习更有用的特征
  • 深度学习的实质:通过足够多的简单非线性模型转换组合,学习更高层次、更抽象的表达
  • "深度"取决于隐藏层的数量;大数据的核心是利用数据的价值,深度学习是利用数据价值的关键技术

一句话总结

机器学习的分类看标签:有监督、无监督、弱监督;决策树三剑客按划分标准区分——ID3 用信息增益、C4.5 用信息增益率、CART 用基尼指数。

相关概念