Appearance
机器学习是人工智能的核心,使计算机能模拟人的学习行为,自动获取知识和技能,不断改善性能。本笔记梳理机器学习的分类体系、常见算法(k-最近邻、SVM、朴素贝叶斯、k-means、决策树、随机森林、集成学习)及深度学习的基本概念。
机器学习的基本概念
定义与三要素
机器学习使计算机能模拟人的学习行为,自动地通过学习获取知识和技能,不断改善性能。主要研究三方面问题:
- 学习机理:人类获取知识、技能和抽象概念的天赋能力
- 学习方法:在简化生物学习机理的基础上,用计算方法进行再现
- 学习系统:能够在一定程度上实现机器学习的系统
学习系统四部分
环境、学习、知识库、执行与评价
机器学习的分类
按学习能力分类
| 类型 | 特点 | 代表方法 |
|---|---|---|
| 有监督学习 | 需要"教师"提供正确响应,训练数据有标签 | SVM、BP学习、k-最近邻 |
| 无监督学习 | 按数据统计规律调节参数,无标签 | 聚类、自组织网络、自编码器 |
| 弱监督学习 | 数据标签允许不完全 | 半监督学习、迁移学习、强化学习 |
按学习任务分类
回归、分类、聚类、降维、密度估计、排序、优化
- 回归、分类、排序 → 有监督
- 聚类、降维、密度估计 → 无监督
按模型分类
几何模型、逻辑模型、网络模型、概率模型
常见机器学习算法
k-最近邻分类(KNN)
核心思想:通过搜索整个数据集中 k 个最相似的实例(邻居),汇总这 k 个实例的输出变量来预测新数据点。
主要过程:
- 计算训练样本与新数据点的距离(欧氏距离、曼哈顿距离、明氏距离、切氏距离)
- 对所有距离排序
- 选取前 k 个距离最小的样本
- 选取出现频率最高的类别作为预测结果
k 尽量取奇数,避免偶数出现票数相等的情况。
支持向量机(SVM)
核心思想:找到一组分割系数(法向量 w),使超平面 g(x) = wᵀx + w₀ = 0 能最佳分割不同类别数据——正确分开(训练错误率0)且分类间隔最大。
优点:
- 解决高维问题(大型特征空间)
- 解决小样本机器学习问题
- 处理非线性特征相互作用,克服局部极小值
- 无须依赖整个数据,泛化能力强
朴素贝叶斯分类器
基于贝叶斯定理,假设特征相互独立:
h(yk) = argmax P(yk) ∏ P(xi | yk)k-均值聚类算法(k-means)
无监督学习算法,将 n 个对象根据特征分为 k 个部分(k < n):
- 用随机特征向量初始化一个聚类
- 将其他样本添加到最近邻的聚类中
- 随样本增多,重新计算聚类形心
- 重新检查所有样本,确保都在最近邻聚类中,直到无样本改变所属聚类
决策树(DT)
树形结构,每个节点表示一个特征分类测试,分支代表输出,叶节点存放类别作为决策结果。
随机森林
套袋集成技术,由许多决策树组成:
- 对原始训练数据 n 次有放回采样,构建 n 个决策树
- 每棵树在节点处随机选择 m 个输入变量子集进行分类
- 每棵树预测输出类别(投票),森林选择投票最多的类别
集成学习
| 方法 | 核心思想 |
|---|---|
| 套袋算法(Bagging) | 放回抽样产生子训练集,训练 m 个分类器,投票决定最终类别 |
| 提升算法(Boosting) | 对样本集操作获得子集,用弱分类算法训练系列分类器,对当前分类器难分的数据点更好分类 |
进阶算法补充
回归家族
| 算法 | 原理 | 注意 |
|---|---|---|
| 线性回归 | 输入项乘常量后相加得输出,样本点落在直线附近,求解线性方程组确定向量 | 一元/多元 |
| 多项式回归 | 在线性回归基础上加特征更高次方,增加模型自由度捕获非线性 | 复杂度升高,过拟合风险增加 |
| 逻辑回归 | 典型的非线性回归,更多用于分类;因变量服从伯努利分布,Sigmoid 函数引入非线性 | 处理 0/1 分类问题 |
降维算法
作用:在不损失过多信息前提下减少数据维度,缓解数据复杂度和计算量随维度急剧增加的问题。
- 主成分分析(PCA):找到数据的主成分,将数据投影到低维空间(无监督,不考虑类别)
- 线性判别分析(LDA):考虑数据的类别信息,降维的同时进行分类(有监督)
应用:数据可视化(高维降到 2D/3D)、数据存储处理、模型训练。
决策树三剑客
构建决策树的关键是选择最优特征划分,常用算法在特征选择标准上不同:
- ID3:基于信息增益选择特征
- C4.5:基于信息增益率(ID3 的改进,处理连续属性与缺失值)
- CART:基于基尼指数(分类树)/均方误差(回归树),生成二叉树
关联规则挖掘
问题定义:找出数据集中满足最小支持度阈值的频繁项集,再生成满足最小置信度阈值的强关联规则。
| 算法 | 原理 | 特点 |
|---|---|---|
| Apriori | 先找频繁项集(支持度阈值),再生成关联规则(置信度阈值) | 经典、准确,但多次迭代生成大量候选项集,效率低 |
| FP-Growth | 韩家炜提出;先建 FP-tree(频繁模式树)保留关联信息,再划分条件库,"分而治之"挖掘 | 不产生候选项集,解决 Apriori 效率问题 |
梯度下降
核心思想:沿着目标函数梯度的反方向迭代更新参数,逐步逼近函数最低点(最小化损失函数)。
三种类型:
| 类型 | 更新依据 | 特点 |
|---|---|---|
| 批量梯度下降 | 所有训练样本梯度 | 保证收敛全局最优,但训练集大时极慢 |
| 随机梯度下降(SGD) | 单个随机样本梯度 | 计算快、能跳出局部最优,但收敛震荡不稳定 |
| 小批量梯度下降 | 小批量样本平均梯度 | 兼顾速度与稳定,实际最常用 |
动量(Momentum):引入对先前梯度更新的记忆,当前梯度方向与之前方向平均结合,加速收敛、避免在"狭长山谷"形损失函数处震荡。
应用:线性回归(最小化 MSE)、逻辑回归(对数损失)、推荐系统(矩阵分解)、强化学习(策略梯度)。
遗传算法
思想:基于达尔文进化论(物竞天择、适者生存)的启发式寻优算法,模拟生物遗传与进化,通过不断选择、交叉、变异找到最优解。
核心术语:基因(二进制表示个体特征)、染色体(基因集合=可能解)、适应度函数(衡量个体优劣)、交叉(基因交换重组,增加多样性)、变异(基因变动,避免局部最优)。
基本过程:初代群体 → 选择适应度高的个体 → 交叉/变异生成下一代 → 重复直至末代种群得到近似最优解。
应用:生产调度(单件/流水线车间)、函数优化、组合优化、机器学习模型参数调优。
机器学习与深度学习
- 传统机器学习:需要设计特征提取器,把原始数据转换成特征向量
- 深度学习:2006年提出,通过构建多隐层模型和海量训练数据学习更有用的特征
- 深度学习的实质:通过足够多的简单非线性模型转换组合,学习更高层次、更抽象的表达
- "深度"取决于隐藏层的数量;大数据的核心是利用数据的价值,深度学习是利用数据价值的关键技术
一句话总结
机器学习的分类看标签:有监督、无监督、弱监督;决策树三剑客按划分标准区分——ID3 用信息增益、C4.5 用信息增益率、CART 用基尼指数。