Appearance
学 AI 之前先备好两样东西:数学底子(微积分、线性代数、概率统计、最优化、形式逻辑)和工具链(TensorFlow、PyTorch 等框架),以及贯穿始终的数据处理能力。本笔记整理人工智能基础课的数学基础、常用工具与数据处理全流程,是 机器学习 等后续章节的地基。
数学基础:AI 的"语言"
微积分
定义:初等数学分析,由牛顿(力学、不定积分)与莱布尼茨(几何、定积分)共同创立,分为微分与积分两部分。
- 微分学:研究函数局部变化率,用极限思维求导数,是"变化速率"的理论
- 积分学:为定义和计算面积等数据提供通用思路与方法
在 AI 中的作用:几乎所有机器学习算法在训练或预测时都是求解最优化问题。微积分在梯度下降、反向传播中用于求解损失函数最小值以调整模型参数;高级优化算法利用微分方程的解析/近似解动态调整每个参数的学习率,平衡收敛速度与稳定性。
线性代数
定义:研究向量空间及向量空间之间映射的学问,是 AI 的基石,用于描述和操作多维空间中的向量和矩阵。
本质视角:万事万物都可抽象成某种特征的组合,在预制规则框架下以静态和动态方式观察——把具体事物抽象为数学对象并描述其特性。
| 应用领域 | 作用 |
|---|---|
| 机器学习 | 矩阵和向量空间运算完成分类、回归、聚类(线性回归预测、高斯过滤器分类) |
| 深度学习 | 矩阵分解技术加速计算,把模型参数分割成多个矩阵分配到不同 GPU,提高效率与内存利用率 |
概率论与数理统计
- 概率论:前提是随机变量分布已知,据已知分布分析其特质与规律;研究随机现象的数量规律
- 数理统计:研究对象是未知分布的随机变量,通过独立重复观察,据观察结果对原始分布做推断
在 AI 中的作用:机器学习需处理不确定量和随机量,概率论用于量化不确定性;在算法数据处理、分析、拟合和决策中提供重要支持。
最优化理论
定义:在一定约束条件下,使系统目标函数达到最大或最小的理论与方法。现代优化理论 20 世纪 40 年代发展起来,涵盖线性规划、非线性规划、动态规划、排队论、对策论、决策论、博弈论等。
AI 的目标就是最优化——几乎所有 AI 问题最终都归结为优化问题的求解。
形式逻辑
定义:研究人的认识知性阶段思维规律的学说(狭义指演绎逻辑,广义还包括归纳逻辑),靠概念、判断、推理反映事物实质。
在 AI 中的地位:理想 AI 应具备抽象意义上的学习、推理与归纳能力,若将认知过程定义为对符号的逻辑运算,AI 的基础就是形式逻辑。谓词逻辑是 知识表示 的主要方法,可实现具有自动推理能力的 AI。
常用工具:8 大开源框架速览
| 工具 | 出品方 | 定位与特点 | 适用 |
|---|---|---|---|
| TensorFlow | 谷歌 | 数据流图数值计算库;多层级、可移植,支持 GPU/TPU,自动微分 | 谷歌内部产品、科研 |
| Mahout | Apache | 可扩展机器学习经典算法实现;含聚类、分类、推荐过滤、频繁子项挖掘 | 大规模分布式 ML |
| Torch | 开源(C/Lua) | 科学数值机器学习库;n 维数组切片索引、线性代数、神经网络模型 | 科研、快速原型 |
| Spark MLlib | Apache | Spark 机器学习库;分类、回归、聚类、协同过滤、降维 + 管道 API | 海量数据、Hadoop 生态 |
| Keras | 开源(Python) | 高阶神经网络 API,可设计/调试/评估/应用/可视化深度学习模型 | 快速搭建模型 |
| CNTK | 微软 | 深度学习工具包,CPU/GPU;语音识别、机器翻译、图像识别 | 微软语音研究 |
| Caffe | 伯克利 | 专注 CNN 研究应用;速度快、模块化,GPU 加速 | 计算机视觉 |
| Scikit-learn | 开源 | 基于 NumPy/SciPy/Matplotlib 的简单 ML 与数据分析工具 | 学术与工业通用 |
数据处理:AI 的"原料生产线"
数据处理是大数据生命周期的主线,共五环:采集 → 存储 → 清洗 → 分析 → 可视化。
① 数据采集(大数据分析的前提)
- 数据类型:结构化(关系数据库)、非结构化(不规则/不完整,电商企业约 80% 数据属此类)、半结构化(有一定结构与一致性约束但非关系型)
- 采集方式:
- 日志采集:Flume、Fluentd、Logstash、Chukwa 等,分布式架构,满足每秒数百兆位采集
- 网络爬虫:Nutch、Crawler4j、Scrapy,垂直搜索引擎技术,多系统并行抓取
- API/数据库采集:微博、百度贴吧、Facebook 开放 API;或与企业合作用特定系统接口
② 数据存储(GB→TB→PB 量级)
| 类型 | 说明 | 典型 |
|---|---|---|
| 分布式存储 | 分而治之,多个自主处理单元网络互连 | HDFS、Dynamo、对象存储 |
| NoSQL | "Not Only SQL",无固定表模式,支持 Web 2.0;但缺数学基础、难强一致 | 键值、文档、图形库 |
| NewSQL | 结合 SQL+NoSQL,海量存储 + 支持 ACID/SQL,下一代方向 | — |
| 云数据库 | 部署在虚拟环境,高可扩展、按需付费 | — |
③ 数据清洗(占开发总时间 50%~70%)
- 脏数据:不完整、不规范、不准确的数据
- 清洗原理:手工清洗(简单但低效)→ 自动清洗(统计方法、数据挖掘、模式规则方法);常见方式为发掘数据模式清理、基于预定义规则清洗
- 应用场景:多库合并去重(识别指代同一实体的重复记录)、数据仓库的分解与重组
④ 数据分析(挖掘数据价值)
- 任务分类:预测任务(据某些属性预测其他属性)+ 描述任务(导出潜在联系模式:分类、回归、关联分析、聚类、推荐、异常检测、链接分析)
- 分析类型:描述性统计(频数/集中趋势/离散程度)→ 探索性分析(概括主要特征,面对脏数据有效)→ 验证性分析(假设检验证实/证伪)
- 数据挖掘:在大量数据中挖掘有用信息,揭示联系、趋势和模式;从数据搜集→认知模型渐进发展
⑤ 数据可视化(直观呈现数据)
- 三种类型:科学可视化(空间数据)、信息可视化(抽象数据结构)、可视化分析(分析推理)
- 五大标准:真实性(有据可依)、完整性(纳入背景/来源/用途)、实用性(满足需求)、艺术性(美观)、交互性(用户可控)
- 应用:金融实时监控与策略调整、医疗建模、工业监控大屏
一句话总结
数学基础是 AI 的"语法",工具是"编译器",数据处理是"原材料"。三者齐备,才进入 机器学习 的正题。