Appearance
计算机视觉(Computer Vision)是研究如何让机器"看"的科学——利用图像传感器获取图像信号,经处理系统转换为数字信号,提取特征后实现对目标的识别、检测和控制。本笔记覆盖三大核心任务(图像分类、目标检测、图像分割)及典型应用。
概述:机器如何"看"
技术原理:图像传感器获取目标图像信号 → 图像处理系统将像素分布、颜色、亮度转为数字信号 → 多种运算处理 → 提取特征分析理解 → 识别/检测/控制。CCD 摄像头采集图像后,经图像数字化、数字图像处理、智能判断决策等模块构建判别模型(线性回归、PCA、贝叶斯决策、SVM、遗传算法、BP 神经网络等)。
发展史:
- 1966 年:明斯基让学生编程让计算机描述摄像头内容——最早任务描述
- 70-80 年代:MIT 首开课程,马尔提出"表示形式是视觉研究最重要问题",应用为 OCR、工件识别
- 90 年代:CPU 进步 + 统计方法与局部特征描述符引入,工业广泛应用
- 21 世纪:互联网海量数据 + 机器学习,人脸检测/识别、车牌识别
- 2010 年后:深度学习带来爆发式增长与产业化(人脸验证、拍照搜索、影像诊断)
挑战:处理速度(高维数据)、数据标注(人工标注费时费力无统一标准)、泛化能力(过拟合)、精度(遮挡/光照/小目标/密集排列)、多模态融合(语义不一致、时间不同步)。
任务一:图像分类
任务定义:输入一张图像,正确输出其类别(如给定 {dog, cat, eagle},分配一个或多个标签)。对计算机而言,一张 RGB 图像是一个高维矩阵(32×32 图 = 3×32×32 矩阵),分类就是找函数把像素数值映射为类别。
传统算法流程
底层特征提取(SIFT/HOG/LBP)→ 特征编码(向量量化、稀疏编码、Fisher 向量)→ 特征汇聚/空间约束(金字塔匹配)→ 分类器(SVM、随机森林)
深度学习模型(经典四架构)
| 模型 | 提出年份 | 核心思想 |
|---|---|---|
| VGG | — | 5 组卷积操作,组间最大池化降维,同组内多次连续 3×3 卷积,核数 64→512,有 11/13/16/19 层变体 |
| GoogLeNet | — | 多组 Inception 模块 + 全局均值池化替代全连接,中间层加 2 个辅助分类器,损失加权求和 |
| ResNet | — | 残差学习解决"网络加深准确度下降":残差模块含直连通路+卷积路径,特征相加 |
| DenseNet | 2017 | 每层直接连接后续所有层(密集连接),缓解梯度消失、重用特征图、减少参数 |
数据集示例:CIFAR-10 含 60000 张 32×32 图像(5 万训练 + 1 万测试),10 类标签。
任务二:目标检测
与分类的区别:分类只判断类别;检测还要给出目标位置(边界框)。
传统算法
- 滑动窗口法:不同尺度/位置滑窗,对每个窗口提取特征并分类;计算量大、效率低
- 选择性搜索法:用图像分割生成候选区域,减少计算,再特征提取+分类
深度学习算法演进(两阶段 → 一阶段)
两阶段(精度高、速度慢):
| 模型 | 改进点 |
|---|---|
| R-CNN | 选择性搜索提 2000 个候选区域 → 压缩到 227×227 → CNN 提特征 → SVM 分类;缺点是 CPU 候选提取耗时、2000 框重复计算 |
| SPP-NET | 最后卷积层后加空间金字塔池化,输入整张图而非 2000 候选框,速度约为 R-CNN 的 100 倍 |
| Fast R-CNN | 借鉴 SPP 提出单层 ROI 池化,固定维度输出 + Softmax 分类,简化流程 |
| Faster R-CNN | 特征层加 RPN(区域生成网络)替代选择性搜索,9 个锚盒,端到端共享参数 |
| Mask R-CNN | 加并行 Mask 分支做像素级掩码 + ROI Align 双线性插值,兼顾检测与实例分割 |
一阶段(速度快、精度略低):
- YOLO:把图像分 7×7 网格,目标中心落在哪个网格就由谁检测;速度约为 Faster R-CNN 的 10 倍,但对小目标、多类别同网格效果差
- YOLO v2:批量归一化 + 448 高分辨率训练 + 聚类定锚盒 + WordTree 联合 COCO/ImageNet 训练(YOLO9000,超 9000 类)
- SSD:对不同卷积层特征图做滑窗扫描,前层小锚盒检小目标、后层大锚盒检大目标,兼顾速度与精度
趋势:轻量化(移动端/嵌入式)、高精度(复杂场景)、实时性、多模态融合。
任务三:图像分割
定义:把图像划分为若干相似特征区域(颜色/纹理/亮度)。分两类:语义分割(像素分类到类别,不区分同类别实例)、实例分割(还要区分同一类别的不同实例)。
传统算法
| 方法 | 原理 | 优缺点 |
|---|---|---|
| 阈值分割 | 按灰度/颜色阈值分前景背景 | 简单高效;复杂图像差,抗噪差 |
| 边缘检测 | 灰度突变处检测边界(Sobel、Canny) | 运算快、定位准;抗噪差、边缘易不连续 |
| 区域生长 | 从种子点合并相似像素 | 利用局部空间信息,结果连续完整;种子点位置关键 |
| 聚类分割 | K-means 等按特征聚类 | 每聚类对应一个区域 |
深度学习算法
- FCN:全卷积网络,全连接层换卷积层,端到端像素级分类
- U-Net:编码器-解码器 + 跳跃连接传递特征图恢复细节,医学分割应用广泛
- Mask R-CNN:检测+实例分割一体,输出类别、位置、掩码
典型应用
- 安防监控:实时分析监控视频,人群异常检测、目标跟踪(车站/机场)、行为分析、人脸识别身份认证(银行/政府/学校)
- 无人机导航:障碍物检测(CNN)、起降平台识别实现自主起降;视觉导航隐蔽、抗干扰、可学习
- 智能工厂:自动化装配(零件识别定位)、物料搬运与仓储(智能货架、AGV)、生产监控与设备维护(磨损预测)
趋势与伦理
- 趋势:Transformer 等新型架构入局、多模态融合、算法优化、量子计算加速、应用拓展(医疗/教育/娱乐/交通)
- 伦理:就业结构调整、隐私与安全监管、算法公正性、社会公平性、数据质量与安全、统一标准
一句话总结
图像分类回答"这是什么",目标检测回答"在哪+是什么",图像分割回答"哪些像素属于它"——三任务由粗到细,是机器感知世界的核心能力。与 深度学习、自然语言处理 共同构成 AI 感知基座。