Skip to content

计算机视觉(Computer Vision)是研究如何让机器"看"的科学——利用图像传感器获取图像信号,经处理系统转换为数字信号,提取特征后实现对目标的识别、检测和控制。本笔记覆盖三大核心任务(图像分类、目标检测、图像分割)及典型应用。

概述:机器如何"看"

技术原理:图像传感器获取目标图像信号 → 图像处理系统将像素分布、颜色、亮度转为数字信号 → 多种运算处理 → 提取特征分析理解 → 识别/检测/控制。CCD 摄像头采集图像后,经图像数字化、数字图像处理、智能判断决策等模块构建判别模型(线性回归、PCA、贝叶斯决策、SVM、遗传算法、BP 神经网络等)。

发展史

  • 1966 年:明斯基让学生编程让计算机描述摄像头内容——最早任务描述
  • 70-80 年代:MIT 首开课程,马尔提出"表示形式是视觉研究最重要问题",应用为 OCR、工件识别
  • 90 年代:CPU 进步 + 统计方法与局部特征描述符引入,工业广泛应用
  • 21 世纪:互联网海量数据 + 机器学习,人脸检测/识别、车牌识别
  • 2010 年后:深度学习带来爆发式增长与产业化(人脸验证、拍照搜索、影像诊断)

挑战:处理速度(高维数据)、数据标注(人工标注费时费力无统一标准)、泛化能力(过拟合)、精度(遮挡/光照/小目标/密集排列)、多模态融合(语义不一致、时间不同步)。

任务一:图像分类

任务定义:输入一张图像,正确输出其类别(如给定 {dog, cat, eagle},分配一个或多个标签)。对计算机而言,一张 RGB 图像是一个高维矩阵(32×32 图 = 3×32×32 矩阵),分类就是找函数把像素数值映射为类别。

传统算法流程

底层特征提取(SIFT/HOG/LBP)→ 特征编码(向量量化、稀疏编码、Fisher 向量)→ 特征汇聚/空间约束(金字塔匹配)→ 分类器(SVM、随机森林)

深度学习模型(经典四架构)

模型提出年份核心思想
VGG5 组卷积操作,组间最大池化降维,同组内多次连续 3×3 卷积,核数 64→512,有 11/13/16/19 层变体
GoogLeNet多组 Inception 模块 + 全局均值池化替代全连接,中间层加 2 个辅助分类器,损失加权求和
ResNet残差学习解决"网络加深准确度下降":残差模块含直连通路+卷积路径,特征相加
DenseNet2017每层直接连接后续所有层(密集连接),缓解梯度消失、重用特征图、减少参数

数据集示例:CIFAR-10 含 60000 张 32×32 图像(5 万训练 + 1 万测试),10 类标签。

任务二:目标检测

与分类的区别:分类只判断类别;检测还要给出目标位置(边界框)。

传统算法

  • 滑动窗口法:不同尺度/位置滑窗,对每个窗口提取特征并分类;计算量大、效率低
  • 选择性搜索法:用图像分割生成候选区域,减少计算,再特征提取+分类

深度学习算法演进(两阶段 → 一阶段)

两阶段(精度高、速度慢)

模型改进点
R-CNN选择性搜索提 2000 个候选区域 → 压缩到 227×227 → CNN 提特征 → SVM 分类;缺点是 CPU 候选提取耗时、2000 框重复计算
SPP-NET最后卷积层后加空间金字塔池化,输入整张图而非 2000 候选框,速度约为 R-CNN 的 100 倍
Fast R-CNN借鉴 SPP 提出单层 ROI 池化,固定维度输出 + Softmax 分类,简化流程
Faster R-CNN特征层加 RPN(区域生成网络)替代选择性搜索,9 个锚盒,端到端共享参数
Mask R-CNN加并行 Mask 分支做像素级掩码 + ROI Align 双线性插值,兼顾检测与实例分割

一阶段(速度快、精度略低)

  • YOLO:把图像分 7×7 网格,目标中心落在哪个网格就由谁检测;速度约为 Faster R-CNN 的 10 倍,但对小目标、多类别同网格效果差
  • YOLO v2:批量归一化 + 448 高分辨率训练 + 聚类定锚盒 + WordTree 联合 COCO/ImageNet 训练(YOLO9000,超 9000 类)
  • SSD:对不同卷积层特征图做滑窗扫描,前层小锚盒检小目标、后层大锚盒检大目标,兼顾速度与精度

趋势:轻量化(移动端/嵌入式)、高精度(复杂场景)、实时性、多模态融合。

任务三:图像分割

定义:把图像划分为若干相似特征区域(颜色/纹理/亮度)。分两类:语义分割(像素分类到类别,不区分同类别实例)、实例分割(还要区分同一类别的不同实例)。

传统算法

方法原理优缺点
阈值分割按灰度/颜色阈值分前景背景简单高效;复杂图像差,抗噪差
边缘检测灰度突变处检测边界(Sobel、Canny)运算快、定位准;抗噪差、边缘易不连续
区域生长从种子点合并相似像素利用局部空间信息,结果连续完整;种子点位置关键
聚类分割K-means 等按特征聚类每聚类对应一个区域

深度学习算法

  • FCN:全卷积网络,全连接层换卷积层,端到端像素级分类
  • U-Net:编码器-解码器 + 跳跃连接传递特征图恢复细节,医学分割应用广泛
  • Mask R-CNN:检测+实例分割一体,输出类别、位置、掩码

典型应用

  • 安防监控:实时分析监控视频,人群异常检测、目标跟踪(车站/机场)、行为分析、人脸识别身份认证(银行/政府/学校)
  • 无人机导航:障碍物检测(CNN)、起降平台识别实现自主起降;视觉导航隐蔽、抗干扰、可学习
  • 智能工厂:自动化装配(零件识别定位)、物料搬运与仓储(智能货架、AGV)、生产监控与设备维护(磨损预测)

趋势与伦理

  • 趋势:Transformer 等新型架构入局、多模态融合、算法优化、量子计算加速、应用拓展(医疗/教育/娱乐/交通)
  • 伦理:就业结构调整、隐私与安全监管、算法公正性、社会公平性、数据质量与安全、统一标准

一句话总结

图像分类回答"这是什么",目标检测回答"在哪+是什么",图像分割回答"哪些像素属于它"——三任务由粗到细,是机器感知世界的核心能力。与 深度学习自然语言处理 共同构成 AI 感知基座。