Appearance
专家系统是符号主义AI的代表应用,强化学习是通过奖励信号改善行为的学习方法。本笔记梳理专家系统的定义、特点、类型与知识获取过程,以及强化学习的核心概念、算法演进和应用。
专家系统
定义与特点
定义:专家系统是一种智能的计算机程序,运用知识和推理来解决只有专家才能解决的复杂问题。
编程思想对比(最大区别):
专家系统 = 知识 + 推理
传统程序 = 数据结构 + 算法特点:
- 具有专家水平的专业知识
- 能进行有效的推理
- 具有启发性、灵活性、透明性、交互性
类型
解释、诊断、预测、设计、规划、控制、修理、教学、调试
知识获取
过程四步:
- 抽取知识
- 知识的转换
- 知识的输入
- 知识的检测
强化学习
核心概念
强化学习是一种通过模拟大脑神经细胞中的奖励信号来改善行为的机器学习方法,目标是学习一个最优策略,使智能体通过接收奖励信号并将其作为回报,获得整体度量的最大化奖励。
主要特点:
- 试错学习
- 延迟反馈(不是每一步都有反馈)
- 时间是重要因素
- 当前行为影响后续接收到的数据
算法演进
| 发展阶段 | 代表方法 |
|---|---|
| Value Based(值函数) | Q-learning |
| Policy Based(策略搜索) | 策略梯度方法 |
| Actor-Critic(演员-评论家) | AC架构 |
| 时间差分 | TD学习 |
| 深度强化学习 | DQN(深度Q网络) |
应用
- AlphaGo 和 AlphaGo Zero
- 游戏训练
- 机器人控制
计算机视觉补充
图像处理基础
- 图像分割:基于像素的分割 + 基于区域不连续性的分割
- 图像锐化:高通滤波法、空域微分法,增强边缘和灰度变化剧烈位置
- 图像特征提取:提取算法决定像素是否属于图像特征,核心是"可重复性"
- 图像分析:分割 → 识别或分类 → 描述
深度卷积神经网络图像分类
经典模型:ResNet、Xception、EfficientNet
目标检测与识别
一句话总结
专家系统的编程思想是"知识+推理",区别于传统程序的"数据结构+算法";强化学习靠试错与延迟反馈学最优策略,演进主线是 Q-learning→策略梯度→Actor-Critic→DQN。