Appearance
自然语言处理(Natural Language Processing, NLP)是利用计算机对自然语言的形、音、义进行处理——对字、词、句、篇章进行输入、输出、识别、分析、理解、生成的操作和加工,是计算机科学、人工智能与语言学的交叉学科。本笔记覆盖 NLP 的工作原理、理解五层次、五大应用与核心挑战。
发展历程
| 时期 | 时间 | 关键事件 |
|---|---|---|
| 萌芽期 | 1956 前 | 1948 香农将马尔可夫过程概率模型用于语言;1952 贝尔实验室启动语音识别;1956 乔姆斯基提出上下文无关语法 |
| 符号/随机分派期 | 1957-1970 | 符号派(乔姆斯基形式语言理论)vs 随机派(贝叶斯统计方法);建立布朗美国英语语料库 |
| 低谷期 | 1971-1993 | 应用难以实现、信心受挫;但 HMM 统计方法在语音识别获得成功,80 年代话语分析进展 |
| 复苏融合期 | 1994-2010 | 算力提升 + 互联网商业化,统计/实例/规则方法融合,语料库技术蓬勃发展 |
| 深度学习时代 | 2010 至今 | CNN/RNN 应用于 NLP;2017 谷歌提出 Transformer,催生 BERT、GPT 系列预训练模型 |
工作原理四步
- 语料预处理:语料清洗(去重/对齐/删除噪声)、分词(规则或统计)、词性标注(最大熵、HMM)、去停用词
- 特征工程:把分词表示为计算类型(一般为向量),常用词袋模型、词向量
- 模型训练:训练 + 参数微调,注意防止过拟合(训练集好、测试集差)
- 指标评价:错误率、精准度、准确率、召回率
自然语言理解(NLU)五层次
| 层次 | 任务 | 要点 |
|---|---|---|
| 语音分析 | 从语音传输数据中区分音节/音调,找词素,识别完整句子并转文字 | 语音识别核心 |
| 词法分析 | 切分单词、找词素、获得语言学信息、确定词义 | 英语切词易但找词素难(词性/数/时态),汉语找词素易但切分词难(切分歧义:"下雨天留客天留我不留") |
| 句法分析 | 分析句子结构,确定词/短语关系并用层次结构表达 | 构造句法分析树;分完全/局部(依存句法) |
| 语义分析 | 把句法成分与目标表示关联,确定真正含义 | 词义消歧、语义角色标注、语义依存分析;方法:语义文法、格文法 |
| 语用分析 | 研究语言环境对使用的影响,关注讲话者/听话者模型 | 侧重语用信息的系统 |
自然语言生成(NLG):按语法语义规则生成文本,含文本规划、语句规划、实现三阶段。理解与生成相辅相成(如对话系统)。
核心应用
信息检索
- 定义:信息加工、整理、组织、存储后按需准确查找(广义);仅指查询过程(狭义)
- 发展:1954 世界首个信息检索系统 → 60 年代脱机到联机 → 90 年代客户机/服务器模式 → 网络化
- 应用形态:垂直检索、多媒体检索(图像/视频/语音/音乐)、移动检索、桌面检索、语音检索(Siri/Alexa)、视觉辅助检索(AR/VR)、社会网络检索(微博)
机器翻译(MT)
让计算机自动将源语言语句转换为目标语言语句(如百度翻译、微信翻译)。三大基本模式构成"金字塔":
┌──────┐
│ 中间语言式 │ ← 塔顶:分析最深、最接近"理解"
├──────┤
│ 转换式 │ ← 中间层次(句法/语义转换)
├──────┤
│ 直译式 │ ← 塔底:词对词替换、分析最少
└──────┘每上升一层,分析更深、翻译质量更高,但处理难度和出错机会增加。应用:翻译机(OCR+语音)、语音同传、跨语言检索(搜狗海外搜索中英双语)。
情感分析
- 定义:判断文本所表达的情感状态(带强烈主观因素),源自 2003 年日本学者商品评论研究
- 核心任务:提取评论实体 + 情感倾向观点;五元组表示(目标实体,属性,评价内容,评论人,时间)
- 应用:商品零售(量化褒贬、对比竞品)、企业舆论、金融交易(分析交易者态度)、社会舆论(掌握舆论走向)
语音识别(ASR)
- 定义:把语音中的词汇内容转换为计算机可读文本或命令,是机器的"听觉系统"
- 发展:1952 贝尔实验室识别 10 个数字 → 60-70 年代连续语音识别探索(进展缓慢)→ 80 年代 HMM 主导 → 2006 辛顿深度置信网络 → 2011 至今深度学习 + 端到端模型(Siri/Alexa)
- 原理:预处理(降噪滤波)→ 特征提取(音高/音长/音色)→ 声学模型+语言模型 → 解码输出(搜索最优路径)
- 应用:智能家居(音箱/电视控制)、企业客服(机器人客服解决约 70% 问题,金融/电信/航空为主)、车载导航
面临的问题与挑战
| 问题 | 说明 | 应对 |
|---|---|---|
| 知识表示与利用 | 常识/专家经验难表示("transformers"多义;鸡兔同笼需常识) | 构建更完善知识库 |
| 数据稀疏性 | 小语种/专业领域语料少 | 数据增强、迁移学习 |
| 计算复杂性 | 词语嵌入、句法解析、语义推理耗资源 | 高效算法、并行/分布式计算、GPU/TPU |
| 交互学习不足 | 传统"训练-测试"循环迭代慢 | 在线学习、强化学习 |
| 大模型局限 | 数据偏见、伦理(隐私/内容审查)、知识更新滞后、算力成本、环境影响 | 审核训练数据、加强监管 |
语言本身挑战:语义歧义("银行")、语法不规则(英语不规则动词、汉语量词)、语言动态性(新词涌现)、数据质量与标注成本。
未来方向
- 更强大的预训练模型:参数更多、结构更优,应用于生成/问答/翻译
- 多模态融合:文本+图像+音频+视频(图像描述、智能安防/医疗);挑战在数据对齐、特征融合
- 个性化服务:用户建模、隐私保护、个性化推荐
- 与神经科学结合:构建类脑语言理解模型;量子计算探索
一句话总结
NLP 让机器读懂人类语言:理解五层次打底,信息检索/机器翻译/情感分析/语音识别是四大支柱,知识表示、数据稀疏与算力是长期瓶颈。预训练大模型时代,NLP 正与 计算机视觉、知识图谱 走向多模态融合。