Skip to content

自然语言处理(Natural Language Processing, NLP)是利用计算机对自然语言的形、音、义进行处理——对字、词、句、篇章进行输入、输出、识别、分析、理解、生成的操作和加工,是计算机科学、人工智能与语言学的交叉学科。本笔记覆盖 NLP 的工作原理、理解五层次、五大应用与核心挑战。

发展历程

时期时间关键事件
萌芽期1956 前1948 香农将马尔可夫过程概率模型用于语言;1952 贝尔实验室启动语音识别;1956 乔姆斯基提出上下文无关语法
符号/随机分派期1957-1970符号派(乔姆斯基形式语言理论)vs 随机派(贝叶斯统计方法);建立布朗美国英语语料库
低谷期1971-1993应用难以实现、信心受挫;但 HMM 统计方法在语音识别获得成功,80 年代话语分析进展
复苏融合期1994-2010算力提升 + 互联网商业化,统计/实例/规则方法融合,语料库技术蓬勃发展
深度学习时代2010 至今CNN/RNN 应用于 NLP;2017 谷歌提出 Transformer,催生 BERT、GPT 系列预训练模型

工作原理四步

  1. 语料预处理:语料清洗(去重/对齐/删除噪声)、分词(规则或统计)、词性标注(最大熵、HMM)、去停用词
  2. 特征工程:把分词表示为计算类型(一般为向量),常用词袋模型、词向量
  3. 模型训练:训练 + 参数微调,注意防止过拟合(训练集好、测试集差)
  4. 指标评价:错误率、精准度、准确率、召回率

自然语言理解(NLU)五层次

层次任务要点
语音分析从语音传输数据中区分音节/音调,找词素,识别完整句子并转文字语音识别核心
词法分析切分单词、找词素、获得语言学信息、确定词义英语切词易但找词素难(词性/数/时态),汉语找词素易但切分词难(切分歧义:"下雨天留客天留我不留")
句法分析分析句子结构,确定词/短语关系并用层次结构表达构造句法分析树;分完全/局部(依存句法)
语义分析把句法成分与目标表示关联,确定真正含义词义消歧、语义角色标注、语义依存分析;方法:语义文法、格文法
语用分析研究语言环境对使用的影响,关注讲话者/听话者模型侧重语用信息的系统

自然语言生成(NLG):按语法语义规则生成文本,含文本规划、语句规划、实现三阶段。理解与生成相辅相成(如对话系统)。

核心应用

信息检索

  • 定义:信息加工、整理、组织、存储后按需准确查找(广义);仅指查询过程(狭义)
  • 发展:1954 世界首个信息检索系统 → 60 年代脱机到联机 → 90 年代客户机/服务器模式 → 网络化
  • 应用形态:垂直检索、多媒体检索(图像/视频/语音/音乐)、移动检索、桌面检索、语音检索(Siri/Alexa)、视觉辅助检索(AR/VR)、社会网络检索(微博)

机器翻译(MT)

让计算机自动将源语言语句转换为目标语言语句(如百度翻译、微信翻译)。三大基本模式构成"金字塔"

        ┌──────┐
        │ 中间语言式 │ ← 塔顶:分析最深、最接近"理解"
        ├──────┤
        │ 转换式   │ ← 中间层次(句法/语义转换)
        ├──────┤
        │ 直译式   │ ← 塔底:词对词替换、分析最少
        └──────┘

每上升一层,分析更深、翻译质量更高,但处理难度和出错机会增加。应用:翻译机(OCR+语音)、语音同传、跨语言检索(搜狗海外搜索中英双语)。

情感分析

  • 定义:判断文本所表达的情感状态(带强烈主观因素),源自 2003 年日本学者商品评论研究
  • 核心任务:提取评论实体 + 情感倾向观点;五元组表示(目标实体,属性,评价内容,评论人,时间)
  • 应用:商品零售(量化褒贬、对比竞品)、企业舆论、金融交易(分析交易者态度)、社会舆论(掌握舆论走向)

语音识别(ASR)

  • 定义:把语音中的词汇内容转换为计算机可读文本或命令,是机器的"听觉系统"
  • 发展:1952 贝尔实验室识别 10 个数字 → 60-70 年代连续语音识别探索(进展缓慢)→ 80 年代 HMM 主导 → 2006 辛顿深度置信网络 → 2011 至今深度学习 + 端到端模型(Siri/Alexa)
  • 原理:预处理(降噪滤波)→ 特征提取(音高/音长/音色)→ 声学模型+语言模型 → 解码输出(搜索最优路径)
  • 应用:智能家居(音箱/电视控制)、企业客服(机器人客服解决约 70% 问题,金融/电信/航空为主)、车载导航

面临的问题与挑战

问题说明应对
知识表示与利用常识/专家经验难表示("transformers"多义;鸡兔同笼需常识)构建更完善知识库
数据稀疏性小语种/专业领域语料少数据增强、迁移学习
计算复杂性词语嵌入、句法解析、语义推理耗资源高效算法、并行/分布式计算、GPU/TPU
交互学习不足传统"训练-测试"循环迭代慢在线学习、强化学习
大模型局限数据偏见、伦理(隐私/内容审查)、知识更新滞后、算力成本、环境影响审核训练数据、加强监管

语言本身挑战:语义歧义("银行")、语法不规则(英语不规则动词、汉语量词)、语言动态性(新词涌现)、数据质量与标注成本。

未来方向

  • 更强大的预训练模型:参数更多、结构更优,应用于生成/问答/翻译
  • 多模态融合:文本+图像+音频+视频(图像描述、智能安防/医疗);挑战在数据对齐、特征融合
  • 个性化服务:用户建模、隐私保护、个性化推荐
  • 与神经科学结合:构建类脑语言理解模型;量子计算探索

一句话总结

NLP 让机器读懂人类语言:理解五层次打底,信息检索/机器翻译/情感分析/语音识别是四大支柱,知识表示、数据稀疏与算力是长期瓶颈。预训练大模型时代,NLP 正与 计算机视觉知识图谱 走向多模态融合。