Appearance
知识图谱(Knowledge Graph)以结构化形式描述客观世界中的概念、实体及其关系,本质上是一种语义网络——节点代表实体或概念,边代表语义关系。它把互联网信息表达成更接近人类认知的形式。本笔记覆盖知识图谱从表示、构建到推理、应用的完整链路。
基础概念
三大要素:
- 实体:知识图谱的基本组成部分,现实世界任何事物(人物/地点/组织/概念),有唯一标识符
- 关系:定义实体间联系,通常表示为三元组(主体,谓词,客体),如(苹果,是,水果)
- 属性:实体的额外信息(如"出生日期""职业"),是实体间关系的基础
发展历史:1955-1977 引文网络/语义网络起源 → 1977-2012 语义网络发展、"知识本体"研究(知识工程、语义网)→ 2012 至今 谷歌提出 Google Knowledge Graph 正式得名,成为知识服务热点。
知识类型:事实知识(最常见,如"柏拉图出生地雅典")、词汇知识(WordNet)、概念知识(类属/子类层级,YAGO/Probase)、常识知识(Cyc/ConceptNet,获取是 AI 发展瓶颈)。
时空维度:很多事实成立有时空条件,需加时间维度,如(2024-01-01,平均温度,-5℃,北京)。
知识表示与建模
两类表示方法
① 基于符号的知识表示:
| 方法 | 提出者/来源 | 特点 |
|---|---|---|
| 一阶谓词逻辑 | — | 精确、接近自然语言,但只能表达确定性知识 |
| 产生式规则 | 波斯特 | "IF-THEN",与人类因果判断相似,范畴广;知识规模大时推理效率低、组合爆炸 |
| 语义网络 | 柯林斯 | 三元组描述,表示范围广、形式简单直接 |
| 框架表示 | 明斯基 | 通用数据结构(槽),有继承性;构建成本高、表达不够灵活 |
② 基于表示学习的知识表示(解决符号方法无法有效计算实体间语义关系的问题):
- TransE 模型:把三元组中的关系看作从实体 head 到实体 tail 的"翻译",调整向量使 h + r ≈ t(h + r = t),能学习隐含特征、有效计算语义关系,广泛用于链接预测、实体分类
知识建模
- 手工建模:适用于容量小、质量要求高的图谱,6 个步骤,耗时昂贵但精细
- 半自动建模:先自动获取知识图谱 + 大量人工干预,基于结构化/半结构化/非结构化数据,适用规模大、语义复杂的图谱
知识抽取(构建的关键)
从不同来源、不同结构数据中提取知识,形成三元组/多元组。三项技术配合:
- 实体抽取(NER):从原始数据识别命名实体。方法:基于规则与词典(特定领域适用)、基于统计机器学习(泛化好但需大量训练数据)、面向开放域
- 关系抽取:抽取语料中命名实体的语义关系。方法:早期人工构造规则 → 统计机器学习(需预定义关系类型)→ 面向开放域(从关系词构建关系模型)
- 属性抽取:从非结构化/半结构化数据提取实体属性信息(可转化为关系抽取问题);数据主要来源是百科半结构化数据
知识存储
| 方式 | 说明 |
|---|---|
| 表结构存储 | 二维数据表(三元组表、类型表、关系数据库三列表);简单直接但大规模查询性能低 |
| 图结构存储 | 属性图(顶点/边/属性/标签)、RDF(资源描述框架)、超图(超边连接任意数顶点);直接反映图谱结构,利于查询和深度挖掘 |
图数据库:以"图"结构存储查询数据(节点+边),处理复杂关系有优势,查询快、关系展现丰富;知识图谱也可基于现有关系数据库构建。
知识融合
- 定义:合并两个知识图谱(本体)或对多源不同概念、上下文、表达进行融合,产生新知识
- 过程:以多源异构数据为基础 → 知识抽取转换(原始数据转可处理形式)→ 本体库和规则库支持下语义组合推理 → 新知识创造 → 根据数据源变化和用户反馈动态调整
- 挑战与应对:数据异构(清洗/转换/标准化)、语义冲突(语义匹配消歧、统一语义模型)、性能效率(并行计算/分布式)、知识更新维护(更新机制定期检查)
知识推理
| 方法 | 原理 |
|---|---|
| 符号推理 | 应用推理规则到图谱,触发规则前件推导新实体关系;规则可自带/人工/机器学习获取;受限于数据规模 |
| 并行知识推理 | 对描述逻辑和 RDFS 推理并行推进,充分利用多核与分布式资源 |
| 表示学习推理 | 实体关系映射到低维向量,通过向量运算学习关系,泛化好、计算高效 |
| 模式归纳推理 | 从实例层学习本体模式层信息(概念层次、属性层次公理);基于归纳逻辑编程、关联规则挖掘、机器学习三大类 |
典型应用
- 语义搜索:透过字面捕捉用户真实意图,基于实体搜索代替字符串搜索(消除歧义)。典型:Google Knowledge Graph、百度知心(搜索"阿里巴巴"列出多个义项)。方法:匹配算法、图遍历、逻辑推理
- 问答系统:返回精准自然语言答案而非文档排序。流程:理解问句语义 → 转为结构化查询 → 图谱查询推理获取答案。关键问题:问句语义解析(词法/句法/语义分析)、大规模知识推理、异构知识关联(综合多知识库,如"谁出演了《变形金刚》且与 Monkey Business 演唱者结婚")
一句话总结
知识图谱 = 用三元组组织"实体-关系-实体"的语义网络:表示(符号/TransE)→ 抽取(实体/关系/属性)→ 存储(表/图)→ 融合 → 推理 → 应用(语义搜索/问答)。它是符号主义在深度学习时代的延续,也是 知识表示 的现代形态。