知识图谱技术综述:知识抽取、表示、融合、推理与应用的全景梳理

1. 什么是知识图谱?

知识图谱.是结构化的语义知识库,用于以符号形式描述物理世界中的概念及其相互关系.其基本组成单位是”实体-关系-实体”三元组,以及实体及其相关属性-值对,实体间通过关系相互联结,构成网状的知识结构。
知识图谱是通过知识抽取、知识融合、知识加工(语义信息)、知识更新(时效性)等构建技术,从原始数据(结构化、半结构、非结构数据)和外部知识库抽取知识事实。知识图谱扩展了图数据模型,在图模型的顶点和边的属性信息,不但能进行划分和存储,还能进行查询、推理和挖掘等操作。

知识图谱 Enable 机器智能化 NLP+KG –> NLU(natural language understanding)① 机器理解数据的本质: 建立从数据到知识库中实体、概念、关系的映射;② 机器解释现象的本质: 利用知识库中实体、概念、 关系解释现象的过程。

2. 如何构建相关领域知识图谱框架?

① 首先确定本体领域和范围,枚举业务重要术语,定义知识图中数据模式;② 其次,通过分析数据特征,定义知识图谱的实体,并提取实体属性;③ 最后,手动定义实体之间的关系,生成本体库。
具体方式如下:

2.1 知识抽取

知识抽取(Knowledge Extraction,KE):通过自动化或半自动化的知识抽取技术,从原始数据中获得实体、关系及属性等可用知识单元。信息抽取是从异构数据源中自动抽取信息得到候选知识单元。对于结构化地数据只需要简单预处理,而非结构化数据需要借助自然语言处理等技术来提取出结构化信息,涉及的关键技术包括实体抽取(Entity Extraction)、关系抽取(Relation Extraction)和属性抽取(Attribute Extraction)。

2.1.1 实体抽取

早期的实体抽取也称为命名实体学习(named entity learning) 或命名实体识别 (named entity recognition),指的是从原始语料中自动识别出命名实体。 由于实体是知识图谱中的最基本元素,其抽取的完整性、准确率、召回率等将直接影响到知识库的质量。– 建立知识图谱中的”节点”

  1. 基于规则与词典的实体抽取方法:早期的实体抽取是在限定文本领域、限定语义单元类型的条件下进行的,主要采用的是基于规则与词典的方法,例如使用已定义的规则,抽取出文本中的人名、地名、组织机构名、特定时间等实体。
  2. 基于统计机器学习的实体抽取方法:将机器学习中的监督学习算法用于命名实体的抽取问题上。

    2.1.2 关系抽取

    关系抽取的目标是解决实体间语义链接问题,早期的关系抽取主要是通过人工构造语义规则以及模板的方法识别实体关系。随后,实体间的关系模型逐渐替代了人工预定义的语法与规则。 – 提取出实体之间的关联关系(边)
  3. 开放式实体关系抽取:开放式实体关系抽取可分为二元开放式关系抽取和n元开放式关系抽取。 在二元开放式关系抽取中,早期的研究有KnowItAll与TextRunner系统,在准确率与召回率上表现一般。 基于语义角色标注的OIE分析显示:英文语句中40%的实体关系是n元的(来源)。
  4. 基于联合推理的实体关系抽取:联合推理的关系抽取中的典型方法是马尔可夫逻辑网MLN(Markov logic network),它是一种将马尔可夫网络与一阶逻辑相结合的统计关系学习框架,同时也是在OIE中融入推理的一种重要实体关系抽取模型。

    2.1.3 属性抽取

    属性抽取主要是针对实体而言的,通过属性可形成对实体的完整勾画。由于实体的属性可以看成是实体与属性值之间的一种名称性关系,因此可以将实体属性的抽取问题转换为关系抽取问题。 –** 从不同信息源中采集特定实体的属性信息,完成对实体属性的完整勾画**。

    2.2 知识表示

    虽然,基于三元组的知识表示形式受到了人们 广泛的认可,但是其在计算效率、数据稀疏性等方面却面临着诸多问题。近年来,以深度学习为代表的表示学习技术取得了重要的进展,可以将实体的语义信息表示为稠密低维实值向量,进而在低维空间中高效计算实体、关系及其之间的复杂语义关联,对知识库的构建、推理、融合以及应用均具有重要的意义。

    2.2.1 应用场景

    分布式表示旨在用一个综合的向量来表示实体对象的语义信息,是一种模仿人脑工作的表示机制,通过知识表示而得到的分布式表示形式在知识图谱的计算、补全、推理等方面将起到重要的作用。
  5. 语义相似度计算。由于实体通过分布式表示而形成的是一个个低维的实值向量,所以,可使用熵权系数法、余弦相似性等方法计算它们间的相似性。这种相似性刻画了实体之间的语义关联程度,为自然语言处理等提供了极大的便利。
  6. 链接预测。通过分布式表示模型,可以预测图谱中任意两个实体之间的关系,以及实体间已存在的关系的正确性。尤其是在大规模知识图谱的上下文中,需要不断补充其中的实体关系,所以链接预测又被称为知识图谱的补全。

    2.2.2 代表模型

    知识表示学习的代表模型主要包括距离模型、 双线性模型、神经张量模型、矩阵分解模型、翻译模型等。
    1) 距离模型
    知识库中实体以及关系的结构化表示方法(structured embedding,SE)的基本思想是:首先将实体用向量进行表示,然后通过关系矩阵将实体投影到与实体向量同一维度的向量空间中,最后通过计算投影向量之间的距离来判断实体间已存在的关系的置信度。由于距离模型中的关系矩阵是两个不同的矩阵,故实体间的协同性较差, 这也是该模型本身的主要缺陷。
    2) 单层神经网络模型
    针对上述提到的距离模型中的缺陷,提出了采用单层神经网络的非线性模型(single layer model,SLM),模型为知识库中每个三元组$(h,t,r)$定义了以下形式的评价函数:
    $$
    f_{r}(h, t)=\boldsymbol{\mu}{t}^{\mathrm{T}} g\left(\boldsymbol{M}{r, 1} l_{h}+\boldsymbol{M}{r, 2} \boldsymbol{l}{t}\right)
    $$
    式中,$\mu_{r}^{\mathrm{T}} \in \mathbb{R}^{k}$为关系$r$的向量化表示;$g()$为$\tanh$函数;$\boldsymbol{M}{r, 1} 、 \boldsymbol{M}{r, 2} \in \mathbb{R}^{d \times k}$是通过关系$r$定义的两个矩阵。单层神经网络模型的非线性操作虽然能够进 一步刻画实体在关系下的语义相关性,但在计算开销上却大大增加。
    3)双线性模型
    双线性模型主要是通过基于实体间关系的双线性变换来刻画实体在关系下的语义相关性。模型不仅形式简单、易于计算,而且还能够有效刻画实体间的协同性。
    4)神经张量模型
    神经张量模型,其基本思想是:在不同的维度下,将实体联系起来,表示实体间复杂的语义联系。 神经张量模型在构建实体的向量表示时,是将该实体中的所有单词的向量取平均值,这样一方面可以重复使用单词向量构建实体,另一方面将有利于增强低维向量的稠密程度以及实体与关系的语义计算。
    5)矩阵分解模型 通过矩阵分解的方式可得到低维的向量表示,故不少研究者提出可采用该方式进行知识表示学习,其中的典型代表是文献提出的RESACL模型
    6)翻译模型
    受到平移不变现象的启发,提出了TransE模型,即将知识库中实体之间的关系看成是从实体间的某种平移,并用向量表示。

    2.2.3 复杂关系模型

    知识库中的实体关系类型也可分为1-to-1、1-to-N、N-to-1、N-to-N4种类型(来源),而复杂关系主要指的是1-to-N、N-to-1、N-to-N的3种关系类型。 由于TransE模型不能用在处理复杂关系上,一系列基于它的扩展模型纷纷被提出,下面将简单介绍其中的几项代表性工作。
    1) TransH模型
    TransH模型尝试通过不同的形式表示不同关系中的实体结构,对于同一个实体而言,它在不同的关系下也扮演着不同的角色。 TransH使不同的实体在不同的关系下拥有了不同的表示形式,但由于实体向量被投影到了关系的语义空间中,故它们具有相同的维度。
    2) TransR模型
    由于实体、关系是不同的对象,不同的关系所关注的实体的属性也不尽相同,将它们映射到同一个语义空间,在一定程度上就限制了模型的表达能力。
    3) TransD模型
    考虑到在知识库的三元组中,头实体和尾实体表示的含义、类型以及属性可能有较大差异,之前的TransR模型使它们被同一个投影矩阵进行映射,在一定程度上就限制了模型的表达能力。
    4) TransG模型
    TransG模型认为一种关系可能会对应多种语义,而每一种语义都可以用一个高斯分布表示。

    2.2.4 多源信息融合

    三元组作为知识库的一种通用表示形式,通过表示学习,能够以较为直接的方式表示实体、关系及其之间的复杂语义关联。然而,互联网中仍蕴含着大量与知识库实体、关系有关的信息未被考虑或有效利用,如充分融合、利用这些多源异质的相关信息,将有利于进一步提升现有知识表示模型的区分能力以及性能。

    2.3 知识融合

    知识融合(Knowledge Fusion,KF):可消除实体、关系、属性等指称项与事实对象之间的歧义,形成高质量的知识库。经由信息抽取之后的信息单元间的关系是扁平化的,缺乏层次性和逻辑性,同时存在大量冗余甚至错误的信息碎片。知识融合就是将多个知识库中的知识进行整合,形成一个知识库的过程。

    2.3.1 实体对齐

    实体对齐 (entity alignment) 也 称为实体匹配(entity matching)或实体解析(entity resolution),主要是用于消除异构数据中实体冲突、指向不明等不一致性问题,可以从顶层创建一个大规模的统一知识库,从而帮助机器理解多源异质的数据,形成高质量的知识。
    在大数据的环境下,受知识库规模的影响,在进行知识库实体对齐时,主要会面临以下3个方面的挑战:1) 计算复杂度。匹配算法的计算复杂度会随知识库的规模呈二次增长,难以接受;2) 数据质量。由于不同知识库的构建目的与方式有所不同,可能存在知识质量良莠不齐、相似重复数据、孤立数据、数据时间粒度不一致等问题[75];3) 先验训练数据。在大规模知识库中想要获得这种先验数据却非常困难。通常情况下,需要研究者手工构造先验训练数据。
    基于上述,知识库实体对齐的主要流程包括:1) 将待对齐数据进行分区索引,以降低计算的复杂度;2) 利用相似度函数或相似性算法查找匹配实例;3) 使用实体对齐算法进行实例融合;4) 将步骤2)与步骤3)的结果结合起来,形成最终的对齐结果。对齐算法可分为成对实体对齐与集体实体对齐两大类,而集体实体对齐又可分为局部集体实体对齐与全局集体实体对齐。
  7. 成对实体对齐方法① 基于传统概率模型的实体对齐方法:主要就是考虑两个实体各自属性的相似性,而并不考虑实体间的关系。 ② 基于机器学习的实体对齐方法:主要是将实体对齐问题转化为二分类问题。 根据是否使用标注数据可分为有监督学习与无监督学习两类,基于监督学习的实体对齐方法主要可分为成对实体对齐、基于聚类的对齐、主动学习。i) 通过属性比较向量来判断实体对匹配与否可称为成对实体对齐,这类方法中的典型代表有决策树、支持向量机、集成学习等。ii) 基于聚类的实体对齐算法,其主要思想是将相似的实体尽量聚集到一起,再进行实体对齐。 iii) 在主动学习中,可通过与人员的不断交互来解决很难获得足够的训练数据问题。
  8. 局部集体实体对齐方法
    为实体本身的属性以及与它有关联的实体的属性分别设置不同的权重,并通过加权求和计算总体的相似度,还可使用向量空间模型以及余弦相似性来判别大规模知识库中的实体的相似程度,算法为每个实体建立了名称向量与虚拟文档向量,名称向量用于标识实体的属性,虚拟文档向量则用于表示实体的属性值以及其邻居节点的属性值的加权和值。
  9. 全局集体实体对齐方法 ① 基于相似性传播的方法是一种典型的集体实体对齐方法,匹配的两个实体与它们产生直接关联的其他实体也会具有较高的相似性,而这种相似性又会影响关联的其他实体。② 基于概率模型的集体实体对齐方法采用统计关系学习进行计算与推理,常用的方法有LDA模型、CRF模型、Markov逻辑网等。
    指代消解:解决多个指称项对同一实体对象的问题;(孙悟空、美猴王)②** 实体消歧:解决同名实体产生歧义问题的技术;(李娜:歌手、网球运动员);③ **实体链接:从非结构化数据(如文本、网页)或半结构化数据(如表格、数据库)中抽取得到的实体对象,将其链接到知识库中对应的正确实体对象的操作;④ 知识合并:在实体链接地基础上把半结构化数据和非结构化数据与结构化数据整合;

    2.3.2 知识加工

    知识加工(Knowledge Processing,KP):对基本的事实进行处理(通过信息抽取,可以从原始语料中提取出实体、关系与属性等知识要素。再经过知识融合,可以消除实体指称项与实体对象之间的歧义,得到一系列基本的事实表达),形成结构化的知识体系和高质量的知识,实现对知识的统一管理。
  10. 本体构建:本体是同一领域内不同主体之间进行交流、连通的语义基础,其主要呈现树状结构,相邻的层次节点或概念之间具有严格的”IsA”关系,有利于进行约束、推理等,却不利于表达概念的多样性。 目的是构建知识库模型和层次体系;涉及实体并列关系相似度计算、实体上下位关系抽取、本体的生成。本体可通过人工编辑的方式手动构建,也可通过数据驱动自动构建,然后再经质量评估方法与人工审核相结合的方式加以修正与确认。数据驱动的本体自动构建过程主要可分为以下3个阶段:① 纵向概念间的并列关系计算。通过计算任意2个实体间并列关系的相似度,可辨析它们在语义层面是否属于同一个概念。计算方法主要包括模式匹配与分布相似度两种。② 实体上下位关系抽取。上下位关系抽取方法包括基于语法的抽取与基于语义的抽取两种方式,例如目前主流的信息抽取系统KnowltAll、TextRunner、NELL等,都可以在语法层面抽取实体的上下位关系,而Probase则是采用基于语义的抽取模式。③ 本体生成。对各层次得到的概念进行聚类,并为每一类的实体指定1个或多个公共上位词。
  11. 质量评估:对知识库的质量评估任务通常是与实体对齐任务一起进行的,其意义在于,可以对知识的可信度进行量化,保留置信度较高的,舍弃置信度较低的,有效确保知识的质量。

    2.3.3 知识更新

    知识更新(Knowledge Upadate,KU):不断迭代更新知识图谱的内容,保障知识的时效性。① 更新层次:模式层更新、数据层更新;模式层的更新是指本体中元素的更新,包括概念的增加、修改、删除,概念属性的更新以及概念之间上下位关系的更新等。 数据层的更新指的是实体元素的更新,包括实体的增加、修改、删除,以及实体的基本信息和属性值。 ② 更新方式:全面更新、增量更新;

    2.4 知识推理

    知识推理则是在已有的知识库基础上进一步挖掘隐含的知识,从而丰富、扩展知识库。对于推理规则的挖掘,主要还是依赖于实体以及关系间的丰富同现情况。知识推理的对象可以是实体、实体的属性、实体间的关系、本体库中概念的层次结构等。 知识推理方法主要可分为基于逻辑的推理与基于图的推理两种类别。

    2.4.1 基于逻辑的推理

    基于逻辑的推理方式主要包括一阶谓词逻辑(first order logic)、描述逻辑(description logic)以及规则等。一阶谓词逻辑推理是以命题为基本进行推理,而命题又包含个体和谓词。逻辑中的个体对应知识库中的实体对象,具有客观独立性,可以是具体一个或泛指一类,例如奥巴马、选民等;谓词则描述了个体的性质或个体间的关系。

    2.4.2 基于图的推理

    在基于图的推理方法中,path constraint random walk,path ranking 等算法较为典型,主要是利用了关系路径中的蕴涵信息,通过图中两个实体间的多步路径来预测它们之间的语义关系。 即从源节点开始,在图上根据路径建模算法进行游走,如果能够到达目标节点,则推测源节点和目标节点间存在联系。

    3. 知识图谱典型应用

    知识图谱为互联网上海量、异构、动态的大数据表达、组织、管理以及利用提供了一种更为有效的方式,使得网络的智能化水平更高,更加接近于人类的认知思维。目前,知识图谱已在智能搜索、深度问答、社交网络以及一些垂直行业中有所应用,成为支撑这些应用发展的动力源泉。

    3.1 知识图谱应用场景

    3.1.1 智能搜索

    基于知识图谱的智能搜索是一种基于长尾的搜索,搜索引擎以知识卡片的形式将搜索结果展现出来。用户的查询请求将经过查询式语义理解与知识检索两个阶段:
    1) 查询式语义理解。 知识图谱对查询式的语义分析主要包括:① 对查询请求文本进行分词、词性标注以及纠错;② 描述归一化,使其与知识库中的相关知识进行匹配;③ 语境分析。在不同的语境下,用户查询式中的对象会有所差别,因此知识图谱需要结合用户当时的情感,将用户此时需要的答案及时反馈给用户;④ 查询扩展。明确了用户的查询意图以及相关概念后,需要加入当前语境下的相关概念进行扩展。
    2) 知识检索。经过查询式分析后的标准查询语句进入知识库检索引擎,引擎会在知识库中检索相应的实体以及与其在类别、关系、相关性等方面匹配度较高的实体。通过对知识库的深层挖掘与提炼后,引擎将给出具有重要性排序的完整知识体系。
    如国外的搜索引擎以谷歌的 Google Search(Wiki、CIA世界概览语义整合)、微软的 Bing Search(Facebook、Twitter个性化定制),国内的主流搜索引擎公司,如百度(知心:通用)、搜狗(知立方:碎片化语义信息整合)。

    3.1.2 深度问答

    问答系统是信息检索系统的一种高级形式,能够以准确简洁的自然语言为用户提供问题的解答。 之所以说问答是一种高级形式的检索,是因为在问答系统中同样有查询式理解与知识检索这两个重要的过程,并且与智能搜索中相应过程中的相关细节是完全一致的。
    如华盛顿大学的 Paralex 系统和苹果的智能语音助手 Siri,都能够为用户提供回答、介绍等服务;国内百度公司 研发的小度机器人,天津聚问网络技术服务中心开发的大型在线问答系统OASK,专门为门户、 企业、媒体、教育等各类网站提供良好的交互式问答解决方案。

    3.1.3 社交网络

    社交网站 Facebook 于2013 年推出了 Graph Search 产品,其核心技术就是通过知识图谱将人、 地点、事情等联系在一起,并以直观的方式支持精确的自然语言查询,例如输入查询式:”我朋友喜欢的餐厅””住在纽约并且喜欢篮球和中国电影的朋友”等,知识图谱会帮助用户在庞大的社交网络中找到与自己最具相关性的人、照片、地点和兴趣等。 Graph Search提供的上述服务贴近个人的生活,满足了用户发现知识以及寻找最具相关性的人的需求。

    3.1.4 垂直行业应用

    1)军事领域:战场信息化水平提升,需快速准确获取战场信息和军事知识,并进行分析;2)医疗领域:智能医疗,将有效医学知识、临床医学数据整合,建立医疗知识图谱;3)交通领域:建立交通知识图谱交通,进行交通流量分析、航空交通管理以及场景挖掘;4)金融领域:实现金融智能咨询推荐、风险控制评估,精准掌握复杂信息中潜在风险。

    3.2 知识图谱交叉领域

    1)知识图谱和自然语言处理① 信息抽取:实体识别和抽取、实体消歧、关系抽取;② 语义解析:将自然语言处理映射成机器可以表达的形式,包括词义消歧、语义角色标注、指代消解等;
    2)知识图谱和人工智能① 计算智能:快速计算和记忆存储能力(规则明确)② 感知智能:视频、听觉、触觉感知能力(语音、图像、视频)③ 认知智能:能理解思考(理解、推理、解释)
    3)知识图谱和大数据① 图机器学习:TransE、GCN等模型② 图数据库:RDF图(gstore、Virtuoso)、属性图(Neo4j、janusgraph)③ 图计算系统:点中心模型系统(Pregel、GraphLab)④ 图挖掘算法:Pagerank、Simrank、社区发现、影响力传播

    4. 知识图谱分类

    通用知识图谱和领域知识图谱的区别主要体现在知识建模与覆盖范围上。
  12. 通用知识图谱面向通用领域,以常识性知识为主,其构建过程高度自动化,通常采用自底向上的方式来构建。其关联的知识大多数是静态的、客观的、明确的三元组事实性知识。一般以互联网开放数据为基础,再逐步扩大数据规模。
  13. 领域知识图谱面向某一特定领域,以行业数据为主,其构建过程是半自动化的,通常采用自顶向下和自底向上两种方式相结合的方式来构建。其关联的知识包含静态知识和动态知识。

    4.1 通用知识图谱

    目前,国内外多个研究机构建立了一些大型通用知识图谱。在国内,代表性的通用知识图谱包括搜狗知立方、百度知心、Zhishi.me、OpenKN、CN-DBpedia等。在国外,代表性的通用知识图谱包括 WordNet、DBpedia、Freebase、YAGO、Probase、Knowledgevault等。上述通用知识图谱的比较如表1所列。通过对现有研究成果的整理和比较可以发现,目前知识图谱的概念规模仍处于发展变化阶段。

    4.2 领域知识图谱

    近年来,在一些领域已经出现面向领域的知识图谱,包括电影领域的 IMDB、生物医学领域的 DrugBank、新闻领域的 ECKG、学术领域的 Acemap 等。上述领域知识图谱的比较如表2所列。

    4.3 两者区别

  14. 知识抽取角度来看,通用知识图谱注重知识的广度,覆盖粗粒度的知识。其在实体抽取层面,关注更多的实体,准确度不高;在关系抽取层面,多采用面向开放域的关系抽取。领域知识图谱注重知识的深度,覆盖细粒度的知识。其在实体抽取层面,关注具有特定行业意义的领域数据,准确度高;在关系抽取层面,多采用预定义关系抽取。
  15. 知识表示角度来看,通用知识图谱将知识表示成多个互相关联的三元组。例如,(实体1,关系,实体2)或(实体,属性,属性值),各部分之间有明确的层次结构。领域知识图谱除了将知识表示为多个互相关联的三元组之外,还需要对专家经验知识、行业文本的语义信息进行表示。
  16. 知识融合角度来看,通用知识图谱对知识抽取的质量有一定容忍度,需要通过知识融合来提升数据质量。领域知识图谱从领域内部的结构化数据、半结构化数据、非结构化数据中抽取知识,并且有一定的人工审核校验机制来保证质量,需要通过知识融合来扩大数据层的规模。
  17. 知识推理角度来看,由于通用知识图谱的知识覆盖范围较宽,深度较浅,从而导致图谱上的推理路径相对较短。而领域知识图谱的知识相对密集,这就导致图谱上的推理路径相对较长。当然,也存在一些特殊情况,例如 DBpedia 具有丰富的推理规则,推理路径比某些只有少量推理规则的领域知识图谱长。另外,推理路径上的区别体现在上层本体和垂直本体的比较上。
  18. 从图谱应用角度来看,通用知识图谱主要应用在信息搜索和自动问答方面。领域知识图谱的主要应用除了上述方面,还包括决策分析、业务管理等。

    5. 参考文献

  19. 杭婷婷, 冯钧, 陆佳民. 知识图谱构建技术:分类,调查和未来方向[J]. 计算机科学, 2021.
  20. 段宏. 知识图谱构建技术综述[J]. 计算机研究与发展, 2016, 53(3):19.
  21. 徐增林,盛泳潘,贺丽荣,王雅芳. 知识图谱技术综述[J]. 电子科技大学学报, 2016, 45(4):18.
  22. 田玲, 张谨川, 张晋豪,等. 知识图谱综述——表示,构建,推理与知识超图理论[J]. 计算机应用, 2021, 41(8):26.
本文结束 感谢您的阅读