命名实体识别 NER 综述:从词典规则到深度学习的技术演进

系统梳理命名实体识别任务:从 MUC-6 提出的任务定义出发,介绍基于词典规则与统计机器学习的传统方法,再展开深度学习 NER 的通用框架——输入层、编码层与解码层的典型设计与代表模型。

随着数据的爆炸式增长,人工从海量的文本中寻找有用的信息无疑是一项费时费力的任务,因此信息抽取研究应运而生。 作为其关键技术之一的命名实体识别(Name Entity Recognition,NER)是知识库问答系统、机器翻译、信息检索、情感分析、知识图谱等多个自然语言处理应用的基础任务。

1. 命名实体识别是什么?

命名实体(named entity,NE)作为一个明确的概念和研究对象,是在 1995 年 11 月的第六届 MUC会议(MUC-6,the Sixth Message Understanding Conferences)上被提出的。

其目的是:是指从文本中提取专有名词和特定命名实体的识别任务,且识别结果作为实体关系抽取的基础。

命名实体识别从早期基于词典和规则的方法,到传统机器学习的方法, 后来采用基于深度学习的方法, 一直到当下热门的注意力机制、图神经网络等研究方法, 命名实体识别技术路线随着时间在不断发展, 技术发展趋势如下图所示。

2. 传统命名体识别技术

命名实体识别是自然语言处理的一项基础任务,从最初的词典和规则的方法,发展到统计机器学习方法,一直到最近应用范围最广的基于深度学习的模型,命名实体识别技术一直是自然语言处理领域中的热点研究方向。

2.1 基于词典和规则的实体识别技术

基于规则和字典的方法是最初代的命名实体识别使用的方法, 这些方法多采用由语言学家通过人工方式, 依据数据集特征构建的特定规则模板或者特殊词典。 基于词典的实体识别方法:是指词典中的每个词与被处理文档之间逐一匹配的过程。词典是由特征词构成的词典和外部词典共同组成, 外部词典指已有的常识词典。 基于规则的实体识别方法:是根据文本特点与定制规则特点匹配的方式完成实体识别。规则包括关键词、位置词、方位词、中心词、指示词、统计信息、标点符号等。 制定好规则和词典后, 通常使用匹配的方式对文本进行处理以实现命名实体识别。

基于词典和规则的实体识别方法使用简单,结果准确率较高,可以满足实际应用中对准确率的要求;但是词典和规则库的建立需要花费大量时间和人力;不同的实体类型需要定制相应的规则,可移植性较差。

2.2 基于统计机器学习的实体识别技术

从给定的、已标注的训练集出发,通过人工构建特征,并根据特定的模型对文本中每个词进行标签标注,实现命名实体识别。与分类问题相比, 序列标注问题中当前的预测标签不仅与当前的输入特征相关,还与之前的预测标签相关, 即预测标签序列之间是有强相互依赖关系的。 序列化标注是目前最为有效,也是最普遍的 NER 方法。

项目模型特点
基于词典和规则的方法准确率高,使用简单;需要人工定制,移植性差
隐马尔可夫模型 HMM训练效率较高;严格的独立观测假设, 不能考虑上下文的特征
最大熵马尔可夫模型 MEMM特征设计灵活,解决了 HMM 输出独立性的问题;局部归一化,存在标签偏置
支持向量机模型 SVM可以解决高维问题,适用大型特征空间;对参数和核函数选择要求高
条件随机场模型 CRF可利用上下文信息,全局归一化求得最优解;收敛速度慢、复杂度高

总的来说,该方法的步骤主要可以总结为:预处理语料、抽取特征并制定特征模板、训练模型、优化模型。

基于统计机器学习算法的命名实体识别模型对特征选取的要求较高,并且需要丰富的语料库。 结合词典规则的统计机器学习模型适用于专业性比较强的领域,可在一定程度上提高分词的准确性,但词典和规则的训练语料库构建程序繁琐,需要爬取大量数据库。同时基于统计的机器学习算法依赖于人工定制特征,限制了该方法在仅有少量标注数据集范围中的更深入使用。

3. 基于深度学习的命名实体识别技术

与基于统计的机器学习方法不同,深度学习本身包含较强的泛化能力,可以从原始数据中自行获取特征,不依赖于专家知识和人工特征。深度学习主要包括深度神经网络模型、注意力模型和迁移学习模型。 与深度神经网络模型相比,迁移学习适用于标注数据稀缺的情况。注意力模型通过相似度计算,在各神经网络单元引入权重系数,提升模型识别精度。

3.1 NER的一般框架

基于深度学习的 NER 模型通常以词作为基本的标记单元,即为文本中的每个词预测一个标签,连接相应的标签就可得出该文本中实体的边界及类型。接下来从输入层、编码层和解码层出发,介绍主流命名实体识别模型的一般框架,详细介绍现有工作中各层的典型实现,并分析它们的优缺点。

3.1.1 输入层

输入层用于把词相关的信息表示为向量;除了最主要的词向量特征外,输入层还经常使用字符向量特征、形态学特征和基于实体词典 (Gazetteer) 的特征等作为补充信息。

字符向量特征被证实是非常通用且有效的信息,主要表现在以下两点:① 可以显式地利用前缀和后缀等子词级 (Sub-word Level) 的特征;② 可以很自然地缓解低频词的词向量质量不可靠、未登录词没有词向量的问题。形态学特征对词形丰富语言的 NER 非常有用。基于实体词典的特征主要是为了利用已有的地名词典、机构名词典以及药品名词典等,对特定领域的 NER 非常有效。

总的来说,在输入层中通常以词作为基本单位,即以预训练的词向量为主要特征,同时把字符特征和形态学等特征作为补充信息。

3.1.2 编码层

编码层学习融合上下文信息的词的向量表示,该表示可以认为是特定于任务的特征;编码主要使用循环神经网络、卷积神经网络和 Transformer。

循环神经网络:在处理序列类时间数据方面有显著的优势。特别是双向循环神经网络可以有效地利用文本的前向信息和后向信息,获得文本的深层上下文语义。 卷积神经网络:是一种深层的前馈神经网络,用于处理类似网格结构数据的网络,具有局部连接、权重共享以及汇聚三个特性,使得卷积神经网络具有一定程度上的平移、缩放和旋转不变性。*Transformer *完全不同于循环神经网络和卷积神经网络,它利用自注意力机制和全连接层构建编码结构。

在编码层,常用的 BiLSTM 网络已表现出良好的序列建模能力,能较好地学习文本中词之间的依赖关系。然而,BiLSTM 也存在以下几个方面的缺陷:① 序列中当前词的计算依赖于前一个词的计算结果,导致其不能并行计算,计算效率不如卷积神经网络 (Convolutional Neural Network, CNN) 和基于注意力机制的 Transformer 网络;② 建模局部上下文 (也称短距离的词之间的依赖) 的能力不如CNN;③ 理论上,BiLSTM 可以建模任意长距离的词之间的依赖,但实际中由于梯度消失问题,其建模长距离依赖的能力不如 Transformer 网络;④ BiLSTM 没有考虑句子的结构信息。

Transformer 可以有效解决 RNNs 存在的 3 点问题,具体解决方案如下:① Transformer 不同于 RNNs 的串行计算结构,采用并行计算结构以充分利用计算机的并行计算资源;② Transformer 采用自注意力机制,在结构上消除了梯度消失和梯度爆炸的问题,可以获取长文本的依赖信息; ③ Transformer 不同于 RNNs 的双向拼接,可以实现双向参数的统一更新,不会割裂上下文关系。 相比于卷积神经网络,Transformer 不受卷积核感受野的影响,可以获得文本的长距离信息。

3.1.3 解码层

解码层用于预测文本中每个词对应的标签。标签解码层的功能是将编码层输出的向量进行解码和分类。 标签解码层的输入为编码层输出的向量表示,输出与文本对应的标签序列。标签解码层的主要网络有:多层感知机+Softmax 层和条件随机场 (CRF) 层。 多层感知机+Softmax 层将命名实体识别转化为一个多分类问题,即将编码层输出的包含上下文语义的向量转化为对应的标签序列。 该方法的优势在于具有较强的非线性表示能力,能够学习潜在的信息。多层感知机+Softmax 层的缺陷在于:该方法假设标签序列是相互独立的,然而标签之间存在一定的依赖关系和规则。标签的独立假设会带来信息损失,影响分类结果。CRF 层是一种标签联合预测的方法,通过加入标签转移得分矩阵参数和定义序列的预测得分来进行全局优化。

相比于多层感知机+Softmax 层,CRF 层可以进行全局优化以避免标签独立假设带来的信息损失。同时 CRF 层存在以下两个缺点:① CRF 层受到马尔可夫假设的限制,对标签相关信息较弱的数据处理效果较差;② CRF 层采用维特比解码技术,计算开销和时间成本较高。

对于上述第一个不足,如果对性能要求不是很高,可以直接使用一个 Softmax 分类层为句子中的每个词单独解码。 对于上述第二个不足,可以把命名实体识别看成是一个序列生成问题,基于 RNN 网络(Recurrent Neural Network)逐个生成句子中词的分类标签,并把前一个词的预测标签用作当前词的标签预测的输入。

3.2 主要研究方法

近几年,比较通用的基础神经网络结构有 BLSTM-CRF、卷积神经网络(CNN)等,都取得了不错的识别效果。

3.2.1 循环神经网络

RNN结构:X 表示输入层的值; Y 表示输出层的值; U是输入值 X 的权重矩阵; V 是输出层 Y 的权重矩阵;W 是隐藏层的权重矩阵。

LSTM结构:在$t$时刻, LSTM 的输入分别有上一时刻 LSTM 的隐藏层输出值$h_{t-1}$、当前时刻网络的输入值$x_t$,以及上一时刻的单元状态值$c_{t–1}$三部分组成, LSTM 的输出有当前时刻 LSTM 输出值$h_t$ 和当前时刻的单元状态$c_t$两部分组成。

模型优点不足
RNN时序结构,擅长解决时间序列问题梯度消失,无法进行长时间序列标注
LSTM门结构,解决RNN梯度消失问题仅能利用输入序列的单向信息

命名实体识别方法

Bi-LSTM-CRF:将文本用字 / 词向量形式表示,完成字符嵌入;使用深度神经网络有监督地训练模型,识别实体类型并进行标签标注;标注序列优化,解决标签无序性问题。流程中利用 word2vec 进行字符嵌入, Bi-LSTM 网络进行信息学习, CRF 使用动态规划算法找出最优标注序列。

模型是以句子为单位进行输入,将一句话看作$n$个字符的序列$(x_1,x_2,…x_n)$。Embedding 层将句子中的每一个字符$x_i$映射为低维度稠密的字向量(character embedding) $x_i ∈ R^d$ ,其中$d$是字向量的维度。该模型的输入层仅使用预训练的词向量,不使用任何人工特征。编码层使用 BiLSTM 从两个方向建模词的上下文信息,前向 LSTM 从左至右学习词在上文中的表示,后向 LSTM 从右至左学习词在下文中的表示。解码时使用一个 CRF 层 (conditional random field, CRF),利用标签之间的依赖关系,搜索最优的标签序列。
BiLSTM 结构对文本的上下文有记忆和过滤的能力,对长距离的信息能有效地运用,对序列数据所包含的信息能够动态捕获。将每个句子的字符序列$(x_1,x_2,…x_n)$作为 BiLSTM 的输入,正向 LSTM 返回序列$\vec{h}_t = (\vec{h}_1,\vec{h}_2,…\vec{h}_n)$,直接拼接$\overrightarrow{h}_t$与$\overleftarrow{h}_t$,得到 BiLSTM 在$t$时刻的输出,即$\overrightarrow{h}_t = [\overrightarrow{h}_t,\overleftarrow{h}_t]$。


CNN-BLSTM-CRF :首先利用卷积神经网络(CNN)训练出单词的具有形态特征的字符级向量,并从大规模背景语料训练得到具有语义特征信息的词向量,然后将二者进行组合作为输入,再构建适合生物医学命名实体识别的BLSTM-CRF 深层神经网络模型。

Bert-Bilstm-CRF:以 BERT 等基于超大规模语料预训练的语言模型为基础的 NER 模型性能远超上述以普通词向量作为输入的 BiLSTM-CRF 模型。然而,这类 NER 模型的不足之处在于其规模太大,需要很强的计算能力,难以运行在大多数便携式设备上。

项目模型特点
基于词典和 CRF 结合在单一模型的方法上提高了准确率和训练速度,适合准确率要求较高的领域
基于 Bi-LSTM-CRF双向循环神经网络可以抽取更长的上下文信息,其特征表达更加丰富,利用 CRF 提升输出标签合理性
基于 BI-GRU-CRFGRU 结构比 LSTM 更简单,减少模型训练计算量
基于 Bi-LSTM ATTENTION通过注意力模型对词语增加权重,提高识别准确率

BiLSTM 依然是 NER 模型中用得较多的编码层,可能的原因之一是其可以同时较好地建模词之间的短距离依赖(虽然不如 CNN)和长距离依赖(虽然不如 Transformer)。基于 CNN 或Transformer 的编码层则具有可以并行计算、速度相对更快的特点。

3.2.2 迁移学习模型

为了解决基于有监督学习的命名实体识别模型需要大量标记数据的问题,有学者提出了新的机器学习模型——迁移学习( Transfer Learning) 。核心思想是运用已标注数据集解决不同但相关目的领域的问题,核心是探索把已标注的数据集源领域(source domain)知识迁移到将学习的新数据集目标领域(target domain)上。

在小规模标注语料的情况下,深度迁移学习模型利用多层非线性神经网络自主学习实体特征,通过迁移学习完成从源领域到目标领域的特征迁移,有效缓解了深度学习在少量数据时学习能力不够的问题,深度挖掘神经网络的特征提取功能,降低了对人工特征的依赖。

3.2.3 注意力模型

注意力机制源于机器模仿人类对关键事物会更加注意的视觉特点,核心思想是通过增加权重来突出关键词,减小权重剔除不必要的部分,因此注意力机制能有效提高命名实体识别模型性能。注意力机制通常与神经网络结合,可以看作是神经网络输出结果上的加权计算结构。

注意力机制计算过程为:先将神经网络输出结果和每个相关单元进行相似度计算得到权重系数,再使用 softmax 函数对这些权重进行归一化计算,然后该层网络学习权值进行权重加权求和,最后得到调整后的输出标签。

4.公开数据集和评价指标

4.1 公开数据集

常用的命名实体识别数据集有 CoNLL 2003,CoNLL 2002,ACE 2004,ACE 2005 等。数据集的具体介绍如下 ① CoNLL 2003 数据集包括 1393 篇英语新闻文章和 909 篇德语新闻文章, 英语语料库是免费的, 德国语料库需要收费。英语语料取自路透社收集的共享任务数据集。数据集中标注了 4 种实体类型: PER,LOC,ORG,MISC。② CoNLL 2002 数据集是从西班牙 EFE 新闻机构收集的西班牙共享任务数据集。数据集标注了 4 种实体类型: PER,LOC,ORG,MISC。

③ ACE 2004 多语种训练语料库版权属于语言数据联盟 ( Linguistic Data Consortium, LDC ) ,ACE 2004多语言培训语料库包含用于 2004 年自动内容提取( ACE) 技术评估的全套英语、阿拉伯语和中文培训数据。语言集由为实体和关系标注的各种类型的数据组成。④ ACE 2005 多语种训练语料库版权属于LDC, 包含完整的英语、阿拉伯语和汉语训练数据,数据来源包括: 微博、广播新闻、新闻组、广播对话等, 可以用来做实体、关系、事件抽取等任务。

⑤ OntoNotes 5.0 数据集版权属于 LDC, 由1745 K英语、900 K 中文和 300 K 阿拉伯语文本数据组成,OntoNotes 5.0 的数据来源也多种多样, 来自电话对话、新闻通讯社、广播新闻、广播对话和博客等。实体被标注为 PERSON, ORGANIZATION, LOCATION 等 18 个类型。⑥ MUC 7 数据集是发布的可以用于命名实体识别任务, 版权属于 LDC, 下载需要支付一定费用。数据取自北美新闻文本语料库的新闻标题, 其中包含 190 K 训练集、64 K 测试集。⑦ Twitter 数据集是由 Zhang 等提供, 数据收集于 Twitter, 训练集包含了 4 000 推特文章, 3 257 条推特用户测试。该数据集不仅包含文本信息还包含了图片信息。

注:CoNLL( Conference on Computational Natural Language Learning)是由 ACL 的自然语言理解专门的兴趣小组( special interest group on Natural Language Learning, SIGNLL)举办的一年一度的学术会议。

4.2 标注方法

IOB 标注法, 是 CoNLL 2003 采用的标注法,I 表示内部, O 表示外部, B 表示开始。如若语料中某个词标注 B /I-XXX, B /I 表示这个词属于命名实体的开始或内部, 即该词是命名实体的一部分, XXX表示命名实体的类型。当词标注 O 则表示属于命名实体的外部, 即它不是一个命名实体。 ② BIOES 标注法, 是在 IOB 方法上的扩展, 具有更完备的标注规则。其中 B 表示这个词处于一个命名实体的开始, I 表示内部, O 表示外部, E 表示这个词处于一个实体的结束, S 表示这个词是单独形成一个命名实体。BIOES 是目前最通用的命名实体标注方法。

Markup 标注法, 是 OntoNotes 数据集使用的标注方法, 方式较简单。

4.3 评价指标

目前, 命名实体识别任务常采用的评价指标有精确率 ( Precision) 、召回率 ( Recall) 、F1 值 ( F1-Measure) 等。

精确率: 对给定数据集, 分类正确样本个数和总样本数的比值。即:

$$
Precison = \frac{TP+TN}{TP+FN+FP+TN}.
$$

召回率: 用来说明分类器中判定为真的正例占总正例的比率, 即:

$$
Recall = \frac{TP}{TP+FN}.
$$

F1 值

: 精确率和召回率的调和平均指标, 是平衡两者影响的综合指标,即:

$$
\frac{1}{F1} = \frac{1}{Recall}+\frac{1}{Precision}.
$$

5. 参考资料

  1. 江千军, 桂前进, 王磊,等. 命名实体识别技术研究进展综述[J]. 电力信息与通信技术, 2022, 20(2):10.
  2. 黄晴雁, 牟永敏. 命名实体识别方法研究进展[J]. 现代计算机:中旬刊, 2018(12):7.
  3. 邓依依, 邬昌兴, 魏永丰,等. 基于深度学习的命名实体识别综述[J]. 中文信息学报, 2021, 35(9):16.
  4. 陈曙东, 欧阳小叶. 命名实体识别技术综述[J]. 无线电通信技术, 2020, 46(3):10.
  5. 刘浏, 王东波. 命名实体识别研究综述[J]. 情报学报, 2018, 37(3):12.
  6. 郑洪浩, 宋旭晖, 于洪涛,等. 基于深度学习的中文命名实体识别综述[J]. 信息工程大学学报, 2021, 22(5):7.
本文结束 感谢您的阅读