Multi-Granularity Feature Fusion for Named Entity Recognition of Classical Chinese Texts from the Perspective of Digital Humanities

  • Meng Jiana ,
  • Xu Yingao ,
  • Zhao Dandan ,
  • Li Fengyi ,
  • Zhao Di
Expand
  • School of Computer Science and Engineering, Danlian Minzu University Danlian 116600

Meng Jiana, professor, PhD, master supervisor;

Xu Ying’ao, master candidate;

Zhao Dandan, associate professor, PhD, master supervisor, corresponding author, E-mail: ;

Li Fengyi, master candidate;

Zhao Di, lecturer, PhD.

Received date: 2024-07-22

  Online published: 2025-04-28

Supported by

Humanities and Social Sciences Research Planning Fund project titled “The Research on the Internet Smart Dissemination of Chinese Culture Based on Knowledge Graphs”(23YJA860010)

Fundamental Research Funds for the Central Universities project titled “Research on Sentiment Analysis Based on Large Models and Knowledge-Driven Approaches”(140250)

Abstract

[Purpose/Significance] Leveraging Named Entity Recognition (NER) techniques for the thorough exploration of ancient literary documents not only drives forward the digitization of ancient Chinese texts, including the vital process of Ancient text digitization, which is crucial for historical studies, bolstering cultural confidence, promoting traditional Chinese culture, and advancing Named Entity Recognition (NER) as a foundational task in NLP. [Method/Process] A method for named entity recognition in classical Chinese texts with multi-granularity feature fusion was proposed, Leveraging "Zuo Zhuan" as the research corpus and formulating named entity recognition tasks for personal names, geographical names, temporal entities, etc. Initially, ancient character information, part-of-speech (POS) information, and glyph features were integrated to enhance input feature representation. Subsequently, auxiliary tasks for predicting entity boundaries were introduced, alongside the utilization of a Transfer Interactor heuristic to learn classical Chinese entity formation rules. This was complemented by joint contextual information extraction using BiLSTM and IDCNN (Iterated Dilated Convolutional Neural Network). Finally, learned features were weighted and merged into a CRF (Conditional Random Field) for entity prediction. [Result/Conclusion] Experimental results demonstrate that the proposed method of multi-granularity feature fusion for named entity recognition in classical Chinese texts enhances precision, recall, and F1 score by 5.09%, 13.45%, and 9.87%, respectively, compared to the mainstream BERT-BiLSTM-CRF method. Multi-granularity feature fusion for named entity recognition in classical Chinese texts is crucial for accurately identifying named entities in ancient texts.

Cite this article

Meng Jiana , Xu Yingao , Zhao Dandan , Li Fengyi , Zhao Di . Multi-Granularity Feature Fusion for Named Entity Recognition of Classical Chinese Texts from the Perspective of Digital Humanities[J]. Knowledge Management Forum, 2024 , 9(6) : 533 -546 . DOI: 10.13266/j.issn.2095-5472.2024.039

1 引言/Introduction

中华文明悠久源远,历经千年岁月,蕴含着无数珍贵的智慧和经验。千古典籍,如明珠般闪烁着历史的光芒,描绘了一幅幅精彩纷呈的历史画卷。以人为鉴,能够领悟得失之道;以史为鉴,能够洞悉兴衰之势。汲取中华文明上下五千年的历史智慧和经验,乃是实现人民幸福、国家兴盛、中华民族伟大复兴的重要法宝。近年来社会信息化的趋势日益增强,数字人文研究悄然兴起,为传统人文与社会科学研究提供了新的研究范式[1]。中共中央办公厅、国务院办公厅印发的《关于推进新时代古籍工作的意见》给数字人文下的古籍智能信息处理研究指明了方向并提供了重要的机遇。从研究的精细程度来看,古籍智能信息处理主要分为词汇级、句子级、篇章级。古文词汇级研究主要包括自动分词、词性标注、关系抽取与命名实体识别[2]。其中,命名实体识别是自然语言处理领域的重要任务之一,旨在从文本数据中识别出具有特定意义的实体,并对其进行分类和抽取。以《左传》为例,利用笔者提出的命名实体识别模型结合前端技术,实现命名实体识别任务案例可视化(见图1)。由于命名实体通常表示现实中具体的人、地点、组织机构、时间或事件等,因此命名实体识别在信息提取、机器翻译、自动问答、情感分析、知识图谱构建等应用场景中具有广泛的应用。
图1 命名实体识别任务

Figure 1 Named entity recognition task

近年来,随着古籍数字化进程不断加快,古文的命名实体识别任务变得尤为重要。古文命名实体识别有助于深入挖掘古文本身的语言、历史、文化等价值。通过识别古文中的人名、地名、时间等实体,能够为古代政治、经济、社会等方面的研究提供更加准确和全面的资料信息。但由于古文语料其语法、结构及字意的特殊性,从古文中提取实体难度极大。命名实体识别模型在提取实体前,需要准确理解字、词及语句的内容才能更加准确判定实体。古文存在很多一词多意的现象,模型理解古文语义十分困难。例如,古文中“策之不以其道”“执策而临之”“策勋十二传”中的“策”分别代表“驱使”“马鞭”“记录”的意思。其次,长度适中的语料便于命名实体识别模型记忆重要信息,遗忘非重要内容,推断实体可能存在的概率及判定实体的边界,而古文句式短小,简明扼要,模型推断实体存在的概率、捕捉文本边界信息或特征十分困难。例如,“知者不惑,仁者不忧,勇者不惧。”最后,嵌入字、词或词性等特征的输入表示隐含了实体构词规律和词边界等重要信息,面向古文领域的命名实体识别,现有的模型对于如何整合多粒度特征信息以及学习古文实体构词规则研究较少。针对上述问题,笔者提出多粒度特征融合的古文命名实体识别方法以提高实体识别的精度,以《左传》数据集为实验对象,构建时间、地名、人名等命名实体识别任务。实验结果证明了多粒度特征融合的古文命名实体识别方法的优异性。相较于传统模型,主要贡献如下:①提出一种融合字、词性、字形结构并显示学习边界信息的多粒度特征融合古文命名实体识别模型架构(以下简称MG-NER)。②设计了一种用于共享实体边界信息并启发式学习实体构词规律的Transfer交互器。

2 相关研究/Related research

2.1 早期命名实体识别技术发展研究

命名实体识别技术历史悠久,针对其特定任务的深度学习技术已经被广泛提出。较早解决命名实体识别任务的神经网络由J. Hammerton[3]提出,该模型采用的是LSTM(Long Short-Term Memory)神经网络。R. Collobert等[4]提出了CNN-CRF(Convolutional Neural Network-Conditional Random Field)的模型架构,取得了优于统计模型的效果。相较于单向LSTM仅使用过去时刻信息来预测当前的结果,Z. Huang等[5]提出BiLSTM-CRF(Bidirectional Long Short Term Memory-Conditional Random Field)作为命名实体识别任务的神经网络模型,取得了比单向LSTM神经网络更优异的结果。J. P. C. Chiu等[6]使用BiLSTM-CNNs(Bidirectional Long Short Term Memory-Convolutional Neural Networks)进行命名实体识别,进一步推动了该领域的发展。而A. Akbik等[7]则探讨用于序列标注的上下文字符串嵌入方法,为命名实体识别的研究提供了另一种视角。

2.2 基于预训练语言模型的命名实体识别技术

通过研究领域命名实体识别下游任务特点设计模型,并结合微调上游预训练语言模型的方法,可以有效提升领域化的命名实体识别精度。2018年10月谷歌AI团队发布新的预训练语言模型BERT(Bidirectional Encoder Representation from Transformers)[8]刷新包括命名实体识别等11项自然语言处理任务记录。预训练语言模型作为编码层并结合下游任务微调逐渐成为主流的文本挖掘方法。其后,一系列基于BERT改进的预训练语言模型出现。Z. Lan等[9]提出一种基于BERT的轻量级自监督学习模型ALBERT,通过分解词嵌入和跨层参数共享技术解决了BERT模型参数规模过大和训练下游任务时间长的问题。Y. Liu等[10]则使用更大规模的数据文本及参数量训练出性能优秀的预训练语言模型RoBERTa。中文预训练语言模型普适性虽强,但在面对特定领域文本的自然语言处理任务时,其功能的发挥容易受限。由于古文命名实体识别技术发展较晚,因此对于古文命名实体识别任务,领域化的深度预训练语言模型成为提高古文文本实体识别效果的关键技术。2022年刘江峰等[11]基于《四库全书》繁体语料在BERT和RoBERTa上进行继续训练得到SikuBERT和SikuRoBERTa预训练语言模型,其设计面向《左传》语料的命名实体识别等任务,验证了SikuBERT和SikuRoBERTa在古文词法、句法和语境学习以及泛化能力方面具有较强的能力。此外SikuBERT和SikuRoBERTa被第一个古汉语领域NLP工具评估比赛EvaHan 2022[12]作为封闭环境下的预训练模型。P. Wang等[12]在BERT预训练模型的基础上,使用了较SikuBERT和SikuRoBERTa更大规模的古文数据集训练得到了Bert-Ancient-Chinese模型,进一步丰富了古文领域化的深度预训练语言模型。

2.3 基于融合字词信息的命名实体识别技术

早期的命名实体识别模型通常以一个字或一个单词作为特征输入的单位。但通常一个中文词语是由多个中文符号构成,中文语句又由多个具有实际含义的字或词构成,仅仅以字作为输入单位会损失词语特征信息。因此,在模型输入阶段如何同时有效利用字和词信息成为提高中文命名实体识别模型性能的关键。许多学者和专家探究了不同的字信息和词信息融合方法。Y. Zhang等[13]提出了Lattice-LSTM模型,该模型同时对输入的字序列以及该字在词典中匹配得到的所有词序列进行编码,并将潜在的词汇信息融合进字信息当中,从而使得模型在获得字信息的同时,也可以有效地利用词的先验信息。但由于Lattice-LSTM模型拥有特定的复杂格子结构,很难完全利用GPU的并行计算能力,导致有着比较低的推理速度。随后,X. Li等[14]提出了面向中文的FLAT(Flat-lattice Transformer)模型,其针对Lattice结构设计了一种巧妙的编码方式,将Lattice转为平面结构,以此提高模型的推理速度。FLAT模型在古文命名实体识别中的优越性也被证实。谢靖等[15]以《黄帝内经·素问》为研究对象、以FLAT结构为微调模型,构建了中医文献中病症、病理等命名实体识别任务。实验结果证明,该微调模型可以同时有效利用字和词信息,提高古代中医命名实体的识别效率。M. Peng等[16]根据字符在其所有匹配词的位置划分4种集合,并将其整合对应到字符中,也有效降低了Lattice-LSTM方法的复杂程度。虽然,在特征输入阶段有效融合了字词信息,但大多方法忽略了如何利用模型充分提取、学习这些有效信息。

2.4 基于特征抽取的命名实体识别技术

中文或古文字符本身存在着一些实际含义,其字形结构、拼音信息、偏旁部首等的特定规律特征可以被模型学习,以此提高命名实体识别模型的效果。Z. Sun等[17]将每个字符的仿宋、行楷和隶书3种字形信息与拼音信息融合,在大规模语料上训练出中文预训练模型ChineseBERT,在命名实体识别任务中取得了优异的结果。尹成龙等[18]提出一种将词嵌入、字嵌入和部首嵌入相融合的新方法,该方法充分利用不同粒度的语义信息,提高了模型的识别效果。孙红等[19]提出了MF-NER方法,通过编码汉字中每个字部件,并使用注意力机制使得文本序列中的字启发式地融合细粒度信息,赋予模型获取中文字形特征的能力。上述方法均从汉字本身特点出发,赋予模型更多可学习的规律和特征。此后,基于联合辅助任务的命名实体识别技术也被广泛提出。C. Chen等[20]利用图注意力网络层捕捉句子中词间关系,并将实体首尾词汇的预测看作是两个独立的二分类问题,作为辅助任务加入训练,缓解了词边界冲突的问题。Y. Gu等[21]在加入预测实体头尾辅助任务的同时,进一步利用注意力机制让模型学习实体内字与字间的关联关系,并探索实体的命名规律性,在多个数据集取得了当年最好的结果。
目前,现有的古文命名实体识别研究在模型输入表征层未能有效融合字形信息、词性信息及字信息的特征表示。模型特征提取设计较为单一,未能有效探究实体边界及实体构词规律。针对以上问题,笔者将融合多重粒度的嵌入表示,并联合辅助任务预测实体头尾的同时使用注意力机制启发式学习实体构成规律,从而有效地提高古文命名实体识别任务的性能。

3 理论与模型/Theory and model

笔者提出了适用于古文命名实体识别任务的MG-NER模型。MG-NER模型由嵌入层、边界感知层、特征感知层、CRF[22]4个部分组成,模型结构见图2。首先,它直接将BERT作为编码器得到文本当中每个字的向量表示。MG-NER模型将字向量、词性向量和3种字体的字形结构特征向量融合作为最终的模型输入表示。其次,将多粒度特征融合向量表示分别送入边界感知层和特征感知层。边界感知层在预测实体头与实体尾的同时,利用Transfer交互器共享实体边界信息并启发式学习实体构词规律。特征感知层一方面使用BiLSTM[23]抽取序列的依赖关系和时序关系,另一方面使用IDCNN[24]扩张卷积视野,捕获长远距离特征信息,学习语句内部规律特征。最后,通过CRF层预测结果。接下来详细介绍模型。
图2 多粒度特征融合模型架构

Figure 2 Multi-granularity feature fusion model architecture

3.1 嵌入设计

3.1.1 向量

向量是一种在计算机科学和数学领域广泛使用的数据结构,向量可以用来表示各种信息和数据,是计算机理解人类语言和信息的一种数据媒介。通常,在自然语言处理各类任务中,通过预训练语言模型将字或词等对象映射成向量形式。预训练语言模型旨在通过在大量无监督语料上进行预训练,以学习丰富的上下文信息,获得比较好的语言表示,再将其应用到特定的自然语言处理的下游任务。在具体实验中,由于古文数据文本与通用领域数据文本有较大差异,因此使用Bert-ancient-Chinese[12]作为预训练语言模型。Bert-ancient-Chinese模型使用双向注意力机制在诗部、史部、医部等大规模的无监督古文语料库上进行预训练从而获得预训练语言模型。相比SikuBERT和SikuRoBERTa[25]等古文预训练语言模型Bert-ancient-Chinese拥有更大的词表,收录了更多的生僻字,因此更有利于提升模型在下游任务的表现性能。

3.1.2 字嵌入

MG-NER模型通过已有的BERT预训练模型在命名实体识别任务上进行微调(Fine-tune)操作,从而优化句子中每个字的上下文表示信息。给定一个输入序列 ,每一个字符的向量表示如公式(1)所示:

3.1.3 词性嵌入

已有的研究表明,结合词性的字特征作为模型的输入表示可以有效提高模型的学习能力。为了提高输入特征表示,强化模型对实体边界信息的识别能力,将词性向量拼接到字向量之后。一个词由一个字符或多个字符组成,为了对齐词与词性的粒度,笔者根据一个词包含字的个数复制词性。例如,“長安君”由“長”“安”和“君”3个字组成。“長安君”的词性为“NR”,因此将“NR”分别嵌入到“長”“安”和“君”3个字中,词性嵌入过程见图3。给定一个字级别向量序列 和一个词性向量序列 ,对于融合后的向量表示如公式(2)所示:
图3 词性嵌入示意图

Figure 3 Part-of-speech embedding diagram

3.1.4 字形结构嵌入

汉语是一种符号语言,很多字符属于象形字,字符的符号蕴含着丰富的语义信息和学习价值,例如,“液”“河”和“湖”都有“氵”,表示这些字符都与“水”的语义相关。因此,将字形结构融合模型中可以增强汉语自然语言模型的表现力。
受ChineseBERT启发,笔者采用仿宋、行楷和隶书3种字体。通过3种不同的字体对比和学习,可以使模型更好地从图像角度理解字符表达的含义。在特征输入阶段,通过多角度学习语句特征,有助于提高模型对于语料内容理解和学习的能力。分别将每个汉字进行20×20的图形向量化,然后将其分别拉平成1 200维向量,拼接后输入全连接层,最终得到融合3种字体的字形结构向量。仿宋、行楷、隶书3种字形结构嵌入的流程见图4。给定字与词性融合向量序列 和融合3种字体的字形结构向量序列 ,对于嵌入后的向量表示如公式(3)所示:
图4 字形结构嵌入流程

Figure 4 Glyph structure embedded flowchart

3.2 网络层

3.2.1 双向长短时记忆网络

BiLSTM是由双向LSTM网络组合而成,通过对输入的文本序列做顺序和逆序的计算,提取序列中的上下文信息[26],得到向量序列。实现其功能的主要单元为LSTM,LSTM通过选择性遗忘上一时刻的细胞状态中的信息以及记忆下一时刻新的信息得以传递,而无用的信息被释放丢弃,并在每个时间步都会输出隐层状态,其中遗忘、记忆与输出由通过上个时刻的隐层状态和当前输入计算出的遗忘门、记忆门、输出门来控制。

3.2.2 Transfer交互器

实体头与实体尾的预测可以有效挖掘嵌入特征的语义和实体边界等潜在信息。此外,实体构词也存在着一定规律性,这一规律性代表了某一类型的实体。例如,“篮球队”“足球队”都是以“队”字结尾,其都代表了组织团队这一类实体,“夏四月”“正月”“初月”都是以“月”字结尾,其都代表了时间这一类实体。预测实体头与实体尾的同时,启发式地学习这些字间规律特征,可以提升模型的整体性能。通过两个独立的BiLSTM网络及深度全连接网络层提取实体头尾特征信息,通过这种方式可以利用模型有效学习实体首尾的构词规律。此外,在学习实体首尾构词规律的同时,通过特征交互矩阵计算句内字与字间的得分可以启发式学习句内的规律特征。为了对齐字间规律得分及原始语句向量矩阵维度,将得到的字间规律特征矩阵与特征降维矩阵相互运算,最终得到包含语义信息及字间规律信息的信息矩阵。启发式学习字间规律特征流程如图5所示:
图5 启发式学习流程

Figure 5 Heuristic learning process diagram

笔者提出将Transfer交互器用于交互共享实体头与实体尾特征信息并启发式学习实体构词规律。Transfer交互器结构包括特征交互矩阵W、特征降维矩阵V、信息矩阵Head_information和Tail_information、激活函数tanh,输出矩阵Head_out和Tail_out,其结构如图6所示:
图6 Transfer交互器架构

Figure 6 Transfer interaction architecture

Transfer交互器核心思想为分别将用于预测实体开头与实体结尾的两个独立BiLSTM的输出与特征交互矩阵W相乘并使用tanh函数激活,充分交互实体头与实体尾的特征信息。通过特征降维矩阵V,进一步优化特征空间,挖掘潜在特征信息。
、 为两个独立BILSTM的输出,将其分别与特征交互矩阵W相乘并用双曲正切函数激活,得到包含实体头与实体尾关联特征信息的矩阵 、 。计算方法如公式(4)、公式(5)所示:
将关联特征信息的矩阵 、 分别与特征降维矩阵V相乘,进一步优化特征空间,并对其归一化得到信息矩阵 、 。计算方法如公式(6)、公式(7)所示:
、 分别与信息矩阵 、 相乘,得到包含了实体头与实体尾特征关联关系的输出矩阵Head_out和Tail_out。计算方法如公式(8)、公式(9)所示:

3.2.3 输出层和损失函数

笔者将边界感知层学习到的边界信息与特征感知层学习到的特征信息融合,最终送入CRF进行预测。
边界信息与特征信息融合计算方式见公式(10)。式中 、 、 分别为可学习参数,可以更好地平衡不同 模块对于模型的贡献程度。 和 分别为预测实体头与实体尾的输出矩阵,为学习到的特征融合矩阵。
MG-NER最终损失值采用损失合策略,边界感知层和特征感知层相互学习、相互作用,最终提高模型的准确性。损失合计算方法如公式(11)所示:

4 实验/Experiment

4.1 实验数据集

古文实体语料资源稀缺,获取难度较大,笔者采用古文数据集《左传》进行实验分析。《左传》是第一届古汉语分词与词性标注评测EvaHan2022所使用的数据集,包含训练集8 900条句子,验证集1 200条句子,测试集1 000条句子,每条句子中包含的实体类型和数量不等,总计分为三大实体类型,包括人名(Name)、地名(Loc)、时间(Time)。相较于诗歌、散文等其他古文数据集,《左传》语料内容丰富,句法复杂,实验结果具有一定的参考价值和意义。针对经典的文言文的命名实体识别任务,有利于研究目前学界已有古代汉语命名实体识别研究成果,更有利于发现、探讨当前研究进展的问题和不足,一同推动古代汉语命名实体识别技术的研究。表1和表2分别展示了《左传》语句规模统计情况、实体分布情况。
表1 《左传》数据集统计表

Table 1 Data set statistical table of Zuo Zhuan (单位:千)

数据集 类型 训练集大小 验证集大小 测试集大小
《左传》 Sentence
Char
8.9K
21.4K
1.2K
3.7K
1.0K
3.0K
表2 《左传》实体分布统计表

Table 2 Entity distribution statistical table of Zuo Zhuan (单位:个)

实体种类 训练集 验证集 测试集
人名 10 662 2 107 2 157
地名 5 199 1 486 1 875
时间 1 474 472 459
《左传》数据集使用BIOES标注体系进行序列标注。在BIOES序列标注体系中,B代表实体的起始位置,I代表实体的中间位置,O代表非实体部分,E代表实体终止位置,S代表单独字为一个实体。序列标注情况如表3所示:
表3 《左传》序列标注方式

Table 3 Sequence labeling of Zuo Zhuan

字 含义 序列标签 字 含义 序列标签
簡 人名 B-Name 有 非实体词 O
子 人名 E-Name , 非实体词 O
謂 非实体词 O 而 非实体词 O
無 人名 B-Name 無 非实体词 O
恤 人名 E-Name 以 非实体词 O
曰 非实体词 O 尹 人名 B-Name
: 非实体词 O 鐸 人名 E-Name
“ 非实体词 O 為 非实体词 O
晉 地名 B-LOC 少 非实体词 O
國 地名 E-LOC ” 非实体词 O
難 非实体词 O 。 非实体词 O
实验通过常用的命名实体识别评估指标对构建的模型进行性能评估,分别为精准率(Precision,P)、召回率(Recall,R)和F1值(F1)3个指标衡量模型的精准性。计算公式如下:

4.2 分词及词性标注

实验选取HanLP2.x工具对《左传》数据集进行分词及词性标注,HanLP2.x使用了大规模语料上预训练的语言模型,这些语料已经包括互联网上绝大部分的古代汉语和现代汉语。为了进一步提高分词及词性标注的准确率,降低由于分词及词性标注错误导致模型性能下降的风险,笔者对文本人工检查5 000余字。表4展示了HanLP2.x对《左传》数据集的分词及词性标注效果。
表4 HanLP2.x分词及词性标注效果

Table 4 HanLP 2.x segmentation and part-of-speech tagging performance

《左传》原文选取 HanLP2.x分词 HanLP2.x词性标注
春秋左傳隱公 春秋||左傳||隱公 t||n||nr
元年春,王周正月,不書卽位,攝也。 元年||春||,||王周||正月||,||不|| 書||卽位||,||攝||也||。 t||Tg||w||nr||t|w||d|Vg||v||w||Vg||v||w
三月,公及邾儀父盟于蔑——邾子克也。 三月||,||公||及||邾儀||父||盟||于||蔑||——||邾子||克||也||。 t||w||Ng||v||nr||n||Vg||p||Ng||w||n||nr||y||w
夏四月,費伯帥師城郎。 夏||四月||,||費伯||帥||師||城||郎||。 Tg||t||w||nr||Vg||Ng||ns||Ng||w

4.3 实验环境与实验参数设置

实验环境为Window11操作系统、CPU Intel Core i7-10700 2.90G Hz、16 GB RAM以及NVIDIA GeForce GTX 1660 SUPER 图形处理器。模型框架为Python3.9、torch1.13。为了更好地调整学习率策略,笔者采用等间隔调整的有序调整方法,即在每经过10轮迭代后,对学习率进行相应的衰减。其他参数详如表5所示:
表5 参数设置表

Table 5 Parameter settings table

超参数 值
学习率 1e-5
Batch大小 16
迭代次数 100
卷积核大小 3×3
BiLSTM隐藏层维度 128
输入句子最大长度 100
BERT隐藏层维度 768
图像特征维度 1 200
梯度下降优化器 Adam
Dropout 0.3

4.4 实验结果与分析

4.4.1 预训练模型对比实验

继2018年基于Transformer架构的预训练自然语言处理模型BERT出现后,针对各个特定领域的预训练自然语言模型相继出现。为得到对古文字编码效果更优的古文预训练自然语言模型,笔者以《左传》为研究语料,选取Bert-base-Chinese、Bert-ancient-Chinese、SikuBERT、SikuRoBERTa、GuwenBERT 5种预训练语言模型进行实验对比。此外,预训练语言模型与BiLSTM-CRF结合已成为命名实体识别任务基础研究模型,笔者在此基线模型基础上继续研究。实验结果如表6所示:
表6 预训练模型实验对比

Table 6 Pre-training model experiment comparison

对比预训练模型 评估指标/%
P R F1
Bert-base-Chinese+BiLSTM+CRF 86.25 64.16 73.58
Bert-ancient-Chinese+BiLSTM+CRF 89.17 70.12 78.72
SikuBERT+BiLSTM+CRF 87.92 69.91 77.89
SikuRoBERTa+BiLSTM+CRF 88.31 70.35 78.32
GuwenBERT+BiLSTM+CRF 55.27 35.88 43.51
由表6可知,Bert-base-Chinese预训练模型F1值较Bert-ancient-Chinese预训练模型下降5.14%。古文和现代汉语在词义、语法规则等方面存在显著差异,因此现有的中文预训练模型并不适用于古文命名实体识别任务。使用双向注意力机制在诗部、史部、医部等大规模的无监督古文语料库上进行预训练,因而获得的Bert-ancient-Chinese预训练语言模型的准确率、F1值明显高于其他预训练模型。笔者进行了多种基线模型对比实验,确定Bert-ancient-Chinese + BiLSTM + CRF为最优的基线模型组合方式。

4.4.2 词性嵌入对比实验

在基线模型的基础上,笔者选取jieba、HanLP2.x、HanLP2.x+人工重构3种方式对《左传》数据集进行词性标注。得到标注后的词性结果分别与静态词性向量文件匹配,得到50维的词性特征向量,并将词性特征向量拼接到字向量之后,进行命名实体识别任务。此外,由于一个词由一个或多个字符组成,为了对齐词与词性的粒度,笔者根据一个词包含字的个数复制词性。实验结果如表7所示:
表7 不同分词方式实验对比

Table 7 Experimental comparison of different segmentation methods


分词方式
评估指标/%
P R F1
jieba 90.66 70.14 79.09
HanLP2.x 91.95 73.14 81.47
HanLP2.x+人工重构 88.02 77.25 82.28
由表7可知,由于jieba分词针对古汉语分词及词性标注效果不佳,错误的词性特征传播会导致模型学习到错误的特征,其效果不佳。HanLP2.x+人工重构的词性标方式在《左传》数据集的精确率方面不如HanLP2.x,但其召回率较HanLP2.x提升了4.11%,具有显著的优势。

4.4.3 实验对比

在《左传》数据集上,笔者提出的MG-NER模型与已有的多种模型进行对比,实验证明了提出的MG-NER命名实体识别模型的有效性,实验结果如表8所示:
(1)FLAT:X. Li等[14]将Lattice结构转化为由多个跨度组成的平面结构,每个跨度对应一个字或词以及其相对应的原始位置。此外,为了对不同跨度产生交互,笔者提出了跨度的相对位置编码。该模型解决了模型性能效率低下、引入外部词汇信息不全或错误的问题。
(2)SIMP:M. Peng等[16]提出一种将每个字符的所有匹配词合并到字符级别NER模型的方法。该方法解决了分词带来的错误传播及模型无法完全利用词信息的问题。通过实验验证了所提出方法的有效性。
(3)MECT:S. Wu等[27]利用汉字的结构信息来加强汉字的特征表达,在FLAT基础上提出使用多元数据嵌入来集成汉字特征和部首级嵌入的方法。MECT能够更好地捕捉汉字的语义信息,为模型提供更多的特征信息。实验结果证明了该方法的优越性。
(4)HGN:J. Hu等[28]提出一种使用滑动窗口机制提取局部特征和位置信息的方法。该模型将全局信息和局部信息进行融合预测实体标签,解决了Transformer忽略局部特征信息的问题。
表8 不同模型对比实验

Table 8 Comparative experiment of different model

模型 评估指标
P/% R/% F1/%
FLAT 88.69 75.83 81.76
SIMP 89.73 75.96 82.13
MECT 90.07 75.04 81.85
HGN 88.53 79.12 83.56
MG-NER-Glyph 94.26 83.57 88.59
MG-NER+Glyph 91.33 84.32 87.67
由表8可知,笔者提出的MG-NER模型在《左传》数据集展示出了优秀的性能。在不嵌入3种字形特征时,其F1值达到了88.59%,MG-NER在捕捉实体边界的同时,启发式地学习实体字间规律,有效学习利用了输入阶段的特征信息。加入字形图像特征时,由于对图像采用全连接层进行特征提取,虽然提高了一定时间效率,但特征信息相对粗糙,存在一些噪音问题导致精确率下降,提取到了很多非实体片段。加入图像特征的同时,模型学习到了那些能用字形结构表达字符本身含义的规律,捕捉到了更多的实体片段,因此召回率有所提升,达到84.32%。FLAT模型提升了词汇信息质量,SIMP模型充分提高了字词的特征表示能力,MECT模型和MF-NER模型根据汉字特点引入结构特征,HGN有效捕捉了局部特征,但以上对比模型都没有充分挖掘潜在特征对于模型的正向反馈以及实体构词规律的学习,因此其效果不如笔者提出的MG-NER模型。此外,由于古文语料实体分布特殊,一大部分实体均由一个字符构成,模型学习其特征规律较为困难,因此实验结果普遍不如通用领域命名实体识别实验结果。

4.4.4 消融实验

为进一步验证MG-NER模型各个模块的有效性,在《左传》数据集中进行不同子模块消融实验。其中,对整体模型的6个子模块消融包括:①在特征输入阶段去掉字形特征;②在特征输入阶段加入字形特征;③保留预测实体头尾辅助任务,在特征抽取阶段去掉IDCNN网络,仅用BiLSTM网络对特征进行抽取;④去掉用于启发式学习字间规律的Transfer交互器;⑤在特征输入阶段去掉拼接的词性特征向量;⑥去掉预测实体头尾的辅助模块以及用于启发式学习字间规律的Transfer交互器。实验结果如表9所示:
表9 消融实验

Table 9 Ablation experiment

模型 评估指标/%
P R F1
MG-NER-Glyph 94.26 83.57 88.59
MG-NER+Glyph 91.33 84.32 87.67
-IDCNN 91.72 77.74 83.58
-Transfer交互器 93.95 81.56 87.07
-Pos 91.90 79.42 84.91
-边界感知层 92.66 80.37 85.86
由表9可知,在嵌入层加入字形特征时,由于模型获取了更多有效特征信息,充分学习了一些可以由字形结构体现字符所表达的含义,捕捉到了更多的实体片段,召回率提升0.75%,但在图像特征提取时,使用全连接层将图片结构拉平进行特征提取,提取特征粒度相对粗糙,捕捉到了一些非实体片段,具有一定的噪音导致精确率有所下降。因此,在特征输入阶段加入图像模态的特征信息具有一定的积极因素和消极因素。其中去掉IDCNN网络,在《左传》数据集的F1下降5%。IDCNN网络采用卷积层和池化层,通过局部感受视野提取特征,更多关注于相邻字符间的关系,而BiLSTM网络具有前向和后向两个LSTM层,更多关注于上下文信息。在特征提取阶段,IDCNN网络与BiLSTM呈现出了互补结构,若去掉某一网络,精确率、召回率和F1值均有明显的下降趋势。其中去掉Transfer交互器,在《左传》数据集的F1下降1.52%。Transfer交互器通过特征交互矩阵启发式的学习到了实体字间的规律特征。古文语句的句法结构复杂,字间存在很多值得学习的规律特征,仅通过预测实体头尾辅助任务学习实体首尾规律而忽略实体内的字间规律导致实验结果F1值明显下降。其中去掉词性特征,在《左传》数据集的精确率、召回率和F1值分别下降2.36%、4.15%、3.68%。一个词由一个字符或多个字符组成,为了对齐词与词性的粒度,在MG-NER模型中,根据一个词包含字的个数复制词性,并拼接在字向量之后。因此,词性特征包含了词语的边界信息,可以让模型充分学习词边界特征信息。在划分词性时对比不同词性标注工具,选取较为精准的HanLP2.x工具,并人工校验了5 000余字,因此词性特征对于MG-NER在各指标的影响十分显著。其中去掉边界感知层,在《左传》数据集的F1下降2.73%。边界感知层旨在显示识别实体头尾部分,充分学习词性特征潜在的边界信息,边界感知层与词性嵌入特征二者相得益彰。实验结果证明了本方法的有效性。

5 结语/Conclusions

笔者提出了数字人文视域下多粒度特征融合的古文命名实体识别MG-NER模型。MG-NER模型将字特征、词性特征、字形特征相互融合,提高模型输入阶段的特征表达。实验证明,通过多角度学习字词及字结构特征可以有效提高模型预测实体的性能。虽然通过提高特征输入方法使得模型性能得到一定提升,但同时需要明确特征种类及特点,调整模型网络层的架构才能令模型更好地捕捉、学习、掌握这些规律特征。研究发现,特征输入阶段在加入词性信息后,其特征向量包含了词边界信息,通过加入预测实体头尾辅助任务让模型进一步学习实体边界特征规律,以此让模型发挥最大学习效能。除实体头尾外,实体内的字间也存在一定规律性,在加入预测实体头尾辅助任务学习边界信息的同时,通过Transfer交互器启发式学习字间规律特征,实验证明了Transfer交互器可以有效计算字间规律得分,帮助模型掌握字间规律,提高判别实体段的能力。面向古文领域的语料,一个字代表一类地名实体、时间实体、人名实体较为常见,并且这些字大多由表及意。从字形结构的角度输入特征,利用BiLSTM网络和IDCNN网络联合抽取学习文字及图像多元特征。在加入字形结构特征后,其精确率和F1值下降,但召回率有所升高,说明MG-NER模型学习到了一些有用信息,但由于提取图像特征粗糙存在一些噪声,导致了一定的错误传播。因此,可以根据实际需要选取是否加入字形特征。通过对比实验及消融实验,均证明了MG-NER模型的优秀性能。
未来笔者将结合大模型外部知识、大模型数据增强等方法继续优化MG-NER模型以提高古文命名实体识别的性能,并构建以MG-NER模型为核心的古文数据集实体自动标注可视化系统。

孟佳娜:设计研究方案,修改论文;

许英傲:提出研究思路,撰写论文;

赵丹丹:采集、清洗和分析数据;

李丰毅:设计实验,处理数据;

赵 迪:修订论文与定稿。

[1]
王东波.SikuBERT:数字人文下的古籍智能信息处理(专题前言)[J]. 图书馆论坛,2022,42(6):30.(WANG D B. SikuBERT: intelligent information processing of ancient texts in digital humanities(special introduction)[J]. Library tribune,2022,42(6):30.)

[2]
GRISHMAN R, SUNDHEIM B. Message understanding conference 6: a brief history[C]// Proceedings of the 16th conference on computational linguistics. Stroudsburg: Association for Computational Linguistics, 1996.

[3]
HAMMERTON J. Named entity recognition with long short-term memory[C]// Proceedings of Conference on natural language learning at HLT-NAACL. Stroudsburg: Association for Computational Linguistics, 2003.

[4]
COLLOBERT R, WESTON J, BOTTOU L, et al. Natural language processing (almost) from scratch[J]. Journal of machine learning research, 2011, 12(1):2493-2537.

[5]
HUANG Z, XU W, YU K. Bidirectional LSTM-CRF models for sequence tagging: computer science[EB/OL]. [2024-06-20].https://arxiv.org/abs/1508.01991.

[6]
CHIU J P C, NICHOLS E. Named entity recognition with bidirectional LSTM-CNNs: computer science[EB/OL].[2024-06-20].https://aclanthology.org/Q16-1026.

[7]
AKBIK A, BLYTHE D, VOLLGRAF R. Contextual string embeddings for sequence labeling[C]// Proceedings of International conference on computational linguistics. Stroudsburg: Association for Computational Linguistics, 2018.

[8]
DEVLIN J, CHANG M W, LEE K, et al. Bert: pre-training of deep bidirectional transformers for language understanding: computer science[EB/OL]. [2024-06-20].https://arxiv.org/abs/1810.04805.

[9]
LAN Z, CHEN M, GOODMAN S, et al. ALBERT: a lite BERT for self-supervised learning of language representations: computer science[EB/OL]. [2024-07-15].https://arxiv.org/abs/1909.11942.

[10]
LIU Y, OTT M, GOYAL N, et al. RoBERTa: a robustly optimized BERT pretraining approach: computer science[EB/OL]. [2024-07-15].https://arxiv.org/abs/1907.11692.

[11]
刘江峰,冯钰童,王东波,等. 数字人文视域下SikuBERT增强的史籍实体识别研究[J].图书馆论坛,2022,42(10):61-72.(LIU J F, FENG Y T, WANG D B. Research on historical entity recognition enhanced by SikuBERT under the perspective of digital humanities[J]. Library tribune,2022,42(10):61-72.)

[12]
WANG P, REN Z. The uncertainty-based retrieval framework for ancient Chinese CWS and POS: computer science[EB/OL]. [2024-07-20].https://arxiv.org/abs/2310.08496.

[13]
ZHANG Y, YANG J. Chinese NER using Lattice LSTM: computer science[EB/OL]. [2024-07-20].https://arxiv.org/abs/1805.02023.

[14]
LI X, YAN H, QIU X, et al. FLAT: Chinese NER using Flat-Lattice Transformer: computer science[EB/OL]. [2024-07-20].https://arxiv.org/abs/2004.11795.

[15]
谢靖,刘江峰,王东波.古代中国医学文献的命名实体识别研究——以Flat-lattice增强的SikuBERT预训练模型为例[J].图书馆论坛,2022,42(10):51-60.(XIE J, LIU J F, WANG D B. Research on named entity recognition of ancient Chinese medical literature: a case study of flat-lattice enhanced SikuBERT pre-trained model[J]. Library tribune,2022,42(10):51-60.)

[16]
PENG M, MA R, ZHANG Q, et al. Simplify the usage of lexicon in Chinese NER: computer science[EB/OL]. [2024-07-20].https://arxiv.org/abs/1908.05969.

[17]
SUN Z, LI X, SUN X, et al. Chinesebert: Chinese pretraining enhanced by glyph and pinyin information: computer science[EB/OL]. [2024-07-26].https://arxiv.org/abs/2106.16038.

[18]
尹成龙, 陈爱国. 融合多重嵌入的中文命名实体识别[J].中文信息学报,2023,37(4):63-71.(YIN C L, CHEN A G. Chinese Named entity recognition with integrated multiple embeddings[J]. Journal of Chinese information processing, 2023,37(4):63-71.)

[19]
孙红,王哲. 多粒度融合的命名实体识别[J]. 中文信息学报, 2023, 37(3): 123-134.(SUN H, WANG Z. Named entity recognition with multi-granularity fusion[J]. Journal of Chinese information processing, 2023, 37(3): 123-134.)

[20]
CHEN C, KONG F. Enhancing entity boundary detection for better Chinese named entity recognition[C]//Proceedings of the 59th annual meeting of the Association for Computational Linguistics and the 11th International joint conference on natural language processing. Stroudsburg: Association for Computational Linguistics, 2021: 20-25.

[21]
GU Y, QU X, WANG Z, et al. Delving deep into regularity: a simple but effective method for Chinese named entity recognition[J]. arxiv:2204.05544, 2022.

[22]
LAFFERTY J, MCCALLUM A, PEREIRA F C N. Conditional random fields: probabilistic models for segmenting and labeling sequence data[C]//Proceedings of International conference on machine learning. San Francisco: Morgan Kaufmann Publishers, 2002.

[23]
ZHOU P, SHI W, TIAN J, et al. Attention-based bidirectional long short-term memory networks for relation classification[C]//Proceedings of the 54th annual meeting of the Association for Computational Linguistics. Berlin: Association for Computational Linguistics, 2016.

[24]
STRUBELL E, VERGA P, BELANGER D, et al. Fast and accurate entity recognition with iterated dilated convolutions: computer science[EB/OL]. [2024-07-26].https://arxiv.org/abs/1702.02098.

[25]
王东波, 刘畅, 朱子赫, 等. SikuBERT与SikuRoBERTa:面向数字人文的《四库全书》预训练模型构建及应用研究[J].图书馆论坛,2022,42(6):31-43.(WANG D B,LIU C,ZHU Z H. SikuBERT and SikuRoBERTa: research on the construction and application of pre-trained models for the Siku Quanshu (Complete Library of the Four Treasuries)in the Context of Digital Humanities[J]. Library tribune, 2022, 42(6):31-43.)

[26]
李正辉,廖光忠.基于多层次特征提取的中文医疗实体识别[J].计算机技术与发展,2023,33(9):119-125.(LI Z H,LIAO G Z. Chinese medical entity recognition based on multi-level feature extraction[J].Computer technology and development,2023,33(9):119-125.)

[27]
WU S, SONG X, FENG Z. MECT: multi-metadata embedding based cross-transformer for Chinese named entity recogtion[EB/OL]. https://aclanthology.org/2021.acl-long.121.pdf.

[28]
HU J, SHEN Y, LIU Y, et al. Hero-gang neural model for named entity recognition[C]//Proceedings of the 2022 conference of the North American Chapter of the Association for Computational Linguistics: human language technologies. Seattle: Association for Computational Linguistics, 2022: 1924-1936.

Outlines

/

〈 〉