《计算机技术与发展杂志》发表论文赏析
作者:陈雪松;李欣蕾;王浩畅
单位:1. 东北石油大学 电气信息工程学院,黑龙江 大庆 163318;2. 东北石油大学 计算机与信息技术学院,黑龙江 大庆 163318
摘要:法律文本具有高度的多样性与复杂性,准确识别法律文本中的各种法律命名实体,对于提高法律数据处理的准确性和效率至关重要。 针对法律文本复杂以及在命名实体识别过程中提取特征信息的方式单一等问题,该文提出了一种基于特征融合的法律文本命名实体识别方法。 具体来说,首先,使用 Legal-ELECTRA 模型作为模型嵌入层,提供字符级嵌入。 其次,使用双向长短时记忆(Bi-directional Long Short-Term Memory,BiLSTM)网络模型和 R-Transformer(Recurrent Neural Network Enhanced Transformer)模型并行提取特征,以获取不同粒度的特征,再将得到的特征进行特征融合,从而更好地理解数据的关键信息,获得更丰富的上下文特征。最后,使用条件随机场进行解码,实现序列预测。 实验结果表明,该方法在数据集 Resume 上有显著提升,该模型在自建的法律领域数据集 Law 上的精确率、召回率和 F1 值分别达到了93. 28% 、94. 62% 、93. 95% ,相比 BiLSTM-CRF、BERT-Transformer-CRF 等方法,具有较优识别效果,证明了该模型在法律领域命名实体识别中的有效性。
关键词:命名实体识别;法律领域;特征提取;特征融合;Legal-ELECTRA模型