《计算机工程与应用杂志》发表论文赏析
作者:杨书新, 刘天扬, 黄伟东
单位:江西理工大学 信息工程学院,江西 赣州 341000
摘要:中文法律文书命名实体识别是智慧司法的基础性任务。目前的中文法律文书命名实体识别研究中已经取得一些成果,但其中大部分方法依赖于已标注的法律语料而未有效利用未标注的法律语料,且不能深入获取法律文书的特征。针对上述问题,提出一种中文法律文书命名实体识别框架。该框架使用基于双向编码器的转换器模型来学习中文法律文书的向量表示,并使用能够融合法律术语特征的双向长短时记忆网络语言模型来捕捉法律文书序列的上下文特征向量。该框架将中文法律文书的向量表示和上下文特征向量进行融合,融合后的特征向量被输入到一个由双向门控循环单元、自注意力机制和条件随机场组成的模块中进行训练。此外,为了使框架在缺少已标注的法律语料时也能得到更加充分的训练,使用未标注的法律语料进行自训练,生成新标注的法律语料并将其与初始标注的法律语料合并,通过进行迭代训练来提升框架性能。实验结果表明,该框架优于其他基于主流神经网络的命名实体识别模型。
关键词:法律文书,实体命名识别,半监督学习