《计算机工程与应用杂志》发表论文赏析
作者:帕尔哈提·吐拉江, 孙媛媛, 蔡艾宸, 王艳华, 林鸿飞
单位:1.大连理工大学 计算机科学与技术学院,辽宁 大连 116024;2.新疆师范大学 计算机科学技术学院,乌鲁木齐 830054;3.中国人民解放军空军通信士官学校,辽宁 大连 710038
摘要:针对司法领域低资源语言法律文书的命名实体识别面临的标注数据匮乏和领域适应性差两大问题,提出了一种融合领域词汇扩充的改进策略。以维吾尔语为例,通过动态扩充特定领域的词汇,将这些词汇融入预训练模型的词汇表中,并在人工标注的维吾尔语法律文书数据集UgLaw-NERD上对模型进行微调,增强模型在司法领域命名实体识别任务中的性能。研究以多个多语言预训练模型为基线进行对比评估,结果显示,融合领域词汇扩充策略使得F1分数相比未扩充词汇的基线模型提高了7.39个百分点,精确率和召回率也显著提升。此外,实验还分析了词汇表大小对模型性能的影响,随着特定领域词汇的逐步增加,精确率、召回率和F1分数整体呈上升趋势;在词汇扩充较大时,模型性能仍能保持稳定提升,但精确率与召回率的增幅相对前期有所减缓。研究结果表明,融合领域词汇扩充策略有效提高了预训练模型对维吾尔语法律文书中命名实体的识别能力,为低资源语言法律文本的处理提供了一种可行的解决方案。
关键词:多语言预训练模型,司法领域,领域词汇扩充,低资源语言,维吾尔语,命名实体识别