《计算机技术与发展杂志》发表论文赏析
作者:文青青;李金星;王虎;李莉婕;赵泽英;郭雷风;*
单位:1. 新疆农业大学 计算机与信息工程学院,新疆 乌鲁木齐 830052;2. 中国农业科学院 农业信息研究所,北京 100080;3. 贵州省农业科技信息研究所,贵州 贵阳 550006
摘要:针对猕猴桃病虫害领域存在的训练数据稀缺、实体结构复杂多变、实体类型繁多以及实体分布不均衡等难题,引入了基于数据增强的 BERT 模型。 首先对收集的 6 本书籍信息进行分析后,构建了包含 11 种实体类别的猕猴桃病虫害数据集 KIVINER,之后为了有效扩充猕猴桃病虫害数据集,采用了句子重组和基于语言模型生成这两种数据增强方法。 在初步研究中,分别对 IDCNN-CRF、BERT-BiLSTM-CRF、RoBERT-BiLSTM-CRF、ALBERT 和 BERT 这五个模型在猕猴桃病虫害原始数据集上的性能进行了实验。 实验结果显示,BERT 模型在 10 类实体上的 F1 值均达到了 90% 以上,总体 F1 值达到了 93. 4% 。 随后,探讨了不同数据增强策略对 BERT 模型在猕猴桃病虫害命名实体识别任务中性能的影响。 实验结果表明,句子重组方法和基于语言模型的方法的 F1 值分别提升到了 94. 29% 和 94. 11% 。将两种数据增强方法结合后,模型的精确率、召回率和 F1 值达到了最高,分别为 94. 12% 、95. 17% 和 94. 64% ,同时,该模型在公开数据集 Resume 上也取得了不错的效果,说明该模型具有一定的泛化能力。
关键词:猕猴桃病虫害;数据增强;BERT;句子重组;语言模型生成;命名实体识别