《湖北农业科学杂志》发表论文赏析
作者:麻之润1,2, 费凡1, 黎芬1, 董慧洁1, 彭琳1
单位:1.云南农业大学大数据学院,昆明 650000; 2.绿色农产品大数据智能信息处理工程研究中心,昆明 650000
摘要:为了便捷、准确、高效地识别海量信息中所描述问题的所属类别,解决农业领域短文本分类存在数据稀疏性、高度依赖上下文等问题,爬取了10 000多条农业问答领域的短文本,经过清洗、过滤和标注等处理后形成一个5分类的短文本数据集;构建了基于BERT和ERNIE预训练模型的农业短文本分类算法,并与基于决策树模型的农业短文本分类算法进行对比分析。结果表明,随着数据集样本的减少,3种模型的准确率、精确率和召回率均呈下降趋势;基于ERNIE预训练模型的准确率、F1值处于较高水平,远高于同数据的决策树模型,表明构建的农业短文本分类算法能够在数据量不足的情况下依然获得较高的分类效果。
关键词:预训练模型,文本分类,BERT,ERNIE
基金资助:云南省重大科技专项(202002AD080002)