《计算机应用与软件杂志》发表论文赏析
作者:刘冬, 翁海光, 陈一民
摘要:针对110报警类警情文本数据存在着文本长度极短且样本类别分布严重不均衡的问题,提出一种BERT-BiGRU-WCELoss警情分类模型。该模型通过中文预训练BERT(Bidirectional Encoder Representations from Transformers)模型抽取文本的语义;使用BiGRU(Bidirectional Gated Recurrent Unit)综合提炼文本的语义特征;通过优化自适应权重损失函数WCELoss(Weight Cross Entropy Loss function)给少数类样本赋予更大的损失权重。实验结果表明:该模型在某市2015年某一自然月的110报警数据集上取得了95.83%的分类准确率,精准率、召回率、F1值和G_mean均高于传统深度学习模型和交叉熵损失训练的模型。
关键词:BERT, BiGRU, 警情分类, 非均衡数据, 短文本, 样本加权