《计算机工程杂志》发表论文赏析
作者:段丹丹, 唐加山, 温勇, 袁克海
单位:1. 南京邮电大学 理学院, 南京 210023;2. 圣母大学 心理学系, 美国 南本德 46556
摘要:针对现有中文短文本分类算法通常存在特征稀疏、用词不规范和数据海量等问题,提出一种基于Transformer的双向编码器表示(BERT)的中文短文本分类算法,使用BERT预训练语言模型对短文本进行句子层面的特征向量表示,并将获得的特征向量输入Softmax回归模型进行训练与分类。实验结果表明,随着搜狐新闻文本数据量的增加,该算法在测试集上的整体F1值最高达到93%,相比基于TextCNN模型的短文本分类算法提升6个百分点,说明其能有效表示句子层面的语义信息,具有更好的中文短文本分类效果。
关键词:中文短文本分类,基于Transformer的双向编码器表示,Softmax回归模型,TextCNN模型,word2vec模型
基金资助:南京邮电大学横向科研项目(2018外095)。