《计算机技术与发展杂志》发表论文赏析

基于 LDA 和 BiGRU 的文本分类

来源:计算机技术与发展杂志2022年第04期北京时间:

作者:冼广铭;王鲁栋;曾碧卿;梅灏洋;陶睿

摘要:文本分类是自然语言处理的基础任务,文本中的特征稀疏性和提取特征所用的神经网络影响后续的分类效果。针对文本中的特征信息不足以及传统模型上下文依赖关系方面不足的问题,提出经过 TF-IDF 加权的词向量和 LDA 主题模型相融合,利用双向门控循环神经网络层( BiGRU) 充分提取文本深度信息特征的分类方法。 该方法主要使用的数据集是天池比赛新闻文本分类数据集,首先用 Word2vec 和 LDA 模型分别在语料库中训练词向量,Word2vec 经过 TF-IDF 进行加权所得的词向量再与 LDA 训练的经过最大主题概率扩展的词向量进行简单拼接,拼接后得到文本矩阵,将文本矩阵输入到 BiGRU 神经网络中,分别从前后两个反方向提取文本深层次信息的特征向量,最后使用 softmax 函数进行多分类,根据输出的概率判断所属的类别。 与现有的常用文本分类模型相比,准确率、F1 值等评价指标都有了较高的提升。

关键词:LDA 主题模型;BiGRU;Word2vec;深度学习;文本分类

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!