《计算机技术与发展杂志》发表论文赏析
作者:卫华;韩立新;夏建华
摘要:文本聚类在数据挖掘和机器学习中发挥着重要作用,该技术经过多年的发展,已产生了一系列的理论成果。传统向量空间模型的文本建模方法存在维度高、数据稀疏和缺乏语义信息等问题,然而仅仅引入词典的文本建模部分解决了语义问题却又受限于人工词典词量少、人工耗力大等多种问题。文中借鉴主题模型的思想,提出一种以word2vec算法得到词向量为基础,词聚类的类别为主题,结合文本中主题的频率、分布范围、位置因子等特征以获得文本在类别空间上的特征向量,完成文本建模的方法word2fea。将其与两种文本建模方法VSM和word2vec base进行比较,实验结果表明该方法能够明显提高文本分类准确率。
关键词:word2vec;文本建模;文本分类;word2fea