《计算机应用杂志》发表论文赏析
作者:束珏, 成卫青, 邓聪
单位:1. 南京邮电大学 计算机学院, 南京 210003;2. 计算机网络和信息集成教育部重点实验室(东南大学), 南京 211189
摘要:针对微博聚类正确率不高的问题,在研究微博数据特点的基础上,利用微博hashtag来增强向量空间模型,使用微博之间的转发关系提升聚类的准确性,并利用微博的转发、评论数以及微博发布者信息来提取聚类中的主题词。在新浪微博数据集上进行实验发现,与k-means算法和基于加权语义和贝叶斯的中文短文本增量聚类算法(ICST-WSNB)相比,基于话题标签和转发关系的微博聚类算法的准确率比k-means算法提高了18.5%,比ICST-WSNB提高了6.48%,召回率以及F-值也有了一定的提高。实验结果表明基于话题标签和转发关系的微博聚类算法能够有效地提高微博聚类的正确率,进而获取更加合适的主题词。
关键词:微博数据,文本挖掘,特征权重,微博转发关系,主题词提取
基金资助:国家自然科学基金资助项目(61170322,71171117,61373065);计算机网络和信息集成教育部重点实验室资助项目(K93-9-2014-04B)。