《计算机技术与发展杂志》发表论文赏析

基于频繁词网络的 LDA 最优主题个数选取方法

来源:计算机技术与发展杂志2018年第08期北京时间:

作者:李菲菲;王移芝

摘要:LDA(latent Dirichlet allocation,隐含狄利克雷分布)主题模型被广泛应用于大规模文档处理,通常用于主题提取、情感分析和文本降维等。 这些模型使用类似期望最大算法从文档集合中提取低维语义分布,并将每一维分布有效结合,形成主题。 在模型构建过程中,初始主题数 K 对迭代过程与结果非常重要。 针对这一问题,根据文档聚类簇数(即社区个数)与文档集隐含主题数相一致的特点,提出了一种以频繁词集网络的社区划分个数用来指定 LDA 主题模型主题输入个数的方法。 该方法对文档构建频繁词对,并以此为基础构建词共现网络,然后采用无监督社区划分算法对该词共现网络进行社区划分,并以划分的社区个数作为 LDA 主题模型的主题个数。 实验结果表明,该方法可以自动化指定主题个数 K ,显著提升主题查准率和查全率,主题独立性更强。

关键词:隐含狄利克雷分布;主题模型;频繁词网络;聚类;社区划

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!