《计算机技术与发展杂志》发表论文赏析
作者:王雨琪;刘晨;刘建炜*;蔡宏民
单位:1. 大规模流数据集成与分析技术北京市重点实验室(北方工业大学),北京 100144;2. 福建幼儿师范高等专科学校,福建 福州 350007;3. 华南理工大学,广东 广州 510640
摘要:自然语言处理技术在文本分析中的应用,显著提高了从海量数据中提取关键信息的效率。 基于自然语言处理技术的主题分析方法也在文本分析领域中取得了一定成果。 然而,由于政策文本数据具有场景复杂、文本长和头部效应等挑战,现有的主题挖掘方法生成的主题结果仍有较大的进步空间。 针对政策文本主题建模的挑战,该文基于 BERTopic 方法,引入了动态文档嵌入优化器和流行度纠偏正则化项。 分别克服了 BERTopic 只能在固定维度挖掘主题导致的普适性不足以及受到词级别的流行度偏差影响导致的主题结果同质化问题,实现了对最佳主题聚类向量维度的自动选择和对热门词汇的有效纠偏。 通过对实验分析,改进后的 BERTopic 方法在主题一致性、主题多样性和综合质量指标上均显著优于原始 BERTopic 模型及先进的神经网络主题模型;在可视化结果上,生成的主题质量也显著优于原生模型。
关键词:自然语言处理;主题模型;政策文本;BERTopic;流行度偏差