《计算机应用与软件杂志》发表论文赏析
作者:黄振业, 莫淦清, 余可曼
摘要:检测长文本和短文本相似性的应用场景越来越多,文本对的致性检测大多可以统一抽象成文本相似性的比较问题。该问题的难点在于短文本是零散的,从而很难判断其属于哪个领域及其背景知识也难以引入词嵌入来解决在通用场景的具体文本匹配问题。基于这个问题,提出一种新的基于文本聚类主题模型的轻量方法,不需要利用额外的背最知识来匹配通用文本相似性。在两个经典测试样本数据集上的实验结果表明,该方法的文本相似性检测效率非常高。
关键词:自然语言处理, 文本匹配, 主题模型, 吉布斯采样