《计算机应用研究杂志》发表论文赏析

利用N-gram和语义分析的维吾尔语文本相似性检测方法

来源:计算机应用研究杂志2019年第9期北京时间:

作者:张莹,亚森·艾则孜,吴顺祥,

单位:1.新疆警察学院信息安全工程系,乌鲁木齐830011;2.厦门大学自动化系,福建厦门361005;

摘要:为了实现维吾尔语文本的相似性检测,提出一种基于N-gram和语义分析的相似性检测方法。根据维吾尔语单词特征,采用了N-gram统计模型来获得词语,并根据词语在文本中的出现频率来构建词语—文本关系矩阵,并作为文本模型。采用了潜在语义分析(LSA)来获得词语及其文本之间的隐藏关联,以此解决维吾尔语词义模糊的问题,并获得准确的相似度。在包含重组和同义词替换的剽窃文本集上进行实验,结果表明该方法能够准确有效地检测出相似性。

关键词:维吾尔语,文本相似性检测,N-gram统计模型,潜在语义分析,

基金资助:国家自然科学基金资助项目(61762086);新疆维吾尔自治区高校科研计划立项项目(XJEDU2016S090);;

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!