《计算机技术与发展杂志》发表论文赏析

基于 Spark 与词语相关度的 KNN 文本分类算法

来源:计算机技术与发展杂志2018年第03期北京时间:

作者:于苹苹;倪建成;韦锦涛;曹博;姚彬修

摘要:针对 K-最近邻(KNN)分类算法在当前大数据背景下分类效率降低、分类效果不理想的问题,提出了一种基于Spark 框架与词语相关度优化的高效 KNN 文本分类算法。 在相似度计算过程中,采用词语相关度将文本词语间的关系考虑在内,对分类算法相似度计算进行优化,从而提高文本分类的准确度;依托 Spark 计算框架的内存处理机制,实现文本分类的并行化,从而提高 KNN 文本分类算法的处理效率,同时在并行化过程中建立类别-距离向量,以进一步加快文本分类的处理速度。 实验结果表明,Spark 框架下基于词语相关度的 KNN 文本分类算法在保证分类效果的基础上大大提高了分类效率,较 Hadoop 平台有较好的加速比,可有效地对大数据进行分类处理。

关键词:K-最近邻;词语相关度;Spark;并行化计算

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!