《计算机技术与发展杂志》发表论文赏析
作者:于苹苹;倪建成;韦锦涛;曹博;姚彬修
摘要:针对 K-最近邻(KNN)分类算法在当前大数据背景下分类效率降低、分类效果不理想的问题,提出了一种基于Spark 框架与词语相关度优化的高效 KNN 文本分类算法。 在相似度计算过程中,采用词语相关度将文本词语间的关系考虑在内,对分类算法相似度计算进行优化,从而提高文本分类的准确度;依托 Spark 计算框架的内存处理机制,实现文本分类的并行化,从而提高 KNN 文本分类算法的处理效率,同时在并行化过程中建立类别-距离向量,以进一步加快文本分类的处理速度。 实验结果表明,Spark 框架下基于词语相关度的 KNN 文本分类算法在保证分类效果的基础上大大提高了分类效率,较 Hadoop 平台有较好的加速比,可有效地对大数据进行分类处理。
关键词:K-最近邻;词语相关度;Spark;并行化计算