《计算机技术与发展杂志》发表论文赏析

基于Spark 的密度聚类算法并行化研究

来源:计算机技术与发展杂志2018年第06期北京时间:

作者:朱子龙;李玲娟

摘要:聚类分析目前是数据挖掘研究领域中热门的研究课题,DBSCAN 算法则是聚类分析中较为重要的一种基于密度的算法。 Apache Spark 扩展了广泛使用的 MapReduce 计算模型,提出了基于内存的并行计算框架。 通过将中间结果缓存在内存中减少 I/ O 磁盘操作,使其能够更高效地支持交互式查询、迭代式计算等多种计算模式。 为了更好地进行大数据聚类挖掘,研究如何对基于当今主流的大数据处理框架 Spark 对 DBSCAN 算法进行并行化。 设计了基于 Spark 的 DBSCAN算法并行化方案,通过合理利用 RDD 和设计 Sample 算子、map 函数、collectAsMap 算子、reduceByKey 算子,实现了对寻找核心对象的密度可达数据点过程的并行化。 在 Spark 平台上运用 DBSCAN 算法对 UCI 的 Wine 数据集、Car Evaluation 数据集和 Adult 数据集的并行化聚类结果表明,并行化的 DBSCAN 算法具有较好的准确性和时效性,适用于大数据聚类。

关键词:DBSCAN;聚类;Spark;并行化

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!