《计算机工程与应用杂志》发表论文赏析
作者:刘莉萍1,章新友1,牛晓录2,郭永坤1,丁 亮1
单位:1.江西中医药大学 计算机学院,南昌 330004;2.江西中医药大学 药学院,南昌 330004
摘要:关联规则挖掘是数据挖掘的一个重要分支,但随着数据的快速增长,传统关联规则挖掘算法不能很好地适应大数据的要求,需要在分布式、并行计算的平台上寻找突破。Spark是专门为大数据处理而设计的一个适合迭代运算的并行计算模型,相比MapReduce具有更高效、充分利用内存、更适合迭代计算和交互式处理的优点。对已有的基于Spark的并行关联规则挖掘算法进行了分类和综述,并总结了各自的优缺点和适用范围,为下一步的研究提供参考。
关键词:Spark,并行,关联规则挖掘,Apriori,FP-Growth