《软件学报杂志》发表论文赏析
作者:吴信东,嵇圣硙
单位:吴信东,合肥工业大学 计算机与信息学院, 安徽 合肥 230009;School of Computing and Informatics, University of Louisiana at Lafayette, Lafayette 70504, USA11,嵇圣硙,合肥工业大学 计算机与信息学院, 安徽 合肥 23000902
摘要:评述了MapReduce与Spark两种大数据计算算法和架构,从背景、原理以及应用场景进行分析和比较,并对两种算法各自优点以及相应的限制做出了总结.当处理非迭代问题时,MapReduce凭借其自身的任务调度策略和shuffle机制,在中间数据传输数量以及文件数目方面的性能要优于Spark;而在处理迭代问题和一些低延迟问题时,Spark可以根据数据之间的依赖关系对任务进行更合理的划分,相较于MapReduce,有效地减少了中间数据传输数量与同步次数,提高了系统的运行效率.
关键词:大数据;MapReduce;Spark;迭代问题;非迭代问题
基金资助:国家重点研发计划(2016YFB1000901);国家自然科学基金(91746209);教育部创新团队项目(IRT17R3)