《计算机应用杂志》发表论文赏析
作者:廖彬, 张陶, 国冰磊, 于炯, 张旭光, 刘炎
单位:1. 新疆财经大学 统计与信息学院, 乌鲁木齐 830012;2. 新疆医科大学 医学工程技术学院, 乌鲁木齐 830011;3. 新疆大学 信息科学与工程学院, 乌鲁木齐 830008;4. 清华大学 软件学院, 北京 100084
摘要:MapReduce计算场景下,复杂的大数据挖掘类算法通常需要多个MapReduce作业协作完成,但多个作业之间严重的冗余磁盘读写及重复的资源申请操作,使得算法的性能严重降低。为提高ItemBased推荐算法的计算效率,首先对MapReduce平台下ItemBased协同过滤算法存在的性能问题进行了分析;在此基础上利用Spark迭代计算及内存计算上的优势提高算法的执行效率,并实现了基于Spark平台的ItemBased推荐算法。实验结果表明:当集群节点规模分别为10与20时,算法在Spark中的运行时间分别只有MapReduce中的25.6%及30.8%,Spark平台下的算法相比MapReduce平台,执行效率整体提高3倍以上。
关键词:协同过滤,MapReduce,Spark算法,性能优化,有向非循环图
基金资助:国家自然科学基金资助项目(61562078,61262088);新疆维吾尔自治区自然科学基金资助项目(2016D01B014)。