《计算机技术与发展杂志》发表论文赏析
作者:李星;李涛
摘要:推荐系统是数据挖掘的一个重要部分,能够实现海量数据信息的快速、全面、准确过滤。 然而基于以往传统单个主机模式实现的推荐算法其计算过程耗费的时间过长,已经不能满足当前商业时代快速可靠的技术追求。 大数据平台Spark 分布式计算框架通过引入 RDD(弹性分布式数据集)的概念以及基于内存的运算模式,能够更好地适应大数据挖掘这一应用场景。 推荐算法在实现过程中存在多次迭代计算,Spark 计算框架的使用可以极大提升推荐系统的运算效率。文中利用 Spark 平台设计了一个基于物品的协同过滤(Item-CF)算法的商品推荐系统,并将其应用在 MovieLens 数据集上运行测试。 实验结果表明,该系统能够提高推荐精确度并降低运算时间。
关键词:大数据;Spark 平台;推荐系统;协同过滤(CF);数据挖掘