《软件学报杂志》发表论文赏析

面向国产申威26010众核处理器的SpMV实现与优化

来源:软件学报杂志2018年第12期北京时间:

作者:刘芳芳,杨超,袁欣辉,吴长茂,敖玉龙

单位:刘芳芳,中国科学院 软件研究所 并行软件与计算科学实验室, 北京 100190;中国科学院大学, 北京 10004911,杨超,中国科学院 软件研究所 并行软件与计算科学实验室, 北京 100190;计算机科学国家重点实验室(中国科学院 软件研究所), 北京 100190;北京大学 数学科学学院, 北京 10087102,袁欣辉,国家并行计算机工程技术研究中心, 北京 10019003,吴长茂,中国科学院 软件研究所 并行软件与计算科学实验室, 北京 10019004,敖玉龙,中国科学院 软件研究所 并行软件与计算科学实验室, 北京 100190;中国科学院大学, 北京 100049;北京大学 数学科学学院, 北京 10087105

摘要:世界首台峰值性能超过100P的超级计算机——神威太湖之光已经研制完成,该超级计算机采用了国产申威异构众核处理器,该处理器不同于现有的纯CPU,CPU-MIC,CPU-GPU架构,采用了主-从核架构,单处理器峰值计算能力为3TFlops/s,访存带宽为130GB/s.稀疏矩阵向量乘SpMV(sparse matrix-vector multiplication)是科学与工程计算中的一个非常重要的核心函数,众所周知,其是带宽受限型的,且存在间接访存操作.国产申威处理器给稀疏矩阵向量乘的高效实现带来了很大的挑战.针对申威处理器提出了一种CSR格式SpMV操作的通用异构众核并行算法,该算法从任务划分、LDM空间划分方面进行精细设计,提出了一套动静态buffer的缓存机制以提升向量x的访存命中率,提出了一套动静态的任务调度方法以实现负载均衡.另外还分析了该算法中影响SpMV性能的几个关键因素,并开展了自适应优化,进一步提升了性能.采用Matrix Market矩阵集中具有代表性的16个稀疏矩阵进行了测试,相比主核版最高有10倍左右的加速,平均加速比为6.51.通过采用主核版CSR格式SpMV的访存量进行分析,测试矩阵最高可达该处理器实测带宽的86%,平均可达到47%.

关键词:稀疏矩阵向量乘;SpMV;申威26010处理器;异构众核并行;自适应优化

基金资助:国家重点研发计划(2016YFB0200603);国家自然科学基金(91530323)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!