《上海理工大学学报杂志》发表论文赏析
作者:赵亚飞,杨耀功,王永刚,魏继增
单位:天津大学 智能与计算学部,天津 300354,飞腾信息技术有限公司,天津 300459,飞腾信息技术有限公司,天津 300459,天津大学 智能与计算学部,天津 300354
摘要:为解决卷积神经网络难以在计算资源受限设备上部署的问题,面向国产FT-2000/4多核处理器提出一种高性能的快速卷积算法FastInfer。采用分块策略优化通用矩阵乘法,将处理器访问频率高的数据存入更靠近处理器的缓存中,从而提高计算过程中的访存效率。配合分块方案设计实现高性能的矩阵乘法微内核,使用向量外积运算更新数据,提高计算访存比,实现最大程度掩盖访存指令的延迟。最终实验结果表明,FastInfer在FT-2000/4处理器上的峰值计算性能达到99.56 GFLOPS。在不同输入规模的通用矩阵乘法测试中,FastInfer性能是OpenBLAS算法的1.07倍和1.52倍。在卷积测试中,FastInfer性能是ARM Compute Library算法的1.32倍,实现了在FT-2000/4多核处理器上的高性能卷积计算。
关键词:深度学习;快速卷积算法;并行计算;通用矩阵乘法
基金资助:国家自然科学基金资助项目(61402321);天津市自然科学基金资助项目(23JCYBJC01770);2024年第一批天津市制造业高质量发展专项资金资助项目(24ZGNGX00020)