《计算机技术与发展杂志》发表论文赏析
作者:朱联祥;牛文煜;仝文东;邵浩杰
单位:西安石油大学 计算机学院,陕西 西安 710065 Author(s): ZHU Lian-xiang;NIU Wen-yu;TONG Wen-dong;SHAO Hao-jie School of Computer Science,Xi’an Shiyou University,Xi’an 710065,China 关键词: 人体动作识别;三维卷积神经网络;全局上下文建模;远程依赖;注意力机制 Keywords: human action recognition; three - dimensional convolutional neural network; global context modeling; long - rangedependence;attention mechanism 分类号: TP391. 41 DOI: 10. 3969 / j. issn. 1673-629X. 2023. 09. 016 摘要: C3D 作为一种典型的三维卷积神经网络被应用于视频动作识别任务。 针对其存在的特征提取不足、易出现过拟合以及识别准确率较低等问题,提出一种融合混合注意力机制的 C3D 三维卷积网络模型。 在原 C3D 网络插入由 GCNet通道注意力模块和 3D-Crisscross 空间注意力模块构建的混合注意力模块,这两种注意力网络具有全局上下文建模操作,能够对三维特征建立远程依赖关系,加强网络对视频特征在通道和空间上的特征提取能力,提高模型的分类性能。 将所提方法在 UCF-101 和 HMDB-51 两个大型视频数据集上进行测试,并与深度学习的其他模型进行比较,结果表明,该方法相对于其他深度学习模型具有相对更高的准确率,在 UCF-101 和 HMDB-51 数据集上的识别准确率可以达到 96. 7%和 63. 3% ,而且与原 C3D 方法相比在效果上有明显提升。
摘要:C3D 作为一种典型的三维卷积神经网络被应用于视频动作识别任务。 针对其存在的特征提取不足、易出现过拟合以及识别准确率较低等问题,提出一种融合混合注意力机制的 C3D 三维卷积网络模型。 在原 C3D 网络插入由 GCNet通道注意力模块和 3D-Crisscross 空间注意力模块构建的混合注意力模块,这两种注意力网络具有全局上下文建模操作,能够对三维特征建立远程依赖关系,加强网络对视频特征在通道和空间上的特征提取能力,提高模型的分类性能。 将所提方法在 UCF-101 和 HMDB-51 两个大型视频数据集上进行测试,并与深度学习的其他模型进行比较,结果表明,该方法相对于其他深度学习模型具有相对更高的准确率,在 UCF-101 和 HMDB-51 数据集上的识别准确率可以达到 96. 7%和 63. 3% ,而且与原 C3D 方法相比在效果上有明显提升。
关键词:人体动作识别;三维卷积神经网络;全局上下文建模;远程依赖;注意力机制