《计算机技术与发展杂志》发表论文赏析

基于注意力掩码视频蒸馏的动作识别

来源:计算机技术与发展杂志2025年第08期北京时间:

作者:陈凯*;党存远;蔡子当;夏雨涵;孙永宣

摘要:在动作识别任务中,时空关系的提取是关键。 而掩码建模是一种视频表示学习方法,它通过将输入数据的一部分掩码,并迫使模型基于未掩码部分预测掩码部分来提高模型的时空建模能力,从而提高模型在动作识别等视频理解下游任务上的性能。 然而,现有掩码建模方法通常使用高掩码率在单个视频帧内随机掩码,并沿时间维度扩展到其他帧。 在动作识别的一些与场景信息高度相关的数据集上,这种掩码方式可能使得剩余的小部分未掩码内容只包含无关的背景信息,这些无关背景信息无法为模型预测掩码部分提供足够的空间线索,阻碍了模型的掩码建模。 针对这个问题,该文提出注意力掩码方法:通过使用预训练的编码器对原始视频帧进行注意力得分计算,以区分包含丰富语义信息的部分和包含无关背景信息的部分。 即便在高掩码率作用下,通过将背景部分掩码,剩余的包含丰富语义信息的部分也能够为预测掩码部分提供足够的空间线索,从而提高模型的空间信息提取能力。 在知识蒸馏方面,一些方法使用一个或多个单独的教师来蒸馏学生模型,而该文通过将多个教师的输出进行集成构造了一个更为“强大”的教师,并用其指导学生模型预测掩码部分。 实验结果显示,与以前使用随机掩码和单独教师的方法相比,使用注意力掩码和集成教师对 vit-small 进行预训练,可以有效提高其在动作识别下游数据集上的分类准确率。 一些消融实验还表明,使用注意力掩码策略在依赖场景关系的数据集上得到了更好的效果。

关键词:注意力掩码;视频表示学习;知识蒸馏;集成教师;动作识别

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!