《信号处理杂志》发表论文赏析
作者:胡正平, 王雨露, 张琦明, 许凌峰, 陈代萍
摘要:基于骨骼数据的人体动作识别方法因其能够消除与动作无关的视觉信息来降低训练复杂性越来越受到人们关注,然而大规模骨骼动作数据收集和注释面临挑战,基于骨骼的单样本动作识别旨在仅用单个训练样本识别人体动作,可以使机器人对新颖动作类别积极反应改善人机交互。针对基于卷积神经网络编码器进行人类活动分类数据稀缺问题,考虑将单样本动作识别问题表述为骨骼序列紧凑表示和深度度量学习范式,基于自注意力Transformer机制和空间解耦约束重新审视骨骼动力学图像建模向新颖活动类别传输,提出多维感知-空间解耦单样本人体动作识别模型。首先,将3D骨骼序列坐标映射为紧凑图像表示;其次,基于骨干网络将输入投影到低维特征空间,提取初级动作特征;接着,设计融合多层感知机与Transformer的嵌入编码器,在嵌入空间中捕捉关节时间空间依赖关系,增强模型对时空信息感知能力,得到高层次多维嵌入特征;然后,基于最近邻搜索完成样本间相似性度量;最后,结合多相似性损失、三元组边界损失、交叉熵损失和空间解耦损失的混合深度度量学习优化模型。实验在公共大规模数据集NTU RGB+D 120上进行评估,提出方法较Skeleton-DML提高3.8%,在使用40个训练类别时较Skeleton-DML提高7.5%。研究表明,提出方法能够在数据稀缺情况下充分利用骨骼序列紧凑表示信息,提高单样本动作识别匹配精度。
关键词:动作识别, 单样本学习, 度量学习, Transformer, 空间解耦