《信号处理杂志》发表论文赏析
作者:余亚男, 贾勇, 杜玲丽, 林凡强, 郭世盛
摘要:深度学习技术使得从毫米波雷达捕获的人体散射信号中精确提取人体运动特征并重构三维人体姿态成为可能。然而,目前毫米波雷达人体姿态重构常采用直接将雷达图像映射到三维关节点坐标的单阶段策略,这种跨域层级映射任务使得网络在重构精度、深度信息表达及姿态连贯性上面临挑战。针对这一问题,本文提出了一种基于时空Transformer的多阶段毫米波雷达三维人体姿态重构模型(Spatial-Temporal Pose Reconstruction Transformer, STPRT),通过两阶段策略处理提高重构精度:第一阶段,构建并行多分辨率子网络从水平和垂直雷达图像中提取多尺度的二维关节点信息和空间位置特征并进行融合,随后由全连接层生成二维人体姿态坐标;第二阶段,时空Transformer通过空间注意力模块对每帧中的二维关节坐标进行高维空间特征编码,时间注意力模块捕捉姿态特征在序列帧中的时间演变,增强姿态间的深度感知和空间准确性,实现从二维姿态到三维姿态的映射提升。此外,在训练过程中引入了指数移动平均(Exponential Moving Average, EMA)策略调整梯度下降,从而提升整体映射的精确度和连贯性。在毫米波雷达公开数据集RFSkeleton3D上的验证表明,相比现有的mm-Pose和RPM模型,本模型在减少参数量的同时,将平均关节位置误差降低至7.3 cm。
关键词:毫米波雷达, 姿态重构, 时空Transformer, 层级映射