《计算机技术与发展杂志》发表论文赏析
作者:代子鑫;翟双姣;秦品乐;晋赞霞;曾建潮
摘要:射频和视频信号融合能够充分利用两者的互补特性,以提升模型的环境感知能力与识别准确性。 针对现有多模态融合方法难以有效解决模态间数据的异构性及复杂场景活动识别泛化性能不足的问题,提出了一种基于对比学习和扩散模型的多模态数据融合活动识别算法。 首先,去除射频数据和视频数据中的环境噪声,并通过对比学习方法建立两种模态间的映射关系,使得这两种模态的数据能够在统一的特征空间内融合,以缓解模态间数据的异构性问题。 然后,针对现有的多模态融合方法在复杂场景下泛化性能不足的问题,利用扩散模型生成高质量的射频数据,以增强射频信号的空间特征表达能力。 同时,采用视频几何变换的方法增加视频数据的多样性,进一步提升模型的鲁棒性和在复杂场景下的泛化能力。 最后,结合融合特征和增强后的多模态数据,充分利用对比学习和扩散模型在多模态活动识别中的优势,进一步提高模型的识别准确率。 实验结果表明,该算法在自建的多模态数据集和公开的 MM-Fi 数据集上的活动识别准确率均超过 90% ,优于现有的多模态融合算法。
关键词:活动识别;对比学习;扩散模型;射频;视频;多模态融合