《信号处理杂志》发表论文赏析
作者:李恭杨, 史世翔, 李红云
摘要:显著性目标检测是计算机视觉领域的一个重要研究方向,旨在从复杂的背景中提取出人眼最为关注的区域。传统的RGB图像显著性目标检测方法仅依赖于图像的颜色信息,难以应对复杂场景中的多样性和干扰。为此,RGB-D显著性目标检测在传统RGB图像的基础上,额外引入了深度信息,从而能够更好地感知图像的空间结构,进而提高了显著性目标检测的性能。然而现有RGB-D显著性目标检测方法大多基于卷积神经网络或视觉Transformer,主要依靠判别式学习进行显著性目标检测,即通过对像素级显著性概率进行硬分类实现预测,往往存在模型过度自信的问题,这限制了现有方法在复杂场景下的检测性能。为了应对上述问题,本文提出了一种基于扩散模型的注意力驱动RGB-D显著性目标检测方法,利用扩散模型的渐进式加噪和逐步去噪过程,以生成的方式有效优化了预测结果,减少了模型过度自信导致的错误估计风险,提升了网络在复杂场景下的检测性能。首先,本文采用金字塔形视觉Transformer主干分别对RGB图像和深度图进行四个层级的特征提取;随后,通过提出的双流注意力融合模块实现对对应特征层级的两种跨模态特征的充分融合,接着通过渐进式融合模块对四个不同层级的融合后特征进行融合;最后,把它作为条件信息注入到去噪网络中对扩散模型的输出进行条件约束,并生成预测的显著性图。实验结果表明,所提出的方法在DUT、LFSD、NJU2K、NLPR、SIP、SSD和STERE这七个公开基准数据集上的多个指标均优于现有主流方法,证明了本文提出方法的有效性。
关键词:RGB-D图像, 显著性目标检测, 扩散模型, 注意力机制