《电子与信息学报杂志》发表论文赏析
作者:才华, 冉越, 付强, 李军龑, 张晨洁, 孙俊喜
单位:1.长春理工大学电子信息工程学院 长春 1300222.长春理工大学空间光电技术研究所 长春 1300223.东北师范大学信息科学与技术学院 长春 130117
摘要:现有视觉定位方法在文本引导目标定位和特征融合方面存在显著不足,主要表现为未能充分利用文本信息,并且整体性能过于依赖特征提取后的融合过程。针对这一问题,该文提出一种多粒度文本感知分层特征交互的视觉定位方法。该方法在图像分支中引入分层特征交互模块,利用文本信息增强与文本相关的图像特征;多粒度文本感知模块深入挖掘文本语义内容,生成具有空间和语义增强的加权文本。在此基础上,采用基于哈达玛积的初步融合策略融合加权文本和图像,为跨模态特征融合提供更为精细的图像表示。利用Transformer编码器进行跨模态特征融合,通过多层感知机回归定位坐标。实验结果表明,该文方法在5个经典视觉定位数据集上均取得了显著的精度提升,成功解决了传统方法过度依赖特征融合模块而导致的性能瓶颈问题。
关键词:视觉定位, 多粒度, 文本感知, 分层特征交互, 自适应文本加权, 哈达玛积
基金资助:国家自然科学基金重大项目(61890963),国家自然基金联合基金(U2341226),吉林省科技厅(20240302089GX)