《信号处理杂志》发表论文赏析
作者:史宝坤, 章宏亮, 田子安, 马伟, 米庆, 毋立芳
摘要:视觉里程计通过分析图像序列,估计每一帧对应的相机位姿,该项技术在机器人自主导航、自动驾驶系统及增强现实等场景中发挥着重要作用。自监督视觉里程计因其无需依赖位姿真值数据而成为当前研究热点,通过几何一致性原理实现跨视角图像合成与自监督损失构建,有效优化位姿和深度估计过程。在自监督视觉里程计框架下,如何设计网络结构以充分挖掘RGB图像和深度图双模态中蕴含的位姿相关线索是提升模型性能的关键。然而,现有算法对于两种模态的异质特性和互补价值考虑欠缺,导致双线索挖掘不充分,进而影响位姿估计精度。针对这一关键问题,本文提出RGB-D双模态互引导的自监督视觉里程计(Self-supervised Visual Odometry with RGB-D Bimodal Mutual Guidance, BMG-VO)。具体而言,设计RGB引导的深度细节增强模块,通过RGB图像的纹理先验增强深度编码分支的细节信息表达能力,使深度特征能有效捕获边缘、纹理等关键细节,从而提升特征匹配鲁棒性;同时,引入深度引导的RGB语义增强模块,利用深度图的几何信息为RGB编码分支补充类内一致性线索,提升其对抗光照污染等干扰的鲁棒性,为位姿回归提供更可靠的匹配依据。此外,设计单模态过滤模块,以突出单一模态中的位姿估计关键线索。在KITTI数据集上的丰富实验结果表明,与现有主流自监督视觉里程计方法相比,BMG-VO的位姿估计准确度更高,深度估计精度也达到了优异水平。
关键词:视觉里程计, 自监督学习, RGB-D双模态互引导, 同步定位与地图构建