《计算机应用研究杂志》发表论文赏析

基于多模态融合的城市道路场景视频描述模型研究

来源:计算机应用研究杂志2023年第2期北京时间:

作者:李铭兴,徐成,李学伟,刘宏哲,闫晨阳,廖文森,

单位:北京联合大学a.北京市信息服务工程重点实验室;b.脑与认知智能北京实验室,北京100101;

摘要:城市道路视频描述存在仅考虑视觉信息而忽视了同样重要的音频信息的问题,多模态融合算法是解决此问题的方案之一。针对现有基于Transformer的多模态融合算法都存在着模态之间融合性能低、计算复杂度高的问题,为了提高多模态信息之间的交互性,提出了一种新的基于Transformer的视频描述模型多模态注意力瓶颈视频描述(multimodal attention bottleneck for video captioning,MABVC)。首先使用预训练好的I3D和VGGish网络提取视频的视觉和音频特征并将提取好的特征输入到Transformer模型当中,然后解码器部分分别训练两个模态的信息再进行多模态的融合,最后将解码器输出的结果经过处理生成人们可以理解的文本描述。在通用数据集MSR-VTT、MSVD和自建数据集BUUISE上进行对比实验,通过评价指标对模型进行验证。实验结果表明,基于多模态注意力融合的视频描述模型在各个指标上都有明显提升。该模型在交通场景数据集上依旧能够取得良好的效果,在智能驾驶行业具有很大的应用前景。

关键词:视频描述,多模态融合,注意力机制,智能驾驶,

基金资助:国家自然科学基金资助项目(62171042,62102033,61906017,61802019);北京市重点科技项目(KZ202211417048);协同创新中心资助项目(CYXC2203);北京联合大学学术研究项目(BPHR2020DZ02,ZB10202003,ZK40202101,ZK120202104);;

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!