《计算机技术与发展杂志》发表论文赏析

基于多模态融合的无监督视频摘要算法研究

来源:计算机技术与发展杂志2024年第11期北京时间:

作者:潘涛;陈虎;黄菊;吴长柯;邓彪;吴志红;

摘要:视频摘要生成算法通过选择视频内容中信息最丰富的部分来构建形成简洁而完整的概要,有利于快速了解视频内容并压缩存储空间。 针对现有视频摘要方法存在的视频多模态信息利用不充分、特征表达能力弱等难题,该文提出了一种基于多模态融合及多尺度时序信息的无监督视频摘要生成算法。 首先,基于视频图像、音频、文本特征,提出了一种两阶段特征融合模块,充分保留了模态间的非冗余信息,提升单帧特征表示能力;其次,采用自注意力和特征金字塔网络对融合特征进行全局及局部的依赖建模;最后,根据多尺度的上下文信息选择关键帧最终构成高质量的视频摘要。 实验结果表明,与其他无监督视频摘要算法相比,该算法在 SumMe 数据集规范设置及增强设置中 F-Score 分别提升了 0. 5 百分点和 1. 4 百分点,在 TVSum 数据集上达到最佳 F-Score。

关键词:无监督视频摘要;多模态融合;自注意力网络;特征金字塔网络;特征编码

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!