《电子与信息学报杂志》发表论文赏析

基于多模态融合Transformer的视听广义零次学习方法

来源:电子与信息学报杂志2025年第7期北京时间:

作者:杨静, 李小勇, 阮小利, 李少波, 唐向红, 徐计

单位:1.贵州大学公共大数据国家重点实验室 贵阳 5500252.上海交通大学计算机科学与工程系 上海 201100

摘要:视听零次学习需要理解音频和视觉信息之间的关系,以便能够推理未见过的类别。尽管领域做出了许多努力并取得了重大进展,但往往专注于学习强大的表征,从而忽视了音频和视频之间的依赖关系和输出分布与目标分布不一致的问题。因此,该文提出了基于Transformer的视听广义零次学习方法。具体来说,使用注意力机制来学习数据的内部信息,增强不同模态的信息交互,以捕捉视听数据之间的语义一致性;为了度量不同概率分布之间的差异和类别之间的一致性,引入了Kullback-Leibler(KL)散度和余弦相似度损失。为了评估所提方法,在VGGSound-GZSLcls, UCF-GZSLcls和ActivityNet-GZSLcls 3个基准数据集上进行测试。大量的实验结果表明,所提方法在3个数据集上都取得了最先进的性能。

关键词:视听零次学习, 视频分类, 注意力机制, KL散度

基金资助:国家自然科学基金(62441608, 62166005),贵州省科技项目基金(QKHZC[2023]368),贵阳市科技人才培养对象及项目基金(ZKHT[2023]48-8),贵州大学基础科研基金([2024]08),公共大数据国家重点实验室开放项目(PBD2023-16)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!