《计算机应用研究杂志》发表论文赏析

基于模态敏感注意力机制的多模态对话模型及应用

来源:计算机应用研究杂志2025年第9期北京时间:

作者:杜维,朱晓瑛,许方敏,郑建生,朱福喜,龚鸣敏,李紫玉,

单位:1.武汉学院信息工程学院,武汉430212;2.北京邮电大学a.网络空间安全学院;b.信息与通信工程学院,北京100876;3.武汉大学电子信息学院,武汉430072;

摘要:多模态对话系统采用Transformer、交叉注意力机制和预训练模型等方式融合不同粒度的文本、语音和视频模态,提取出跨模态特征,然而现有研究忽略了不同模态特征对分类任务的敏感差异性,造成过度融合及带来的信息冗余。针对多模态融合的顺序特征对分类结果的影响,提出了基于模态敏感注意力机制的多模态对话模型MDM-MSAM,分为主从模态筛选、双模态跨模态融合和三模态跨模态融合三部分,通过确定主从模态并提取跨双模态特征,与三模态融合特征再融合,形成模态敏感的层次化跨多模态特征。在MintRec和CMU-MOSI数据集上的分类准确率分别比目前性能最好的模型提升了3.15%和3.5%。MDM-MSAM模型部署应用在流程引擎式的多轮对话系统中,取得了良好的应用效果。

关键词:多模态对话系统,跨模态特征,敏感差异性,模态敏感注意力机制,主从模态,

基金资助:国家自然科学基金资助项目(42374013);北京市自然科学基金资助项目(L234080);武汉学院科研基金年度计划资助项目(JJA202304);中国高校产学研创新基金—腾讯科技创新教育专项资助项目(2022TX007);;

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!