《计算机技术与发展杂志》发表论文赏析

多尺度KAN卷积与跨模态注意力的视听情绪识别

来源:计算机技术与发展杂志2025年第07期北京时间:

作者:罗志鑫;刘知贵;唐荣;潘志祥;李理;

单位:1. 西南科技大学 信息工程学院,四川 绵阳 621000;2. 四川省工业自主可控人工智能工程技术研究中心,四川 绵阳 621000;3. 四川湖山电器股份有限公司,四川 绵阳 621000

摘要:针对现有视听情绪识别方法在特征提取层级别的模态互补性研究不足以及传统的视听情绪识别方法通常难以充分挖掘音频与视频模态之间的互补性等问题,提出了一种基于 Kolmogorov-Arnold Networks(KAN)卷积、多尺度特征提取和跨模态注意力机制的情绪识别模型。 该模型在音视频特征提取过程中引入 KAN 卷积,通过多尺度卷积核捕捉不同层次的情绪特征,KAN 卷积通过可学习的 B 样条函数建模数据中的非线性模式,从而增强了模型对复杂情绪模式的学习能力。为了提升模态间信息的互补性,特征融合阶段采用了跨模态注意力机制。 能够有效地对音视频特征进行加权融合,使得模型能够更好地捕捉音视频模态的交互关系,从而提升情绪识别的性能。 在 RAVDESS 数据集上的实验结果表明,该模型的准确率和 F1 值分别达到了 75. 62% 和 77. 23% ,相较于传统方法取得了显著提升。研究表明,该模型在多模态情绪识别任务中表现出更强的鲁棒性和适应性,为视听情绪识别应用提供了新的有效方案。

关键词:情绪识别;视听融合;跨模态注意力;KAN卷积;多尺度提取

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!