《计算机工程与应用杂志》发表论文赏析

基于图像特征优化与自监督学习的视觉问答模型

来源:计算机工程与应用杂志2026年第15期北京时间:

作者:蔡谋熙, 孙海春, 张自勖

单位:中国人民公安大学 信息网络安全学院,北京 100038;

摘要:针对当前视觉问答模型存在图像特征理解不足与数据偏差问题,提出一种由双视觉特征编码器、文本编码器、多模态特征融合及多模态特征解码器构成的新视觉问答模型。在问题推理阶段,模型以双视觉编码器提取多粒度特征,解决视觉特征理解不充分的问题。在训练阶段,借助图像掩码重建增强局部特征与全局结构的关联,通过生成高度无关负样本强迫模型学习到图像与问题之间的真实语义关联。两阶段的自监督训练引导模型从“像素级重建”到“语义级对齐”逐步深化特征理解,达到优化图像特征提取质量与抑制偏差的目的。所提模型在VQA-CPv2、VQAv2和OK-VQA数据集上分别达到65.74%、67.50%和61.86%的准确率,优于当前SOTA方法。消融实验和可视化分析也验证了模型各模块的有效性。模型通过合理的架构设计与自监督训练为VQA模型增强泛化能力提供了一种有效方案。

关键词:视觉问答,图像特征优化,自监督训练,偏差抑制

基金资助:中国人民公安大学基本科研业务费(2024JKF02);公安部技术研究计划基金项目(2024JSZ01)。

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!