《软件学报杂志》发表论文赏析

提升隐式场景下短语视觉定位的因果建模方法

来源:软件学报杂志2025年第9期北京时间:

作者:赵嘉宁,王晶晶,罗佳敏,周国栋

单位:赵嘉宁,苏州大学 计算机科学与技术学院, 江苏 苏州 21500611,王晶晶,苏州大学 计算机科学与技术学院, 江苏 苏州 21500602,罗佳敏,苏州大学 计算机科学与技术学院, 江苏 苏州 21500603,周国栋,苏州大学 计算机科学与技术学院, 江苏 苏州 21500604

摘要:短语视觉定位是多模态研究中一个基础且重要的研究任务, 旨在预测细粒度的文本短语与图片区域的对齐关系. 尽管已有的短语视觉定位方法已经取得了不错的进展, 但都忽略了文本中的短语与其对应图片区域的隐式对齐关系(即隐式短语-区域对齐关系), 而预测这种关系可以有效评估模型理解深层多模态语义的能力. 因此, 为了有效建模隐式短语-区域对齐关系, 提出一种隐式增强的因果建模短语视觉定位方法. 该方法使用因果推理中的干预策略来缓解浅层语义所带来的混淆信息. 为评估模型理解深层多模态语义的能力, 标注一个高质量的隐式数据集, 并进行大量实验. 多组对比实验结果表明, 所提方法能够有效建模隐式短语-区域对齐关系. 此外, 在这个隐式数据集上, 所提方法的性能优于一些先进的多模态大语言模型, 这将进一步促进多模态大模型更多的面向隐式场景的研究.

关键词:隐式短语-区域对齐关系;因果推理;短语视觉定位

基金资助:国家自然科学基金(62006166, 62076175, 62076176); 江苏高校优势学科建设工程

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!