《计算机应用与软件杂志》发表论文赏析

基于以物体为中心表示学习的视频解析

来源:计算机应用与软件杂志2025年第11期北京时间:

作者:高诚敏

摘要:目前以物体为中心的多视角表示学习由于不成熟性,遗留了诸多问题:1)绝大多数模型需要利用昂贵的视角标签学习物体表示;2)目前模型无法很好地重构出被遮挡物体的完整形状。为此,专注于从物体静态、视角变化且无视角标签的视频数据中无监督学习以物体为中心的表示,同时学习不同帧的视角表示。模型基于Transformer学习帧与帧之间的相关性,从而能联合地推断属于不同帧的视角表示;另外为了保持物体表示在不同视角下的一致性,模型使用基于交叉注意力的序列扩展版模块以学习物体的3D表示。该建模增强了两种表示的解耦性,能更好地重构完整形状。在多个专门设计的合成数据集上的实验表明该模型在视频分解、物体遮挡性能方面均优于现有模型。

关键词:生成模型, 机器学习, 以物体为中心的表示

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!