《计算机工程与应用杂志》发表论文赏析
作者:杜方, 高欣宇, 王品语, 武文娟
单位:1.宁夏大学 信息工程学院,银川 750021;2.中国人民大学 信息学院,北京 100872;
摘要:针对遮挡和动态纹理等复杂场景中视频插帧感知质量不足的问题,提出了结合SAM(segment anything model)编码的潜在扩散视频插帧方法SLDVFI(SAM-encoded latent diffusion video frame interpolation)。利用SAM编码器提取语义分割特征,精准识别遮挡区域的边界信息,设计空间上下文融合模块以有效融合高级语义信息和低级视觉信息,增强模型对复杂场景的理解能力,提升插值帧的结构完整性;同时设计基于Transformer的自适应扩散网络,利用全局注意力机制建模长程依赖,在潜在空间中精准重建特征。实验结果表明,SLDVFI在Middlebury、UCF101和SNU-FILM等数据集上均有效提高了感知质量,尤其在SNU-FILM Hard数据集上,LPIPS和FloLPIPS分别为0.054和0.109,明显优于现有方法。在遮挡和动态纹理场景中,SLDVFI生成的中间帧展现了更自然的运动连贯性和纹理真实感。
关键词:视频插帧,扩散模型,SAM模型,注意力机制
基金资助:宁夏重点研发项目(2023BEG02009)。