《计算机工程与应用杂志》发表论文赏析

融合时序建模与风格表达的2D说话人视频生成方法

来源:计算机工程与应用杂志2026年第13期北京时间:

作者:代宽, 朱欣娟

单位:1.西安工程大学 计算机科学学院,西安 710600;2.陕西省服装设计智能化重点实验室,西安 710600;3.新型网络智能信息服务国家地方联合工程研究中心,西安 710048;

摘要:针对音频驱动2D说话人视频中唇音动作不连贯、头部运动突兀以及动漫角色风格表达不足的问题,提出一种融合时序建模与个性化风格表达的方法TccTalk。设计了时序一致性控制模块(temporal consistency controller,TCC),通过LSTM建模帧间动态关系,结合速度与加速度约束实现面部与头部动作的自然过渡;提出个性化风格表达模块(personalized talking style,PTS),从参考视频中提取音频-运动对进行风格编码并引入情感标签作为辅助建模条件,进一步提升对动漫角色风格特征的建模能力。实验结果表明在唇音同步、面部连续性及角色风格还原方面均优于对比基线模型,具备更高的生成质量与泛化能力。

关键词:音频驱动,2D说话人,时序建模,个性化风格表达

基金资助:陕西省重点研发计划项目(2024GX-YBXM-548)。

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!