《计算机应用研究杂志》发表论文赏析
作者:徐康,袁野,付军秀,傅柯婷,任钦泽,刘娜,
单位:上海理工大学机器智能研究院,上海200093;
摘要:提出了一种创新的隐式情绪导向语音驱动方法,用于仿生机器人的面部表情与头部姿态生成。该方法基于深度学习,通过引入颈部舵机控制系数,突破了传统方法仅依赖预编程随机动作序列的局限,实现了音频信号到自然表情的精确映射。此外,提出了一种隐式情绪导向特征融合自编码器框架,无须显式输入情绪参数,即可从音频中隐含地推断情绪特征,并生成丰富的面部表情和颈部运动。实验表明,该方法在多个数据集上显著优于现有技术,并且通过轻量化设计,能够高效适应资源有限的移动设备。
关键词:仿生机器人,音频驱动,情绪导向,卷积长短时记忆网络,
基金资助:国家重点研发计划资助项目(2023YFC3605800);;