《计算机工程与应用杂志》发表论文赏析

改进MADDPG算法的未知环境下多智能体单目标协同探索

来源:计算机工程与应用杂志2025年第22期北京时间:

作者:韩慧妍, 石树熙, 况立群, 韩燮, 熊风光

单位:1.中北大学 计算机科学与技术学院,太原 030051;2.机器视觉与虚拟现实山西省重点实验室,太原 030051;3.山西省视觉信息处理及智能机器人工程研究中心,太原 030051

摘要:针对多智能体深度确定性策略梯度算法(multi-agent deep deterministic policy gradient,MADDPG)在未知环境下探索效率低下的问题,提出多智能体深度强化学习算法RE-MADDPG-C。利用残差网络(residual network,ResNet)缓解网络中的梯度消失和梯度爆炸问题,提高算法的收敛速度。为解决未知环境下单目标探索中奖励稀疏导致的收敛困难问题,引入多智能体内在好奇心模块(intrinsic curiosity module,ICM),将好奇心奖励作为智能体的内在奖励,为其提供额外的探索动机。通过设计合理的探索奖励函数,使得多智能体能够在未知环境下完成单目标探索任务。仿真实验结果表明,该算法在训练阶段获得的奖励提升更快,能够快速完成探索任务,相比MADDPG及其他算法训练时间缩短,且获得的全局平均奖励更高。

关键词:深度强化学习,RE-MADDPG-C,残差网络,内在好奇心模块(ICM),奖励稀疏

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!