《计算机工程与应用杂志》发表论文赏析
作者:王珩冰, 周亚同, 杨帆
单位:河北工业大学 电子信息工程学院,天津 300401;
摘要:多智能体近端策略优化(multi-agent proximal policy optimization,MAPPO)在处理动态复杂环境时面临稳定性和效率的挑战。针对以上挑战,设计了一种联合引力机制,提升了任务执行的速度和效率。在联合引力机制的基础上,提出了一种改进的MAPPO算法(DEA-MAPPO)。该算法通过自适应探索机制,动态调整探索幅度以适应无人机的实时表现和环境变化,增强了算法的适应性和稳定性。引入了高斯自适应注意力机制,提高了无人机决策质量、协作效率,增强了系统的可解释性和鲁棒性。通过加入延迟策略更新机制,有效避免了局部最优陷阱,进一步提升了算法性能和稳定性。通过在仿真环境中的实验验证,联合引力机制显著提升了覆盖效率,DEA-MAPPO算法在目标覆盖任务中的表现优于传统的MAPPO算法,在同样的训练回合数下,总奖励值和覆盖率都有了较大的提升,为多无人机在复杂环境中的高效协同执行目标覆盖任务提供了新的解决方案和理论支持。
关键词:多无人机,强化学习,目标覆盖,多智能体近端策略优化,联合引力机制
基金资助:河北工业大学创新研究院(石家庄)石家庄市科技合作专项基金(SJZZXA23005)。