《计算机集成制造系统杂志》发表论文赏析
作者:李硕, 赵永廷, 何盼, 高鹏, 王小军, 赵立军, 郑彬
单位:1.中国科学院重庆绿色智能技术研究院2.重庆邮电大学计算机科学与技术学院3.中科万勋智能科技(苏州)有限公司4.重庆文理学院智能制造工程学院5.人工智能与服务机器人控制技术重庆市重点实验室
摘要:针对多智能体在网格环境下的寻路与避障规划问题,提出一种分布式、基于深度强化学习的多机器人避障导航方法。该方法基于最近策略优化算法(PPO)用于离散决策下的改进方法进行训练得到的策略模型,该模型通过每个智能体自身的前序多帧仿真激光雷达距离信息,生成符合预设规范的动作,实现多机器人系统在不同环境中的寻路避障。该模型在训练过程中通过引入密度奖励、距离奖励以及步长惩罚,提高了智能体在场景当中的避障寻路能力,减轻了拥塞、死锁等问题的发生,减少了无效路径生成。实验部分在仿真环境中对模型在随机场景、复杂交互场景、障碍场景多个场景进行实验,证明了该模型相比于集中式规划方法大大降低了规划时间,提高了泛化性和稳定性。通过与其他分布式方法相比,证明了所提到的密度、距离奖励设置对智能体安全快速完成任务具有良好作用,在规划效果上减小了与集中式规划方式的差距。
关键词:多智能体,深度强化学习,网格工作空间,寻路避撞
基金资助:重庆市自然科学基金面上资助项目(cstc2019jcyj-msxmX0442);重庆市技术创新与应用示范专项重点示范资助项目(cstc2018jszx-cyzdX0068);重庆市技术创新与应用发展专项重点资助项目(cstc2021jscx-gksbX0003,cstc2021jscx-gksbX0020)。