《计算机应用与软件杂志》发表论文赏析
作者:于效民, 王欣, 吴迪, 刘雪莲
摘要:移动机器人在动态未知复杂环境中进行路径规划时,需要保证机器人的实时性。针对DQN算法在移动机器人路径规划中存在的过估计问题以及收敛速度慢的问题,提出一种C-RD3QN算法(Combination-Residual Dueling Double DQN)。该算法在D3QN算法基础上,将卷积层修改为残差网络结构,使用竞争网络结构中的动作优势函数来估计动作值函数,将状态值函数与奖励值结合,使机器人达到更快的收敛速度。经过仿真实验对比分析,表明C-RD3QN算法能够进行更优的路径规划。
关键词:深度强化学习, 机器人路径规划, 残差网络结构, 奖励值重构