《计算机应用与软件杂志》发表论文赏析
作者:贾路宽, 谢劼欣, 岳校田, 邓飞, 朱德良, 郭士杰
摘要:现有基于深度强化学习(DRL)的机器人轨迹规划方法通常效率低下,且容易陷入局部最优解。为解决上述问题,设计了一种好奇心网络,并基于此提出了策略—估值—好奇心框架(A-C-C),A-C-C使智能体以更接近人类的方式处理问题,更关注探索的过程而不是结果。通过加强对未知区域的探索,A-C-C框架能够有效地提高DRL方法的学习效率并避免局部最优解。实验结果表明,A-C-C框架可以与不同的奖励函数结合,使得探索效率加快43.6%~101.2%,同时可以使得收敛均值提高4.8%~6.4%。
关键词:深度强化学习, 机器人轨迹规划, 优化框架