《计算机工程与应用杂志》发表论文赏析

面向轨迹规划的深度强化学习奖励函数设计

来源:计算机工程与应用杂志2020年第2期北京时间:

作者:李跃,邵振洲,赵振东,施智平,关永

单位:1.首都师范大学 信息工程学院,北京 100048;2.首都师范大学 轻型工业机械臂与安全验证北京市重点实验室,北京 100048;3.首都师范大学 成像技术北京市高精尖创新中心,北京 100048

摘要:现有基于深度强化学习的机械臂轨迹规划方法在未知环境中学习效率偏低,规划策略鲁棒性差。为了解决上述问题,提出了一种基于新型方位奖励函数的机械臂轨迹规划方法A-DPPO,基于相对方向和相对位置设计了一种新型方位奖励函数,通过降低无效探索,提高学习效率。将分布式近似策略优化(DPPO)首次用于机械臂轨迹规划,提高了规划策略的鲁棒性。实验证明相比现有方法,A-DPPO有效地提升了学习效率和规划策略的鲁棒性。

关键词:深度强化学习,机械臂,轨迹规划,方位奖励函数

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!