《计算机技术与发展杂志》发表论文赏析
作者:吕相霖;';臧兆祥;';李思博;';王俊英;'
单位:1. 三峡大学 水电工程智能视觉监测湖北省重点实验室,湖北 宜昌 443002;2. 三峡大学 计算机与信息学院,湖北 宜昌 443002
摘要:针对深度强化学习算法在部分可观测环境中面临信息掌握不足、存在随机因素等问题,提出了一种融合注意力机制与循环神经网络的近端策略优化算法( ARPPO 算法) 。 该算法首先通过卷积网络层提取特征;其次采用注意力机制突出状态中重要的关键信息;再次通过 LSTM 网络提取数据的时域特性;最后基于 Actor-Critic 结构的 PPO 算法进行策略学习与训练提升。 基于 Gym-Minigrid 环境设计了两项探索任务的消融与对比实验,实验结果表明 ARPPO 算法较已有的A2C 算法、PPO 算法、RPPO 算法具有更快的收敛速度,且 ARPPO 算法在收敛之后具有很强的稳定性,并对存在随机因素的未知环境具备更强的适应力。
关键词:深度强化学习;部分可观测;注意力机制;LSTM 网络;近端策略优化算法