《计算机应用研究杂志》发表论文赏析
作者:何富君,王晓争,刘凯,
单位:东北石油大学机械科学与工程学院,黑龙江大庆163318;
摘要:针对深度强化学习算法在复杂动态环境中训练时,由于环境的部分可观测性原因导致智能体难以获得有用信息而不能学习到良好策略且算法收敛速度慢等典型问题,提出一种基于LSTM和非对称actor-critic网络的改进DDPG算法。该算法在actor-critic网络结构中引入LSTM结构,通过记忆推理来学习部分可观测马尔可夫状态中的隐藏状态,同时在actor网络只使用RGB图像作为部分可观测输入的情况下,critic网络利用仿真环境的完全状态进行训练构成非对称网络,加快了训练收敛速度。通过在ROS中进行机械臂抓取仿真实验,结果显示该算法相比于DDPG、PPO和LSTM-DDPG算法获得了更高的成功率,同时具有较快的收敛速度。
关键词:深度确定性策略梯度,长短期记忆,非对称actor-critic,深度强化学习,动态环境,
基金资助:国家重点研发计划资助项目(2018YFE0196000);东北石油大学研究生创新科研资助项目(YJSCX2017-022NEPU);;