《南京信息工程大学学报·自然科学版杂志》发表论文赏析
作者:汪晨曦,赵学艳,郭新
单位:汪晨曦,华南理工大学 自动化科学与工程学院, 广州, 510641,赵学艳,华南理工大学 自动化科学与工程学院, 广州, 510641,auxyzhao@scut.edu.cn郭新,广东交通职业技术学院, 机电工程学院, 广州, 510650
摘要:在深度强化学习中,深度Q网络算法存在严重高估动作值问题,使得智能体的表现不尽人意.尽管深度双Q网络和竞争网络结构可以部分缓解高估带来的影响,但引入双Q网络的同时,有时也会低估动作值.本文提出了一种基于权重值的竞争深度双Q网络算法(Weighted Dueling Double Deep Q-Network,WD3QN),把改进的双估计器及竞争网络结构结合至深度Q网络中,将学习到的可能动作值进行加权产生最终动作值,有效减少估计误差.最后,将算法应用于Open AI Gym平台上的CartPole经典控制问题,仿真结果显示:与已有算法对比,本算法有更好的学习效果,收敛性和训练速度均有提升.
关键词:深度强化学习;深度双Q网络;竞争网络结构;权重值
基金资助:国家自然科学基金(61873099,62073144);广东省自然科学基金(2020A1515010441);广州市科技计划(202002030158,202002030389);广东省青年创新人才项目(2018GkQNCX005)