《计算机科学与探索杂志》发表论文赏析

解决深度探索问题的贝叶斯深度强化学习算法

来源:计算机科学与探索杂志2020年第2期北京时间:

作者:杨珉,汪洁

单位:中南大学 信息科学与工程学院,长沙 410083

摘要:在强化学习领域,如何平衡探索与利用之间的关系是一个难题。近几年提出的强化学习方法主要关注如何结合深度学习技术来提高算法的泛化能力,却忽略探索利用困境这一问题。传统的强化学习方法可以有效解决探索问题,但存在着一定的限制条件:马尔可夫决策过程的状态空间必须是离散并有限的。提出通过贝叶斯方法来提高深度强化算法的探索效率,并将贝叶斯线性回归中计算参数后验分布的方法扩展到人工神经网络等非线性模型中,通过结合Bootstrapped DQN和提出的计算方法得到了贝叶斯自举深度Q网络算法(BBDQN)。最后用两个环境下的实验表明了BBDQN在面对深度探索问题时的探索效率要优于DQN以及Bootstrapped DQN。

关键词:深度强化学习,探索与利用,贝叶斯定理

获取完整文献 了解学术指导

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!