《计算机工程与应用杂志》发表论文赏析
作者:李晓益, 胡滨, 秦进, 彭安浪
单位:1.贵州大学 计算机科学与技术学院 公共大数据国家重点实验室,贵阳 550025 ;2.贵州大学 计算机科学与技术学院,贵阳 550025;3.贵州兆信数码技术有限公司,贵阳 550025
摘要:最近提出的进化强化学习(evolutionary reinforcement learning,ERL)框架表明了利用进化算法提高强化学习的探索能力对性能提升的好处。然而,现有的基于ERL的方法并没有完全解决进化算法中突变的可伸缩性问题且由于进化算法本身的限制使得ERL解决问题的速度较为缓慢。为了使算法每一步的探索都被限制在安全区域中且能在较短的时间内收敛,运用元学习的思想,预训练一个初始的种群,这个种群只需要经过几次进化就能得到任务中不错的效果。将预训练过后的种群用于处理任务,在此过程中,利用敏感度调整种群突变的范围,限制种群在安全区域内进行突变,确保种群的突变不会带来无法预料的后果。该方法在来自OpenAI gym中的五种机器人运动中进行了评估。最终在所有测试的环境中,该方法在以ERL、CEM-RL以及两种最先进的RL算法、PPO和TD3为基线的比较中,取得了具有竞争性的效果。
关键词:进化强化学习,元学习,预训练,安全区域,突变算子