《电子与信息学报杂志》发表论文赏析
作者:李晨溪, 曹雷, 陈希亮, 张永亮, 徐志雄, 彭辉, 段理文
单位:1.(解放军理工大学指挥信息系统学院 南京 210007)2.(浙江大学机械工程学院 杭州 310027)
摘要:强化学习通过与环境的交互学得任务的决策策略,具有自学习与在线学习的特点。但交互试错的机制也往往导致了算法的运行效率较低、收敛速度较慢。知识包含了人类经验和对事物的认知规律,利用知识引导智能体(agent)的学习,是解决上述问题的一种有效方法。该文尝试将定性规则知识引入到强化学习中,通过云推理模型对定性规则进行表示,将其作为探索策略引导智能体的动作选择,以减少智能体在状态-动作空间探索的盲目性。该文选用OpenAI Gym作为测试环境,通过在自定义的CartPole-v2中的实验,验证了提出的基于云推理模型探索策略的有效性,可以提高强化学习的学习效率,加快收敛速度。
关键词:云推理, 深度强化学习, 知识, 探索策略
基金资助:中电集团重点预研基金(6141B08010101),中国博士后科学基金(2015T81081, 2016M602974),江苏省自然科学青年基金(BK20140075)