《计算机工程杂志》发表论文赏析

非参数化近似策略迭代并行强化学习算法

来源:计算机工程杂志2018年第11期北京时间:

作者:季挺,张华

单位:南昌大学 江西省机器人与焊接自动化重点实验室,南昌 330031

摘要:针对在线近似策略迭代强化学习算法收敛速度较慢的问题,提出一种非参数化近似策略迭代并行强化学习算法。通过学习单元构建样本采集过程确定并行单元数量,基于径向基函数线性逼近结构设计强化学习单元,然后采用以样本空间完全覆盖为目标的估计方法实现单元自主构建,并基于近似策略迭代进行单元自主学习。其中,各单元通过平均加权法融合得到算法的整体策略。一级倒立摆仿真结果表明,与online LSPI算法和BLSPI算法相比,该算法在保持较高加速比的同时具有较高的效率,其控制参数更少,收敛速度更快。

关键词:并行强化学习,非参数化,策略迭代,K均值聚类,倒立摆

基金资助:国家高技术研究发展计划(SS2013AA041003)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!