《计算机技术与发展杂志》发表论文赏析
作者:赵春宇;赖俊*;陈希亮;张人文
摘要:强化学习在游戏对弈、机器人控制等领域内已取得良好成效。 为进一步提高训练效率,将元学习拓展至强化学习中,由此所产生的元强化学习已成为当前强化学习领域中的研究热点。 元知识质量是决定元强化学习效果的关键因素,基于梯度的元强化学习以模型初始参数为元知识指导后续学习。 为提高元知识质量,提出了一种通用元强化学习方法,通过加权机制显式表现训练过程中子任务对训练效果的贡献。 该方法利用不同子任务所得的梯度更新向量与任务集内所有梯度更新向量的相似性作为更新权重,完善梯度更新过程,提高以模型初始参数为元知识的质量,使训练好的模型在一个良好的起点上解决新任务。 该方法可通用在基于梯度的强化学习中,达到使用少量样本快速解决新任务的目标。 在二维导航任务和仿真机器人运动控制任务的对比实验中,该方法优于其他基准算法,证明了加权机制的合理性。
关键词:元学习;强化学习;元强化学习;梯度下降;无模型