《计算机测量与控制杂志》发表论文赏析
作者:任红格,向迎帆,李福进,刘伟民
摘要:针对两轮自平衡机器人在学习过程中遇到的主动性差和以往强化学习对单步学习效率低的问题,受心理学中内在动机理论的启发,提出一种基于内在动机的强化学习算法;该算法利用内在动机信号作为内部奖励,模拟人类心理认知机理并与外部信号一起作用于整个学习过程,提高了智能体的自学习能力,同时采用自组织神经网络进行训练,保证了算法的快速性;通过无扰动和有扰动两种仿真实验的对比,验证了基于内在动机的强化学习算法能够使两轮机器人在未知环境下通过自主学习最终达到平衡,且体现了该算法的鲁棒性和可行性。
关键词:内在动机;强化学习;平衡控制;鲁棒性;两轮机器人
基金资助:国家自然科学基金(61203343);河北省自然基金(E2014209106)。