《计算机应用研究杂志》发表论文赏析

基于互信息最大化的意图强化学习方法的研究

来源:计算机应用研究杂志2022年第11期北京时间:

作者:赵婷婷,吴帅,杨梦楠,陈亚瑞,王嫄,杨巨成,

单位:天津科技大学人工智能学院,天津300457;

摘要:强化学习主要研究智能体如何根据环境作出较好的决策,其核心是学习策略。基于传统策略模型的动作选择主要依赖于状态感知、历史记忆及模型参数等,其智能体行为很难受到控制。然而,当人类智能体完成任务时,通常会根据自身的意愿或动机选择相应的行为。受人类决策机制的启发,为了让强化学习中的行为选择可控,使智能体能够根据意图选择动作,将意图变量加入到策略模型中,提出了一种基于意图控制的强化学习策略学习方法。具体地,通过意图变量与动作的互信息最大化使两者产生高相关性,使得策略能够根据给定意图变量选择相关动作,从而达到对智能体的控制。最终,通过复杂的机器人控制仿真任务Mujoco验证了所提方法能够有效地通过意图变量控制机器人的移动速度和移动角度。

关键词:强化学习,互信息,意图控制,近端策略优化算法,

基金资助:国家自然科学基金资助项目(61976156);天津市企业科技特派员项目(20YDTPJC00560);;

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!