《计算机技术与发展杂志》发表论文赏析

一种改进强化学习算法的路径规划方法

来源:计算机技术与发展杂志2025年第02期北京时间:

作者:陈松;沈苏彬

单位:1. 南京邮电大学 计算机学院,江苏 南京 210023;2. 南京邮电大学 通信与网络技术国家工程研究中心,江苏 南京 210003

摘要:提升 Q 学习(Q-learning)算法在复杂环境中的数据效率与决策准确度,无疑是算法性能优化所面临的关键挑战。将因果模型引入 Q 学习算法,通过揭示变量间的因果关系,从而提高 Q 学习算法的性能是新兴且热门的研究方向。 该文提出一种基于因果模型的 Q 学习算法,C-Q 学习(Causal-model based Q-learning)算法。 该算法包括基于智能体利用 Q学习算法与环境交互过程中关键变量之间的因果关系,构建结构因果模型;采用因果推断理论中的后门调整的方法去除模型中影响奖励的混淆因子所引起的混淆效应,评估了更为准确的 Q 值,并且精准识别出每个状态下可能获得最高奖励的动作,优化 Q 学习算法的动作选择过程。 最后,将 Q 学习算法、Eva-Q 学习算法、C-Q 学习算法在栅格环境中进行仿真实验。 仿真实验结果表明,C-Q 学习算法在路径长度、规划时间、数据效率和决策准确度等多个指标上均优于其余两种算法。

关键词:Q学习算法;因果模型;因果推断;混淆因子;后门调整

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!