《吉林大学学报·理学版杂志》发表论文赏析

基于渐近式k-means聚类的多行动者确定性策略梯度算法

来源:吉林大学学报·理学版杂志2025年第3期北京时间:

作者:刘全, 刘晓松, 吴光军, 刘禹含

单位:1. 喀什大学 计算机科学与技术学院, 新疆 喀什 844000; 2. 苏州大学 计算机科学与技术学院, 江苏 苏州 215008; 3. 西交利物浦大学 未来教育学院, 江苏 苏州 215000

摘要:针对深度确定性策略梯度(deep deterministic policy gradient, DDPG)算法在一些大状态空间任务中存在学习效果不佳及波动较大等问题, 提出一种基于渐近式k-means聚类算法的多行动者深度确定性策略梯度(multi-actor deep deterministic policy gradient based on progressive k-means clustering, MDDPG-PK-Means)算法. 在训练过程中, 对每一时间步下的状态进行动作选择时, 根据k-means算法判别结果辅佐行动者网络的决策, 同时随训练时间步的增加, 逐渐增加k-means算法类簇中心的个数. 将MDDPG-PK-Means算法应用于MuJoCo仿真平台上, 实验结果表明, 与DDPG等算法相比, MDDPG-PK-Means算法在大多数连续任务中都具有更好的效果.

关键词:深度强化学习,确定性策略梯度算法,k-means聚类,多行动者

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!