《计算机应用与软件杂志》发表论文赏析
作者:王泽远
摘要:针对现有并行任务调度算法大多未考虑环境的不稳定性以及缺少通用性、实时性等问题,提出一种基于强化学习的并行任务实时调度方法。将任务调度建模为一个马尔可夫决策过程,通过智能体与环境的交互,使用近端策略优化方法。其中,使用仿真方法来构造奖励函数,并通过降噪自编码器为优势估计函数添加经验项,使得智能体能够学习到高效且可靠的调度策略。两个场景下的仿真对比实验结果表明,采用该方法比现有方法提升时间利用率超过17%,提高产出超过16%,能够在毫秒级时间内实时调度。
关键词:强化学习, 并行任务, 实时调度, 仿真, 降噪自编码器