《计算机集成制造系统杂志》发表论文赏析
作者:李甜甜, 陈德胜, 曹斌
单位:浙江工业大学计算机科学与技术学院(软件学院)
摘要:针对传统调度方法求解效果差、效率低、轮休约束表达不准确的问题,首次提出一种基于强化学习的人员轮休调度方法。该方法将轮休调度过程构建为Markov决策过程,利用动作掩码方法实现轮休约束,通过深度Q网络(DQN)方法对轮休调度的策略进行学习。最后,采用学习得到的调度策略对人员进行快速安排。实验表明,在遵守轮休约束的前提下,该方法能够快速给出匹配每日人力需求的人员安排。对比传统的基于遗传的方法,该方法在人力需求拟合上的安排偏差更小,求解效率更高。
关键词:轮休调度,强化学习,Markov决策过程,深度Q网络,动作掩码
基金资助:浙江省自然科学基金资助项目(LQ21F020019);浙江省重点研发计划资助项目(2022C01145)。