《计算机工程与应用杂志》发表论文赏析
作者:王智文, 卢玉梅, 张海鹏, 庞煜丽
单位:1.广西科技大学 电子工程学院,广西 柳州 545006;2.广西科技大学 计算机科学与技术学院(软件学院),广西 柳州 545006
摘要:深度强化学习可以利用大序列模型自身的优势,来解决多交叉口交通信号协同控制问题,为此,提出了多智能体序列决策的多交叉口交通信号协同控制方法。根据多智能体优势分解定理,利用序列模型的特性将多交叉口交通信号控制建模为序列问题,将实时的多交叉口交通信号控制转变成一个多智能体序列决策问题,充分利用了多智能体强化学习决策过程与序列模型预测之间惊人的联系。使用小样本Transformer序列模型来在线学习每个智能体的最优控制策略,实现多交叉口交通信号协同控制,解决了集中训练分散执行的训练模式很难覆盖多智能体交互的全部复杂性,随着智能体数量不断增多,导致最优联合值函数求解更复杂等问题。实验结果表明,所提出的方法可以显著提高交通信号控制算法的性能并降低其实现的复杂性。
关键词:多智能体优势分解,序列决策,多交叉口,协同控制,强化学习