《计算机工程与应用杂志》发表论文赏析
作者:陈鸿翔, 邓天奇, 王嘉杰, 刘子源, 刘明烁, 赵国冬
单位:1.哈尔滨工程大学 计算机科学与技术学院,哈尔滨 150001;2.哈尔滨工程大学 机器人仿真协会,哈尔滨 150001;
摘要:随着深度学习与强化学习的进步,AlphaZero在围棋、国际象棋及将棋博弈等领域展现出了卓越的性能。然而,庞大的算力需求成为限制AlphaZero在其他棋类游戏应用的主要瓶颈。考虑到不同棋类对AlphaZero模型中超参数的适应性差异,提出一种DQN-NCD超参数优化方法。该方法使用深度Q学习动态调控AlphaZero在蒙特卡罗树搜索(MCTS)执行时的模拟节点数量,以优化单次MCTS的模拟质量,加快残局阶段的自博弈数据生成。此外,将MCTS叶子深度及其标准差整合到决策模型输入以及奖励参考中,动态调整平衡参数[Cpuct]及噪声参数[α],优化胜利决策。实验结果表明,DQN-NCD AlphaZero的深度神经网络收敛效果优于原网络,MCTS的单次搜索深度加深了22.47%。DQN-NCD AlphaZero与原始AlphaZero在苏拉卡尔塔棋500局残局状态下,平均先手行棋净胜率为69.88%,平均后手行棋净胜率为57.29%,较原模型胜率有所提高。探讨了AlphaZero在残局游戏中的高效取胜策略的新思路。
关键词:AlphaZero,深度Q学习,超参数动态调整,蒙特卡洛树搜索(MCTS)深度,残局优化策略