《计算机工程与应用杂志》发表论文赏析
作者:施伟, 黄红蓝, 梁星星, 程光权, 郑臻哲
单位:1.国防科技大学 系统工程学院 大数据与决策实验室,长沙 410073;2.火箭军工程大学 核工程学院,西安 710025;3.上海交通大学 电子信息与电气工程学院,上海 200240
摘要:随着军事智能化技术演进,兵棋推演智能决策研究备受关注。针对传统云端集中式决策模式存在的通信延迟、数据安全风险和部署壁垒等问题,提出端云协同混合离在线强化学习框架(Decider),实现基于先验知识与试错数据的融合驱动决策。云端动态筛选高价值样本传输至边缘设备,缓解数据分布偏移问题,加速策略搜索;引入历史动量聚合算法,稳定模型训练。在海空对抗兵棋实验中,Decider策略搜索速度提升超过90%,平均对抗得分提高26%以上,且通信负载降至传统架构的9.5%。
关键词:端云协同,强化学习,离在线强化学习,兵棋推演,智能决策