《计算机工程与应用杂志》发表论文赏析
作者:罗宗浩, 赵文杰, 林煜
单位:浙江大学 航空航天学院,杭州 310027;
摘要:无人机空战任务具有任务多样且奖励稀疏的特点,传统强化学习难以在跨任务场景中快速泛化。针对此问题,提出了一种基于非对称结构的正样本对比学习方法,并将其嵌入到PEARL框架中,构建出改进算法PPEARL-BOY。该算法以在线编码器与目标编码器生成的对应表征构建正样本对,并通过对比损失更新上下文网络,从而提升任务潜变量的判别性与上下文表征能力。针对近距空战中奖励设计难以适应态势变化的问题,提出了自适应奖励权重分配机制,为元策略优化提供关键的奖励引导。该方法基于空战特征构建概率模型,利用贝叶斯推断判定态势,并动态调整角度、距离、速度与高度奖励的权重系数。实验结果表明,PPEARL-BOY算法在策略收敛速度、跨任务泛化性能以及训练稳定性方面,较原始算法均有所提高,充分验证了所提方法的有效性。另一方面,自适应奖励机制在空战任务中提升了策略收敛效率,缩短了训练步长:平均回报在40轮趋于收敛,较原始方法提前约20轮。
关键词:无人机机动决策,近距空战,元强化学习,非对称对比学习,自适应奖励权重分配