《计算机应用研究杂志》发表论文赏析
作者:贺亮,徐正国,贾愚,沈超,李赟,
单位:1.盲信号处理重点实验室,成都610041;2.西安交通大学智能网络与网络安全教育部重点实验室,西安710049;
摘要:针对航迹探测领域中探测器获得的目标地理位置通常是同一帧下无法区分的多目标场景,需要利用目标位置信息还原各航迹并区分各目标的问题进行研究,提出采用深度强化学习复原目标航迹的方法。依据目标航迹的物理特点,提取数学模型,结合目标航迹的方向、曲率等提出轨迹曲率圆(TOC)奖励函数,使深度强化学习能够有效复原多目标航迹并区分各目标。首先描述多目标航迹复原问题,并将问题建模成深度强化学习能够处理的模型;结合TOC奖励函数对多目标航迹复原问题进行实验;最后给出该奖励函数的数学推导和物理解释。实验结果表明,TOC奖励函数驱动下的深度强化网络能够有效还原目标的航迹,在航向和航速方面切合实际目标航迹。
关键词:深度强化学习,序贯决策,Q函数,轨迹密切圆,
基金资助:国家自然科学基金重点项目(U1736205);国家自然科学基金资助项目(61773310);;