《电子与信息学报杂志》发表论文赏析
作者:林政, 胡海鹰, 邸鹏, 朱永生, 周美江
单位:1.中国科学院微小卫星创新研究院 上海 2013042.中国科学院大学 北京 1000493.合肥国家实验室 合肥 230088
摘要:在考虑地球扁率J2摄动的影响下,该文针对限定携带燃料和限定转移时间下的异面轨道航天器远距离快速转移的最省燃料轨迹优化问题,基于近端策略优化(PPO)设计脉冲机动的时长与脉冲增量大小,实现最省燃料消耗的转移轨迹设计。首先构筑J2摄动下航天器转移变轨的动力学模型,并进行航天器在轨运行中的不确定性分析,其次,将问题转化为最优控制问题,并建立强化学习训练框架;此后,设计基于过程约束和终端约束的合适的奖励函数,提高算法的探索能力和训练过程的稳定性;最后,在该强化学习框架下进行训练得到模型,生成变轨机动策略,通过仿真并进行对比实验验证算法性能。相较已有深度强化学习(DRL)方法,该文设计的改进型密集奖励函数结合位置势函数与速度引导机制,显著提升了算法的收敛速度、鲁棒性与燃料优化性能,仿真结果表明,该方法能够很好地生成策略并达到预期抵近要求。
关键词:航天器交会制导, 轨迹优化, 深度强化学习, 密集奖励函数
基金资助:上海市东方英才领军项目(Y4DFRCYG01)