《交通运输系统工程与信息杂志》发表论文赏析
作者:翁金贤, 丁海峰, 刘文, 石坤, 倪宝龙
单位:1. 上海海事大学,交通运输学院,上海201306;2.武汉理工大学,航运学院,武汉430063;3. 中华人民共和国黄浦海事局,上海200086)
摘要:针对传统强化学习方法在船舶自主航行决策中存在环境演化建模缺失与决策短视的问题,本文提出一种世界模型(WorldModel,WM)协同强化学习(Reinforcement Learning, RL)的船舶自主航行决策方法。首先,构建RL智能体作为决策主体生成船舶候选动作。其次,基于递归状态空间模型(Recurrent State Space Model, RSSM)构建WM,利用编码器将高维观测映射至潜在空间,结合水动力流场与船舶交互环境进行时序特征提取与环境演化建模。最后,针对传统RL策略的决策短视问题,构建基于群组风险的梯度投影模块,利用WM的前视推演能力对RL候选动作进行安全性校验,通过求解约束优化问题将高风险动作映射至安全可行域,实现对潜在RL高风险决策的动态修正。以上海黄浦江典型感潮河段为例进行闭环实验,结果表明:本文决策方法在多项评估指标上均优于其他模型,相较于传统RL方法,所提方法将高风险群组出现频次由3.2次·航程-1降低至0.8次·航程-1,时间偏差率由8.15%优化至5.56%,且舵角角速度标准差由5.2(°)·s-1降至3.2 (°)·s-1。此外,消融实验表明,相比原方法,引入投影模块后高风险群组出现频次降低52.11%,时间偏差率由6.20%优化至4.32%,舵角角速度与纵向加速度标准差分别从4.21(°)·s-1和0.23 m·s-2降低至2.75 (°)·s-1和0.18 m·s-2。
关键词:水路运输,船舶航行决策,世界模型,船舶,风险评估,航行安全
基金资助:上海市学术带头人(23XD1421500)。