《交通运输系统工程与信息杂志》发表论文赏析

进口集装箱堆存决策的两阶段强化学习方法

来源:交通运输系统工程与信息杂志2026年第1期北京时间:

作者:宋丽英, 邓琨琦, 宁武, 宋海涛, 李四维

单位:北京交通大学,a.交通运输学院,b.中国综合交通研究中心,北京100044;2.广西北部湾国际港务集团有限公司,南宁530022;3. 广西钦州保税港区宏港码头有限公司,广西钦州535008

摘要:进口集装箱堆存问题因卸船顺序与提箱顺序的矛盾以及堆场资源约束而呈现高度复杂性。针对这一挑战,本文面向自动化垂直布局堆场,提出一种基于深度强化学习的两阶段堆存决策方法。该方法将堆存过程建模为马尔可夫决策过程,在框架上引入“堆区决策-堆位决策”的分阶段结构,有效降低状态与动作空间的维度,并结合差异化奖励函数,将均衡堆区利用率、翻箱次数和提箱移动距离作为优化目标。算法设计上,第1阶段采用深度Q网络(DQN)实现堆区选择,第2阶段引入对偶深度Q网络(DuelingDQN)提升复杂状态下的堆位选择效率。实验结果表明,该方法能够在全堆场范围内形成均衡的堆存策略:在不同堆场密度和集装箱批量场景下均表现出稳定适应性,平均翻箱率控制在15%~27%,平均移动贝位数最大值为3.84贝·箱-1,分别较实际数据降低约61.5%与38.7%。与单阶段DQN、两阶段近端策略优化(PPO)和启发式算法相比,本文方法在收敛效率、决策效果和鲁棒性方面均具有明显优势。本文不仅验证了分阶段建模与差异化奖励机制在复杂堆存问题中的有效性,还为大规模自动化堆场的调度与资源优化提供了具有推广性的解决方案。

关键词:物流工程,堆存决策,强化学习,进口集装箱,两阶段方法

基金资助:广西科技重大专项-江海联运重点货种运输组织方案关键技术研究(桂科AA23062021-2)。

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!