《交通运输系统工程与信息杂志》发表论文赏析
作者:王江锋, 宋之凡, 李云飞, 齐崇楷, 闫学东, 李青山
单位:1. 北京交通大学,交通运输学院,北京100044;2.北京交通大学,唐山研究院,河北唐山063000;3. 西南交通大学,交通运输与物流学院,成都611756;4.中国雄安集团交通有限公司,河北雄安070001
摘要:针对部分新兴城区网约车服务在空间分布上存在“集中供给和稀疏需求”的结构性失衡现象,本文引入激励策略优化网约车调度决策,解决供需分布的空间错配。基于强化学习方法提出一种嵌入激励策略的网约车调度优化算法,包括调度环境构建、可行决策筛选、激励策略嵌入和调度决策优化这4个模块。具体而言,基于Markov决策过程构建涵盖订单匹配、空驶调度和充电管理等任务的调度环境,通过订单抽成下调与优先派单保障机制设计“直接经济刺激”“间接规则优化”相结合的联合激励策略,提出以平台收益最大化为目标的Actor-Critic调度优化算法。以雄安新区为例进行实证分析,结果表明,本文提出的算法能够有效提升“稀疏需求”订单的服务率。在网约车投放规模固定的情况下,分别评估订单抽成下调,优先派单保障以及联合激励策略,结果显示,在平台收益不下降且全局订单服务率有所提升的前提下,“稀疏需求”订单服务率分别提高了24.70%、2.53%和26.09%。随着网约车投放规模增加,当投放数量达120辆时,“稀疏需求”订单服务率和全局订单服务率分别达到61.20%和81.55%。对平台抽成比例与优先派单保障期的敏感性分析进一步表明,当抽成比例设置为24%,保障期设置为4个调度周期时,系统在全局订单服务率与平台收益之间实现了较优平衡。
关键词:城市交通,激励策略,强化学习,网约车,调度算法
基金资助:河北省创新能力提升计划项目(244X0801D);河北省省级科技计划项目(236Z0802G)。