《计算机技术与发展杂志》发表论文赏析
作者:彭云建;梁进
摘要:针对移动智能体在未知环境下的路径规划问题,提出了基于探索-利用权衡优化的 Q 学习路径规划。 对强化学习方法中固有的探索-利用权衡问题,提出了探索贪婪系数?ε 值随学习幕数平滑衰减的 εDBE(ε-decreasing based episodes)方法和根据 Q 表中的状态动作值判断到达状态的陌生 / 熟悉程度、做出探索或利用选择的 AεBS( adaptiveε based state) 方法,这一改进确定了触发探索和触发利用的情况,避免探索过度和利用过度,能加快找到最优路径。 在未知环境下对基于探索-利用权衡优化的 Q 学习路径规划与经典的 Q 学习路径规划进行仿真实验比较,结果表明该方法的智能体在未知障碍环境情况下具有快速学习适应的特性,最优路径步数收敛速度更快,能更高效实现路径规划,验证了该方法的可行性和高效性。
关键词:强化学习;Q 学习;探索-利用;路径规划;未知环境