《计算机应用与软件杂志》发表论文赏析
作者:王敏, 王赞, 李珅, 陈立家, 范贤博俊, 王晨露, 刘名果
摘要:针对深度强化学习算法在三维环境下对机械臂进行全自由度训练时训练周期过长等问题,提出一种面向解空间的机械臂深度强化学习快速训练方法。首先,通过对抓取任务分解,将机械臂横向机与纵向机间的训练解耦,通过降维的方式压缩解空间,在保证动作执行精度的情况下,简化了训练过程;其次对深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)算法进行改进,对同批次样本进行二次价值估计以延迟更新策略网络,辅以优先经验回放,有效提升了DDPG算法的训练效率。实验结果表明所提方法具备训练复杂度低、速度快和成本低的特点,抓取成功率可以达到98%,有利于工业场合的应用推广。
关键词:深度强化学习, 机械臂, 深度确定性策略梯度, 目标抓取, 降维