《计算机应用与软件杂志》发表论文赏析
作者:田小禾, 李伟, 许铮, 刘天星, 戚骁亚, 甘中学
摘要:随着深度学习和强化学习研究取得长足的进展, 多Agent强化学习已成为解决大规模复杂序贯决策问题的通用方法。为了推动该领域的发展, 从竞争与合作的视角收集并总结近期相关的研究成果。该文介绍单Agent强化学习; 分别介绍多Agent强化学习的基本理论框架——马尔可夫博弈以及扩展式博弈, 并重点阐述了其在竞争、合作和混合三种场景下经典算法及其近期研究进展; 讨论多Agent强化学习面临的核心挑战——环境的不稳定性, 并通过一个例子对其解决思路进行总结与展望。
关键词:深度学习, 强化学习, 多Agent强化学习, 环境的不稳定性