《计算机工程与应用杂志》发表论文赏析
作者:庾源清, 马为之, 张敏
单位:1.清华大学 计算机科学与技术系,北京 100084;2.清华大学 智能产业研究院,北京 100084
摘要:近年来强化学习算法被引入推荐系统以解决探索-利用问题,改善平台上用户体验并提升系统长期效益。现有研究主要从模型层面进行探索策略设计,但大部分工作很少考虑用户体验对探索策略的影响。提出通过修改奖励的方式设计探索策略,充分考虑强化学习在推荐场景下将用户建模为环境的特殊性,将商品多样性和新颖性作为内在奖励,利用用户体验指导模型的探索方向。在两个不同类型的真实数据集上进行实验,实验结果表明所提出方法在推荐性能和推荐商品多样性等各项指标上实现了明显的效果提升,验证了所提出探索策略的有效性。
关键词:推荐系统,强化学习,探索策略