《计算机测量与控制杂志》发表论文赏析
作者:王快,张骞,易元刚
单位:重庆市测绘科学技术研究院
摘要:考虑产品环境感知状态选择对后续行为的影响,提出基于强化学习的知识图谱推荐方法。该方法构建一个强化学习知识推荐框架,结合短期奖励与长期增量评价提出双重奖励驱动机制,用于改进演员-评论家网络的全局推理能力;利用增强损失约束作为信号监督策略梯度更新,形成自监督路径推理策略。通过实验证明:作为改进实体知识推荐实例,所提方法相比基准学习方法具有较高的推荐精度和平均奖励,能够引导策略寻找推荐路径并提供有效解释,为知识推理提供了决策支持。
关键词:强化学习;知识图谱;双重奖励驱动;自监督推理;增强损失约束
基金资助:国家自然科学基金(编号41801274)、重庆市科研机构绩效激励引导专项项目(编号CSTB2023JXJL-YFX0048)