《计算机工程与应用杂志》发表论文赏析

大模型辅助的强化学习奖励设计方法研究综述

来源:计算机工程与应用杂志2026年第9期北京时间:

作者:曹育箐, 陈希亮, 董浩洋, 周鑫, 孙鸣蔚

单位:陆军工程大学 指挥控制工程学院,南京 210007;

摘要:奖励设计是强化学习中的核心挑战,传统方法依赖专家手工设计,存在主观性强、难以表达复杂目标、易导致奖励黑客与稀疏奖励等问题。大模型凭借其强大的语义理解、任务分解与代码生成能力,实现了从“人类意图”到“可执行奖励函数”的端到端自动化映射,显著降低了奖励设计门槛,突破了传统方法依赖专家知识、目标表达歧义的瓶颈。系统综述了大模型辅助强化学习奖励设计的研究进展。阐述了强化学习基础框架与奖励设计挑战,剖析大模型辅助的内在机理与价值;梳理传统奖励设计方法局限,构建“奖励初始化器-奖励迭代器”分类框架,并详细阐述了各类方法的代表性工作、机制与适用场景;从“模型-方法-系统”三个层级总结了当前研究在模型可靠性、交互效率与工程安全方面面临的关键挑战,并提出了相应的技术路径。

关键词:强化学习,大模型,奖励设计

基金资助:国家自然科学基金(62273356);国家部委基金。

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!