《计算机工程与应用杂志》发表论文赏析

基于反馈的大语言模型内容与行为对齐方法综述

来源:计算机工程与应用杂志2025年第20期北京时间:

作者:张钰莹, 云静, 刘雪颖, 史晓国

单位:1.内蒙古工业大学 数据科学与应用学院,呼和浩特 010080;2.内蒙古自治区大数据软件服务工程技术研究中心,呼和浩特 010080;3.内蒙古北疆网络空间安全重点实验室,呼和浩特 010080

摘要:近年来,大语言模型在一系列任务中展现了卓越的自然语言理解、生成与推理能力。然而,为了确保其输出符合人类预设标准,对齐成为关键的解决方式。针对“内容对齐”和“行为对齐”两大核心目标,从概念框架、技术实现到评估方法进行了系统综述。明确了获取反馈的来源、格式及其使用目的,建立了基于反馈对齐的概念框架。按照大模型训练、推理和生成的顺序总结了现有的基于反馈对齐的方法。之后回顾了评估大模型的基本技术指标,以及相关的数据集与基准。总结了基于反馈的对齐方法在提升大语言模型性能方面的潜力,以及当前面临的重大挑战和关键问题。

关键词:大语言模型(LLMs),AI对齐,内容安全,评估基准

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!