《图书情报工作杂志》发表论文赏析
作者:朱述承,王伟康,刘颖,刘鹏远
单位:1 中国人民大学图书馆 北京 100872;2 清华大学人文学院 北京 100084;3 上海财经大学信息管理与工程学院 上海 200433;4 北京语言大学信息科学学院 北京 100083;5 北京语言大学国家语言资源监测与研究平面媒体中心 北京 100083
摘要:[目的/意义] 评估中文大语言模型识别文本公平性的能力,构建相应的公平性评估数据集和方法体系,促进大语言模型公平健康发展。[方法/过程] 构建包含10个群体类别、5种语体、3项公平性识别任务的句子级多维度公平性数据集,以评估神经网络语言模型、预训练语言模型和大语言模型共11个语言模型的公平性识别能力,并测试大语言模型在上下文学习后的性能改变情况。[结果/结论] 相较于较为客观的情感识别任务,大语言模型在更为主观的伤害性识别任务上的性能有所下降,特别是考虑到伤害性的可能性时,模型难以仅依靠提示语学习人类赋予的新价值观。在情感和伤害性识别这两个任务上,大语言模型的整体效果不如专门的微调预训练语言模型,并且其公平性识别能力会受到文体类型的影响。然而,经过提示语的上下文学习后,大语言模型的公平性识别能力有所提升。
关键词:大语言模型,公平性,评估,数据集,
基金资助:本文系CCF-百度松果基金项目“大语言模型公平性数据集和评价规范体系的构建”(项目编号:CCF-BAIDU 202323)和国家语言文字工作委员会基金项目“大语言模型语言行为中的偏见测量资源与平台建设”(项目编号:ZDI145-97)研究成果之一。