《计算机应用杂志》发表论文赏析

基于大语言模型和数据增强的通感隐喻分析

来源:计算机应用杂志2025年第3期北京时间:

作者:盛坤, 王中卿

单位:苏州大学 计算机科学与技术学院,江苏 苏州 215006

摘要:中文通感隐喻分析任务是隐喻领域的一个特定细分任务。由于通感语料中感觉词的分布不均匀,中文通感隐喻数据集存在数据稀疏的问题。为解决这一问题,利用真实训练数据中的稀疏感觉词数据作为提示,并使用大语言模型生成额外的合成样本进行数据增强。为避免合成数据的引入造成的额外噪声影响模型性能,构建基于大语言模型的数据增强框架,并采用评分机制和标签误差优化机制减小合成数据和真实数据之间的分布差异。实验结果表明,所提框架可以生成高质量的合成数据来扩充数据集,在感觉词抽取和感觉领域分类任务上的总体F1值达到68.5%,比仅使用真实训练数据的基线模型T5(Text-To-Text Transfer Transformer)提升了2.7个百分点。

关键词:大语言模型,数据增强,通感隐喻,数据稀疏,数据合成

基金资助:国家自然科学基金资助项目(62076175)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!