《计算机技术与发展杂志》发表论文赏析
作者:孙晓晔;成彬;*;王程;
单位:1. 河北省科学院应用数学研究所,河北 石家庄 050081;2. 河北省信息安全认证技术创新中心,河北 石家庄 050081
摘要:为了利用大语言模型不依赖于标注数据、上下文理解和迁移能力强的优势,该文将 LLM 用于公开数据集匮乏的统一方面级情感分析(Unified Aspect-Based Sentiment Analysis,UABSA)任务,提出了一种结合数据筛选和 LLM 指令微调的方法 SLIT,并在多个领域的中英文数据集上进行了实验。 首先,通过对比训练集中样本之间的相似度,筛除相似度高的部分样本数据,得到精简数据集;然后,设计提示模板,用精简数据集构造用于微调的指令数据集;最后,对 ChatGLM3-6B 大模型进行 P-Tuning v2 微调,在测试集上验证效果。 实验结果表明,与使用未经过数据筛选的 ChatGLM3-6B+微调方法相比,SLIT 虽然使用的数据更少,但在 Rest14、Laptop14、扫地机器人 3 个数据集上的 F1 值分别提高了 3. 95 百分点、2. 01 百分点、4. 62 百分点,与其他基准方法相比,在 Rest14 数据集上的效果达到了最佳。
关键词:自然语言处理;方面级情感分析;大语言模型;数据筛选;指令微调