《图书情报工作杂志》发表论文赏析
作者:陆泉,郝志同,陈静,陈仕,朱安琪
单位:1. 武汉大学信息资源研究中心 武汉 430072;<br />\r\n2. 国土资源部城市土地资源监测与仿真重点实验室 深圳 518034;<br />\r\n3. 华中师范大学信息管理学院 武汉 430079
摘要:[目的/意义] 将从互联网大数据中无监督学习的结果迁移到目标领域,解决目标领域因学习样本有限而信息识别效果难以提升的问题。[方法/过程] 使用以中文维基百科等数据预训练的RoBERTa模型进行迁移学习,将学习结果映射到目标领域后使用DPCNN对其进行聚合凝练,然后结合部分标注数据微调模型完成领域信息的精准识别。[结果/结论] 在10个领域内与未进行迁移学习的模型及经典模型TextCNN对比,提出的模型均较大幅度优于对比模型,平均后的精确率绝对提高4.15%、3.43%,召回率绝对提高4.55%、3.44%,F1分数绝对提高4.52%、3.44%,表明利用网络大数据迁移学习可以显著提升目标领域的信息识别效果。
关键词:迁移学习,信息识别,RoBERTa,
基金资助:本文系国家社会科学基金重点项目"心理账户理论视角下在线健康社区精准信息服务研究"(项目编号:20ATQ008)研究成果之一。