《计算机工程与应用杂志》发表论文赏析
作者:郑国风, 刘纳, 李晨, 杨杰, 道路
单位:1.北方民族大学 计算机科学与工程学院,银川 750021;2.北方民族大学 图像图形智能处理国家民委重点实验室,银川 750021
摘要:在非结构化的医疗文本数据中精准地提取出医疗实体对于推动医学信息化进程具有重要的研究意义。利用小样本场景中的提示学习方法可以弥补预训练和微调阶段存在的差距,提升模型的泛化能力和适应性。然而,现有基于提示学习的命名实体识别研究通常严重依赖于设计的提示模板。人工设计的提示模板稳定性较差,而自动构建的离散提示模板采用固定的词向量,无法理解复杂语义。针对上述挑战,提出了一种离散提示与连续提示相结合的混合提示模板,两者协同帮助语言模型理解医疗文本中的深层次语义信息;设计了融合对比学习的预训练策略,引导模型拉近相关实体与标签词之间的语义距离,以提升模型区分不同实体标签的能力;设计抽象概率转移矩阵,有效缓解了实体在不同语境下语义不一致的问题。经过实验证明,在CCKS2019、IMCS-V2-NER和cMedQANER三个中文医疗命名实体识别数据集中,该方法相比基线模型,F1值均获得有效提升。此外,在中文通用领域命名实体识别数据集CLUENER2020上验证了模型的泛化能力。
关键词:命名实体识别,提示学习,对比学习,小样本学习,预训练语言模型