《图书情报工作杂志》发表论文赏析
作者:王彦莹,王昊,朱惠,李晓敏
单位:1 南京大学信息管理学院 南京 210023;2 江苏省数据工程与知识服务重点实验室(南京大学) 南京 210093
摘要:[目的/意义] 针对历史古籍事件识别问题,对比序列标注方法和文本生成方法,探究两种方法在古汉语上的表现,构建模型实现历史古籍事件识别自动化,以提高面向历史古籍构建知识图谱的效率。[方法/过程] 选取《三国志》为原始语料,序列标注实验对《三国志》事件数据集进行 BMES 标注,构建 BBCN-SG 模型,文本生成实验构建 T5-SG 模型,对比两种方法的表现。接下来,构建 RoBERTa-SG、 NEZHA-SG 模型展开生成模型的对比实验。最后,结合三个文本生成模型,融入 Stacking 集成学习的思想,构建 Stacking-TRN-SG 模型。[结果/结论] 在历史古籍事件识别建模问题上,文本生成方法的表现明显优于序列标注方法。而在文本生成方法中, RoBERTaSG 模型的识别效果综合最好。Stacking 集成学习能够大大提高生成模型的识别效果,构建的 Stacking-TRN-SG模型达到 70.35% 的召回率,初步实现历史古籍的自动事件识别。
关键词:历史古籍,事件识别,文本生成,序列标注,集成学习,
基金资助:本文系国家自然科学基金面上项目“关联数据驱动下我国非遗文本的语义解析与人文计算研究”(项目编号: 72074108)和中央高校基本科研项目“面向人文计算的方志文本的语义分析和知识图谱研究”(项目编号: 010814370113)研究成果之一。