《图书情报工作杂志》发表论文赏析
作者:杜悦,王东波,江川,徐润华,李斌,许超,徐晨飞
单位:1. 南京农业大学信息科学技术学院 南京 210095;<br />\r\n2. 金陵科技学院人文学院 南京 210001;<br />\r\n3. 南京师范大学文学院 南京 210097;<br />\r\n4. 南通大学经济与管理学院 南通 226019
摘要:[目的/意义] 典籍是我国传统文化、思想和智慧的载体,结合数字人文的数据获取、标注和分析方法对典籍进行实体自动识别,对于后续应用研究具有重要意义。[方法/过程] 基于经过自动分词与人工标注的25本先秦典籍构建古籍语料库,分别基于不同规模的语料库和Bi-LSTM、Bi-LSTM-Attention、Bi-LSTM-CRF、Bi-LSTM-CRF-Attention、Bi-RNN和Bi-RNN-CRF、BERT等7种深度学习模型,从中抽取构成历史事件的相应实体并进行效果对比。[结果/结论] 在全部语料上训练得到的Bi-LSTM-Attention与Bi-RNN-CRF模型的准确率分别达到89.79%和89.33%,证实了深度学习应用于大规模文本数据集的可行性。
关键词:数字人文,深度学习,命名实体识别,先秦典籍,
基金资助:本文系国家自然科学基金面上项目"基于典籍引得的句法级汉英平行语料库构建及人文计算研究"(项目编号:71673143)和国家社会科学基金重大项目"基于《汉学引得丛刊》的典籍知识库构建及人文计算研究"(项目编号:15ZDB127)研究成果之一。