《图书情报工作杂志》发表论文赏析
作者:胡蝶,赵文华,王希羽,刘浏
单位:1 中国人民大学信息资源管理学院 北京 100872;2 南京农业大学信息管理学院 南京 210095;3 南京农业大学人文与社会计算研究中心 南京 210095
摘要:[目的/意义] 《二十四史》作为中国古代官修史书的重要汇编,对先秦诸子典籍多有引用,系统梳理和分析其引书情况,有助于揭示诸子思想的继承与演变规律。研究旨在构建字词级别的引书识别框架,实现对史书中先秦诸子引书的细粒度识别与分析,从而为古文研究提供一种可靠的典籍引书识别方法,并为诸子研究开辟新的分析视角。[方法/过程] 首先,选取无监督古汉语检索模型辅助人工标注,建立初步的《二十四史》引先秦诸子典籍语料库;其次,基于标注语料,依托大语言模型检索增强生成框架,构建细粒度引书识别模型,并采用人机协同迭代策略完善引书语料库、优化模型性能;最后,对史书中的先秦诸子引书开展多维度的计量分析。[结果/结论] 当检索器返回相似度最高的前三个句子时,采用Esimcse-GujiRoBERTa_ts作为古汉语文本检索器,并结合指令微调后的internlm2_5-7b-chat作为文本生成器,所构建的引书识别框架对文本是否包含引书的判断能力F1值达到98.59%,文本输出的序列标注能力F1值达到82.65%。后续的计量分析揭示了以《论语》为代表的儒家思想在不同历史时期的重要地位。
关键词:细粒度引书识别,大语言模型,检索增强生成,先秦诸子典籍,二十四史,
基金资助:本文系国家社会科学基金重大项目“先秦诸子典籍知识库建设及词典编纂”(项目编号:22&ZD262)和江苏省社会科学基金一般项目“《二十四史》人物知识图谱构建与应用研究”(项目编号:24TQB004)研究成果之一。