《图书情报工作杂志》发表论文赏析

基于古籍大模型的无监督互文自动发现研究

来源:图书情报工作杂志2024年第23期北京时间:

作者:叶文豪,胡蝶,王东波,周好,刘浏

单位:南京农业大学信息管理学院 南京 210095

摘要:[目的/意义] 针对先秦典籍这一高度互文的文本,建立一套无监督的互文自动发现流程,探索基于大语言模型来开展古籍内容分析与考据校勘工作,以提高工作效率。[方法/过程] 对比分析现有语言模型的不同技术路线,并引入对比学习框架,采用无监督的方式训练互文自动发现模型,通过构建成语溯源任务检验系列模型效果,选择最优模型。[结果/结论] 成语溯源的结果显示,当前对话大语言模型仍存在大量事实性错误。所构建的基于对比学习框架的古籍大模型ESimCSE- GujiRoBERTa在成语溯源任务中取得最优结果。此模型在先秦诸子典籍引用互文识别上展现优异的语义区分能力。同时,从春秋三传互文识别的结果来看,互文自动发现能够为古籍考据校勘工作提供有益参考。

关键词:古籍互文,语言模型,无监督,对比学习,

基金资助:本文系江苏省社科基金青年项目\"先秦典籍外译知识库构建及应用研究\"(项目编号:23TQC004)、国家自然科学基金管理学部青年项目\"基于深度学习的典籍引书知识图谱构建及应用研究\"(项目编号:72004095)和\"面向科技项目评价的创新知识图谱构建及知识推理研究\"(项目编号:72304142)研究成果之一。

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!