《图书情报工作杂志》发表论文赏析
作者:夏天,于凯,余芊蓉,彭欣然,赵群,杨孟辉
单位:1 中国人民大学信息资源管理学院 北京 100872;2 蜜度科技股份有限公司 上海 201204
摘要:[目的/意义] 将生成式大语言模型用于古文自动断句与标点任务,解决传统序列标注模型需特殊设计标记并构造标注数据的局限,帮助提升断句与标点的效果。[方法/过程] 采用滑动窗口策略对训练数据进行分块以增加可学习样本数量,利用最小哈希和局部敏感哈希为无标点文本提供参考样例,并对大语言模型的解码过程进行约束控制。以荀子古籍大语言模型作为基座模型并运用低秩适应LoRA方式进行微调,让模型理解和对齐古文标点任务,由无标点文本生成含有标点字符的目标文本。[结果/结论] 在EvaHan 2024公布的两个可对比测试集上,自动断句F1指标分别为88.47%和92.48%,自动标点F1指标分别为75.29%和80.01%,显著优于荀子大语言模型和ChatGPT 3.5,表明生成式大语言模型是解决古文断句和标点任务的可行途径。
关键词:自动断句,自动标点,古籍,数字人文,大语言模型,
基金资助:本文系国家社会科学基金项目“基于图书全内容的知识发现与智能服务研究”(项目编号:22BTQ068)的研究成果之一。