《图书情报工作杂志》发表论文赏析
作者:王伟正,乔鸿,李肖俊,王静静
单位:1 山东师范大学图书馆 济南 250358;2 山东师范大学商学院 济南 250358;3 齐鲁工业大学(山东省科学院)数字人文研究中心 济南 250014;4 齐鲁工业大学(山东省科学院)情报研究所 济南 250014;5 山东大学新闻传播学院 济南 250100
摘要:[目的/意义] 探索大语言模型生成与学者撰写论文摘要的差异性,为学术论文的AIGC检测提供参考。[方法/过程] 以情报学领域近三年高被引论文为例,首先使用Prompt根据论文标题生成对应摘要,构建研究数据集;其次,从图灵测试、词汇特征、词性特征、困惑度、主题一致性评测对两类文本的异同进行深入分析,揭示两类文本的差异性;最后,提出一种基于BERT-CNN的分类器对两类摘要文本进行识别。[结果/结论] 当前人工无法较好识别大语言模型生成的论文摘要,其识别的精确率甚至低于随机猜测概率0.5;大语言模型生成的摘要相对较长,使用的词汇量也较多,两类摘要在名词占比上具有较大差异;学者撰写论文摘要拥有更高的困惑度,两类摘要的部分主题分布一致,在关注焦点、研究视角上存在较大差异;BERT-CNN的分类器具有最好的分类效果,超过主流的五种机器学习模型和三种深度学习模型。
关键词:大语言模型,文本特征,文本分类,论文摘要,ChatGPT,
基金资助:本文系国家自然科学基金青年项目“基于多源异构数据的科技关键节点及信息扩散机理研究”(项目编号:72304169)研究成果之一。