《图书情报工作杂志》发表论文赏析
作者:韩红旗,张均胜,周则旭,吴光
单位:1 中国科学技术信息研究所 北京 100038;2 富媒体数字出版内容组织与知识服务重点实验室 北京 100038
摘要:[目的/意义] 科学研究从问题开始,问题推动研究、引导研究。由计算机生成新颖的科研问题,有利于激发科研人员的创造性思维和创新灵感,辅助科研人员提出新的科研问题。[方法/过程] 借鉴基于片段预测的词汇约束文本生成方法,提出一个基于大模型的科研问题生成方法,能根据用户输入的关键词生成新的科研问题,其生成过程包括问题句子抽取、训练数据构造、大模型微调、生成文本处理和科研问题选择等5个环节。[结果/结论] 选择通义千问Qwen2-1.5B-Instruct作为基座模型进行实验研究,采用约束关键词比例、文本相似性、文本多样性、文本流利度4项指标评估生成文本的效果,采用人工方法评估生成问题的新颖性,并将生成的问题与论文中新提出的问题进行对比,以说明科研问题生成的价值。实验发现,提出的方法能生成可理解的、新颖的、具有参考价值的科研问题;与Bart模型对比发现,大模型(Qwen2)生成的问题文本能很好地包含约束关键词,且在文本多样性方面表现突出。
关键词:科研问题,文本生成,大模型,LoRA微调,预训练模型,通义千问,
基金资助:本文系国家科技重大专项“高可信科技文献预训练大模型构建与优化”(项目编号:2023ZD0121502)和中国科学技术信息研究所创新基金面上项目“基于文本生成模型的问题创新方案挖掘”(项目编号:MS2024-03)研究成果之一。