《计算机工程与应用杂志》发表论文赏析
作者:黄菲, 沈思, 朱丹浩
单位:1.南京理工大学 计算机科学与工程学院,南京 210094;2.南京理工大学 经济管理学院,南京 210094;3.江苏警官学院 刑事科学技术系,南京 210031;
摘要:为解决推理大语言模型训练中缺少高质量难题数据的问题,提出了一种难题数据合成方法。对现有数学数据集进行概念抽取,获得包含数学概念、应用场景和示例的概念实体;基于现有推理大语言模型对随机抽取的概念组进行难题合成,生成具有长推理链形式的解答,建立候选难题数据集;采用基于规则和大语言模型验证的方法,从候选数据集中筛选出正确的难题、长推理链解答及参考答案,得到最终的难题数据集。基于所提出的方法,构建了包含1?000条数据的数据集SD1k。实验结果表明,使用SD1k对Qwen2.5-32B-Instruct模型进行微调,在MATH500、AIME2024和GPQA Diamond数据集上的性能比基准数据集分别提升了3.2、10和8.6个百分点。该方法构建了质量高、难度大的数学问题,在进行长推理链解答时,有效支撑了大语言模型的训练和评测。
关键词:大语言模型,数据合成,推理模型
基金资助:国家自然科学基金面上项目(71974094);国家社会科学基金重点项目(24ATQ009)。