《农业机械学报杂志》发表论文赏析
作者:王耀君,葛明亮,徐国威,张齐豫,别宇辉
单位:中国农业大学,中国农业大学,中国农业大学,中国农业大学,中国农业大学,
摘要:利用基准数据集对模型进行评估,是衡量大语言模型(LLMs)在特定领域能力的重要方法,主要用于评测其知识水平与推理能力。为更好地评估大语言模型在农业领域的能力,本文提出了 Agri-Eval:一个用于评估农业领域大语言模型知识与推理能力的基准。Agri-Eval的评测数据集涵盖农业领域7个主要学科:作物科学、园艺学、植物保护学、畜牧学、林学、水产科学和草业科学,共包含2283道试题。在国内通用大语言模型中,DeepSeek-R1 表现最佳,准确率达 75.49%;在国际通用大模型中,Gemini-2.0-Pro-exp-02-05以74.28% 的准确率位居首位。作为农业垂直领域大模型,神农V2.0(Shennong V2.0) 的综合表现超越了所有国内通用大模型,其在农业知识问答的准确率亦优于所有现有的通用模型。Agri-Eval的发布有助于开发者通过多样化任务与测试,全面评估模型在农业领域的综合能力,从而推动农业领域大语言模型的发展。
关键词:大语言模型;评估体系;农业知识;农业数据集
基金资助:国家重点研发计划项目(2024YFD2000805)