《农业机械学报杂志》发表论文赏析

Agri-Eval:农业领域大语言模型多层次评估基准

来源:农业机械学报杂志2026年第1期北京时间:

作者:王耀君,葛明亮,徐国威,张齐豫,别宇辉

单位:中国农业大学,中国农业大学,中国农业大学,中国农业大学,中国农业大学,

摘要:利用基准数据集对模型进行评估,是衡量大语言模型(LLMs)在特定领域能力的重要方法,主要用于评测其知识水平与推理能力。为更好地评估大语言模型在农业领域的能力,本文提出了 Agri-Eval:一个用于评估农业领域大语言模型知识与推理能力的基准。Agri-Eval的评测数据集涵盖农业领域7个主要学科:作物科学、园艺学、植物保护学、畜牧学、林学、水产科学和草业科学,共包含2283道试题。在国内通用大语言模型中,DeepSeek-R1 表现最佳,准确率达 75.49%;在国际通用大模型中,Gemini-2.0-Pro-exp-02-05以74.28% 的准确率位居首位。作为农业垂直领域大模型,神农V2.0(Shennong V2.0) 的综合表现超越了所有国内通用大模型,其在农业知识问答的准确率亦优于所有现有的通用模型。Agri-Eval的发布有助于开发者通过多样化任务与测试,全面评估模型在农业领域的综合能力,从而推动农业领域大语言模型的发展。

关键词:大语言模型;评估体系;农业知识;农业数据集

基金资助:国家重点研发计划项目(2024YFD2000805)

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!