《农业机械学报杂志》发表论文赏析
作者:郝子超,赵向宇,潘守慧,刘东明,王开义
单位:沈阳农业大学;北京市农林科学院,北京市农林科学院,北京市农林科学院;北京派得伟业科技发展有限公司,北京派得伟业科技发展有限公司,北京市农林科学院,
摘要:高通量作物表型采集设备的飞速发展为育种与栽培研究提供了现代化数据采集手段,同时催生了海量多模态、非结构化表型数据。传统结构化数据存储模式已难以满足此类数据的高效存取需求。为此,提出基于分布式技术的混合存取框架,利用HBase和HDFS构建结构化和非结构化融合存储引擎,集成客户端缓存和Redis缓存设计高效检索机制,并对核心问题进行了优化:针对原生HDFS存储表型数据的固有缺陷,设计基于模态聚合的MCH存储框架,通过将表型数据按模态分类合并存储,并使用双层哈希技术构建局部索引,有效降低NameNode内存压力,同时提高单模态数据的访问效率与存储空间利用率。面向高并发数据读取场景,构建基于数据热度的双层缓存机制,通过元数据分层缓存优化热点数据读取效率,创新提出结合访问频率和时间特性的数据热度评估模型,有效提高缓存命中率。试验结果表明:本文提出的分布式存取方法在数据为1.0×105份时,NameNode内存占用量较最佳原生方案(SequenceFile)降低31.2%,检索时间较最佳原生方案(MapFile)降低25.4%,为海量多模态表型数据的存储和检索提供了技术支撑。
关键词:多模态作物表型数据;分布式存取;文件合并;双层缓存机制
基金资助:国家重点研发计划项目(2022YFD2002303-03)和北京市乡村振兴项目(NY2401040425)