《计算机技术与发展杂志》发表论文赏析

基于集成学习的 N6 甲基化位点预测方法研究

来源:计算机技术与发展杂志2021年第03期北京时间:

作者:赵媛媛;陈进祥;李富义;';吴昊;刘全中*

单位:1. 西北农林科技大学 信息工程学院,陕西 杨凌 712100;2. 蒙纳士大学数据科学中心,澳大利亚 墨尔本 VIC 3800;3. 蒙纳士大学生物医学发现研究所和生物化学与分子生物学系,澳大利亚 墨尔本 VIC 3800

摘要:N6-甲基腺嘌呤(N6-methyladenine,6mA)是指腺嘌呤第 6 位氮原子的甲基化修饰。 6mA 在维持细胞正常的转录活性、DNA 损伤修复、染色质重塑、遗传印记、胚胎发育和肿瘤发生等生物过程中起着非常重要的作用。 通过生物实验的方法来鉴定 6mA 位点耗时且昂贵。 近年来,研究界提出了一些基于机器学习的 6mA 位点预测方法,但这些预测方法过度依赖一种学习模型,导致模型的泛化能力不足以及预测的准确度不高等问题。 集成学习综合多种预测模型的优点,具有较好的泛化能力及预测性能。 因此,为了进一步提升 6mA 位点的预测准确性,提出了一种基于 stacking 集成学习的 6mA位点预测模型 Stack6mAPred。 该模型由两层分类器组成,第一层集成了朴素贝叶斯、支持向量机(support vector machine,SVM)和 LightGBM 等三种主流分类器,第二层使用逻辑回归(logistic regression,LR)分类器。 Stack6mAPred 利用增强核苷酸组成等 5 种特征对实验已鉴定 6mA 序列和非 6mA 序列进行编码,使用 XGBoost (extreme gradient boosting)算法进行特征选择,去除冗余特征。 通过在水稻基准数据集上进行五折交叉验证,与目前性能最优的方法 MM-6mAPred 相比,Stack6mAPred 在敏感性、特异性、准确度、MCC 和 AUC 上均获得了更好的性能,分别提高了 1.7%、1.36%、1.72%、0.06 和 0.031。

关键词:6mA 甲基化;stacking 集成学习;XGBoost;LightGBM;支持向量机

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!